Hacker News Digest

28 июля 2026 г. в 15:48 • sebastianraschka.com • ⭐ 408 • 💬 72

OriginalHN

#attention-residuals#deepseek-v4#kimi-k3#latentmoe#multimodality#nemotron-3#nope#rope

Kimi K3 Architecture Overview and Notes

Kimi K3 — крупнейшая на данный момент открытая модель с 2,8 трлн параметров — представляет собой масштабированную версию Kimi Linear, но с рядом инноваций для повышения эффективности. Ключевое нововведение — LatentMoE, сокращающий размер линейных слоёв через понижение размерности, аналогично Multi-Head Latent Attention и Kimi Delta Attention. Эти изменения позволяют сохранить мощность модели при снижении вычислительных затрат на инференс. Также модель отказывается от RoPE в пользу NoPE во всех слоях — первый случай такого подхода на фронтальном уровне.

Одним из немногих не-efficiency-ориентированных изменений стали attention residuals: они соединяют остаточные пути между слоями с помощью весов, вычисляемых через внимание, что улучшает метрики на валидации и downstream-задачах за небольшой прирост в 4% обучающей и 2% инференсной нагрузки. Дополнительно модель получила нативную поддержку мультимодальности. Все эти улучшения — часть тренда, общего с Nemotron 3 и DeepSeek V4, где акцент смещается на архитектурные оптимизации, а не просто рост размера.