Kimi K3 Architecture Overview and Notes
Kimi K3 — крупнейшая на данный момент открытая модель с 2,8 трлн параметров — представляет собой масштабированную версию Kimi Linear, но с рядом инноваций для повышения эффективности. Ключевое нововведение — LatentMoE, сокращающий размер линейных слоёв через понижение размерности, аналогично Multi-Head Latent Attention и Kimi Delta Attention. Эти изменения позволяют сохранить мощность модели при снижении вычислительных затрат на инференс. Также модель отказывается от RoPE в пользу NoPE во всех слоях — первый случай такого подхода на фронтальном уровне.
Одним из немногих не-efficiency-ориентированных изменений стали attention residuals: они соединяют остаточные пути между слоями с помощью весов, вычисляемых через внимание, что улучшает метрики на валидации и downstream-задачах за небольшой прирост в 4% обучающей и 2% инференсной нагрузки. Дополнительно модель получила нативную поддержку мультимодальности. Все эти улучшения — часть тренда, общего с Nemotron 3 и DeepSeek V4, где акцент смещается на архитектурные оптимизации, а не просто рост размера.