Hacker News Digest

Тег: #kimi-k3

Постов: 3

Kimi K3 Architecture Overview and Notes (sebastianraschka.com) 🔥 Горячее

Kimi K3 — крупнейшая на данный момент открытая модель с 2,8 трлн параметров — представляет собой масштабированную версию Kimi Linear, но с рядом инноваций для повышения эффективности. Ключевое нововведение — LatentMoE, сокращающий размер линейных слоёв через понижение размерности, аналогично Multi-Head Latent Attention и Kimi Delta Attention. Эти изменения позволяют сохранить мощность модели при снижении вычислительных затрат на инференс. Также модель отказывается от RoPE в пользу NoPE во всех слоях — первый случай такого подхода на фронтальном уровне.

Одним из немногих не-efficiency-ориентированных изменений стали attention residuals: они соединяют остаточные пути между слоями с помощью весов, вычисляемых через внимание, что улучшает метрики на валидации и downstream-задачах за небольшой прирост в 4% обучающей и 2% инференсной нагрузки. Дополнительно модель получила нативную поддержку мультимодальности. Все эти улучшения — часть тренда, общего с Nemotron 3 и DeepSeek V4, где акцент смещается на архитектурные оптимизации, а не просто рост размера.

by ModelForge • 28 июля 2026 г. в 15:48 • 408 points

ОригиналHN

#attention-residuals#deepseek-v4#kimi-k3#latentmoe#multimodality#nemotron-3#nope#rope

Комментарии (72)

Kimi K3 — мощная модель с архитектурными решениями LatentMoE и NoPE, эффективно решающая сложные задачи. Сравнивается с Opus и Fable, демонстрируя высокую производительность. Ведётся дискуссия о том, является ли она результатом дистилляции или оригинальной архитектурой, что влияет на воспроизводимость и открытость. Существуют споры о её стоимости относительно Opus 5 и Sol. Эксперты советуют использовать её с осторожностью из-за риска переобучения и необходимости тщательной настройки гиперпараметров.

Nvidia, Microsoft, Meta warn against overregulating open-weight models (cnbc.com) 🔥 Горячее 💬 Длинная дискуссия

Крупнейшие технологические компании, включая Nvidia, Microsoft, Meta, Palantir и более двадцати партнёров, опубликовали совместное письмо, в котором настоятельно просят избегать преждевременных ограничений на открытые модели ИИ, чтобы не подавлять конкуренцию и не вытеснять развитие за пределы США. Они подчёркивают, что такие модели можно скачивать, модифицировать и запускать на собственной инфраструктуре, что ставит под угрозу закрытые системы, например OpenAI и Anthropic, особенно на фоне роста китайского Kimi K3, который превосходит их по некоторым бенчмаркам. Jensen Huang и Satya Nadella разместили письмо в своих соцсетях, а Элон Мэкск выразил поддержку.

В письме также говорится, что полагаться только на закрытые модели не гарантирует безопасность: они могут быть взломаны, использованы в чужих целях или дать сбой, что трудно отследить извне, тогда как открытая экосистема распределивает риск. Компании предлагают решать вопросы незаконного дистилляции через целенаправленные правовые механизмы, а не через всеобъемлющие запреты на методы, важные для инноваций. Они заявляют, что лидерство в ИИ будет определяться не модели, а способностью США создать открытый рынок, где каждый сектор получит доступ к технологиям, способствуя росту и процветанию.

by louiereederson • 24 июля 2026 г. в 13:32 • 400 points

ОригиналHN

#anthropic#elon-musk#jensen-huang#kimi-k3#meta#microsoft#nvidia#openai#palantir#satya-nadella

Комментарии (199)

Участники обсуждения считают, что компании — Nvidia, Microsoft, Meta — поддерживают открытые модели ИИ, чтобы конкурировать с лидерами рынка, такими как OpenAI и Anthropic. Спорят о искренности этих мотивов. Предлагают инвестировать в открытые модели для усиления позиций. Предупреждают, что регулирование открытых моделей может снизить конкуренцию и вытеснить разработку за пределы США. Также обсуждаются риски: кража интеллектуальной собственности и снижение затрат на разработку.

Kimi K3, and what we can still learn from the pelican benchmark (simonwillison.net)

Kimi K3 — модель с 2,8 триллиона параметров от китайской лаборатории Moonshot AI — заявлено как первый «открытый» модельный класс на уровне 3 триллионов, обойдя DeepSeek-V4-Pro. Она демонстрирует превосходство над Claude Opus 4.8 и GPT-5.5 в большинстве бенчмарков, уступая лишь Claude Fable 5 и GPT-5.6 Sol. Особенность — цена: $3 за миллион входных и $15 за миллион выходных токенов, что делает её самой дорогой среди китайских моделей. При этом она использует на 21% меньше токенов вывода, чем её предшественник K2.6, и лидирует в генерации фронтенд-кода на Arena.ai.

Тест с генерацией SVG-изображения пеликана на велосипеде выявил неожиданные детали: модель тратит 13 241 токен на «размышления» при выводе всего 3 417 токенов ответа, что делает задачу дорогой — 25 центов за один запрос. Входной промпт из 95 токенов странно велик — возможно, скрытый системный промпт добавляет 85 токенов. Визуальное понимание работает отлично: при описании изображения модель точно передаёт детали — цвета, позы, фон. Хотя «пеликан» уже не коррелирует с общей мощностью моделей, он остаётся полезным «приветствием»: проверяет генерацию SVG, оценку стоимости, пространственное понимание и даёт наглядный пример для сравнения версий.

by droidjj • 17 июля 2026 г. в 14:21 • 221 points

ОригиналHN

#benchmark#claude-opus#frontend#kimi-k3#llm#moonshot-ai#pelican#svg

Комментарии (124)

При оценке моделей ИИ важно учитывать не только количество параметров, но и механизм внимания, экономическую эффективность и практическую применимость. Например, Kimi K3 демонстрирует доступную стоимость — $3 за миллион входных и $15 за миллион выходных токенов — и при этом превосходит более дорогие модели, такие как GLM, на бенчмарках, несмотря на меньшее число параметров. Китайские лаборатории могут использовать вычислительные ресурсы через соседние страны, что способствует разработке крупных моделей. Разработка открытых моделей затруднена из-за высоких требований к ресурсам. Модели могут переобучаться на специфических данных, снижая обобщаемость, и их производительность зависит от данных обучения. Эффективным инструментом оценки генерации изображений является бенчмарк с пеликаном на велосипеде. Необходимо развивать новые методы оценки, учитывающие качество, скорость и стоимость.