Hacker News Digest

17 июля 2026 г. в 14:21 • simonwillison.net • ⭐ 221 • 💬 124

OriginalHN

#benchmark#claude-opus#frontend#kimi-k3#llm#moonshot-ai#pelican#svg

Kimi K3, and what we can still learn from the pelican benchmark

Kimi K3 — модель с 2,8 триллиона параметров от китайской лаборатории Moonshot AI — заявлено как первый «открытый» модельный класс на уровне 3 триллионов, обойдя DeepSeek-V4-Pro. Она демонстрирует превосходство над Claude Opus 4.8 и GPT-5.5 в большинстве бенчмарков, уступая лишь Claude Fable 5 и GPT-5.6 Sol. Особенность — цена: $3 за миллион входных и $15 за миллион выходных токенов, что делает её самой дорогой среди китайских моделей. При этом она использует на 21% меньше токенов вывода, чем её предшественник K2.6, и лидирует в генерации фронтенд-кода на Arena.ai.

Тест с генерацией SVG-изображения пеликана на велосипеде выявил неожиданные детали: модель тратит 13 241 токен на «размышления» при выводе всего 3 417 токенов ответа, что делает задачу дорогой — 25 центов за один запрос. Входной промпт из 95 токенов странно велик — возможно, скрытый системный промпт добавляет 85 токенов. Визуальное понимание работает отлично: при описании изображения модель точно передаёт детали — цвета, позы, фон. Хотя «пеликан» уже не коррелирует с общей мощностью моделей, он остаётся полезным «приветствием»: проверяет генерацию SVG, оценку стоимости, пространственное понимание и даёт наглядный пример для сравнения версий.