Hacker News Digest

Тег: #language-model

Постов: 4

Hy4 preview (tencent.com) 🔥 Горячее 💬 Длинная дискуссия

Tencent открыла исходный код модели Hy4 preview — крупномасштабной языковой модели с 770 млрд общего и 49 млрд активных параметров, поддерживающей контекстное окно свыше 1 млн токенов. Модель позиционируется как решение для реальных задач продуктивности: программирования, офисной работы и научных исследований. Она доступна через открытый исходный код, а также интегрирована в продукты Tencent — WorkBuddy, CodeBuddy, Yuanbao и ima — с возможностью бесплатного использования в течение двух недель после запуска. Доступ через API предоставляется via Tencent Cloud TokenHub и OpenRouter по цене $0.834 за млн входных токенов, $2.501 за млн выходных и $0.042 за кэш-хит.

В внутреннем слепом тестировании с участием 163 экспертов и 203 инженерных задач Hy4 preview набрала средний балл 2.99 из 4.00, опередив GLM-5.3 (2.92) и Kimi K3 (2.94). Модель показала сильные результаты в понимании длинного контекста, планировании, отладке и валидации кода, а также в генерации интерфейсов высокого качества. В офисных сценариях она улучшила анализ сложных рабочих процессов, финансовую аналитику и кросс-документную работу. В геймдеве способна создавать играбельные прототипы из одного естественно-языкового запроса и взаимодействовать с игровыми движками. В научных исследованиях продемонстрировала улучшенные способности в ИИ-разработке, молекулярной динамике, физике конденсированного состояния и фундаментальной математике. Notably, Hy4 preview участвовала в собственном развитии: предлагала оптимизации методов обучения, данных и оценки, проводила эксперименты и внедряла улучшения в инференс — включая фьюжн операторов и коммуникационную оптимизацию — что повысило сквозную пропускную способность на 31.8%. Это подтверждает наличие раннего рекурсивного цикла самосовершенствования. Следующие модели серии Hy4 ожидаются в ближайшее время.

by shenli3514 • 29 августа 2026 г. в 19:33 • 323 points

ОригиналHN

#code-generation#gaming#hy4#language-model#machine-learning#openrouter#scientific-research#tencent#tencent-cloud#tokenhub

Комментарии (195)

Обсуждение дополняет статью практическим опытом и оговорками. **Трафик и стоимость.** По наблюдению @minimaxir, Hy4 за пару дней на OpenRouter обработала больше токенов, чем GLM 5.3 за неделю. @martinald связывает это с тем, что cache read стоит 5%, тогда как у большинства конкурентов 10–20%; @martinald и @joegibbs считают это главной скрытой статьёй расходов и видят возможность для провайдеров заметно снизить цену. **Качество инференса и доступ.** По опыту @vcryan и @XCSme, провайдеры страдают от rate-limit/timeout и медленного инференса даже у самой Tencent. @bobby_coder_55 отмечает, что codebuddy недоступен из США, поэтому лучше пробовать через OpenRouter/Opencode. **Кодинг и агенты.** По опыту @jorl17 и @alexfortin, Hy3 близок к DeepSeek в агентных задачах, а бесплатная версия через Opencode Go приятно удивила в кодинге; @joshheitzman, напротив, через novita.ai не смог получить полезного результата как coding agent. **Графики в анонсе.** @fastball, @usernomdeguerre и @yipinwong критикуют их (сортировка не по рангу, подсветка всей строки) как намеренно вводящие в заблуждение; @vatsachak и @tyre, наоборот, хвалят финальное качество и направление развития. **Маркетинг и необходимость.** @cyanydeez, @joegibbs и @judge2020 подозревают, что Tencent продвигает модель через свои продукты и, возможно, оплачивает трафик; @Zigurd и @pianopatrick сомневаются, нужны ли «следующие» frontier-модели большинству задач. **«Open weights» ≠ open source.** @petcat и @andsoitis настаивают, что релизы — непрозрачные бинарные блобы без кода обучения/инференса; часть пользователей по опыту с Hy3 опасается медленной скорости. **Прочее.** @codethief и @try-working иронизируют над заявлением о рекурсивном самосовершенствовании модели, сравнивая с предсказаниями ai-2027 и с «Windows 95, участвовавшей в своей разработке». @jamienk и @nbush обсуждают риск «newspeak» при оптимизации словаря: более плотная токенизация снижает тонкость смысла, хотя @dnautics и @vatsachak считают, что многословие в верхних слоях скорее помогает рассуждению.

GPT-5.6 Sol Pricing Cut by 50% (openrouter.ai) 🔥 Горячее 💬 Длинная дискуссия

GPT-5.6 Sol — флагманская модель OpenAI из серии GPT-5.6, ориентированная на сложное рассуждение, программирование и агентные сценарии. Особенно эффективна в цепочках команд, длительных задачах и работе с командной строкой. В рамках ограниченного предложения сейчас доступна со скидкой 50 % — ввод $2,50, вывод $15 за миллион токенов, контекст до 1 млн токенов, актуальна с 9 июля 2026 года, база знаний обновлена до февраля 2026 года.

Модель размещается на нескольких провайдерах, а OpenRouter автоматически выбирает оптимальный вариант: Balanced — сочетание цены и скорости, Nitro — максимум быстродействия, Exacto — высокая точность вызова инструментов. Средняя фактическая стоимость составляет $0,87 ввода и $20,58 вывода за миллион токенов благодаря кэшированию и скидкам. В сравнении с другими провайдерами OpenAI предлагает лучшую комбинацию точности (GPQA Diamond ≈ 91 %) и скорости (латентность ≈ 3,6 с), при этом сохраняет высокую доступность 99,17 %. Эти цифры делают GPT-5.6 Sol привлекательным выбором для разработчиков, нуждающихся в надёжном и экономичном решении для сложных задач.

by Topfi • 17 августа 2026 г. в 21:03 • 522 points

ОригиналHN

#gpt-5.6#language-model#llm#openai#openrouter#pricing

Комментарии (338)

Скидка 50% на GPT-5.6 Sol доступна только через OpenRouter (вероятно, через Flex-тариф), не в официальной документации OpenAI. Пользователи отмечают, что Sol переусложняет простые задачи (например, превращая список дел в эссе), работает медленнее (32 токена/сек) и проигрывает предшественникам в скорости, но эффективен в сложных агентных сценариях. Конкуренция со стороны Kimi K3 и DeepSeek v4 Flash вынуждает снижать цены — Kimi K3 конкурирует с Sol по качеству при меньшей цене, DeepSeek вытесняет Gemini. Подписки Pro/Plus остаются выгоднее API даже со скидкой. Некоторые считают Sol регрессией, другие — прогрессом в коде и рассуждениях. Промпты для Claude не работают на Sol из-за различий в логике. Первоначальная цена Sol, вероятно, имела высокую маржу, позволяющую снизить цену вдвое. Скидка недоступна при включённом ZDR на OpenRouter. Действие OpenRouter связано с приобретением Stripe.

Gemini 3.7 Flash (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Гемини 3.7 Flash — новое поколение «рабочей лошадки» от Google, созданное для сложного программирования и агентных сценариев. За три недели после релиза 3.6 Flash компания представила модель с существенно улучшенным пониманием кода, точностью генерации и способностью работать с длинными цепочками задач. На тестах FrontierCode 1.1 точность выросла с 34,4 % до 43,6 %, а в DeepSWE v1.1 — с 49,0 % до 65,3 %. В веб‑разработке 3.7 Flash генерирует полноценные приложения и UI‑компоненты из меньшего числа промптов, а на Arena.ai WebDev Arena набрал Elo 1588 против 1538 у предшественника.

Особенно заметны рост точности в обработке тяжёлых документов: на бенчмарке GDP.pdf показатель вырос с 22 % до 34 %, а в AutomationBench — с 17 % до 30,4 %. Стоимость остаётся вдвое ниже, чем у 3.6 Flash (0,75 $/млн входных и 3,75 $/млн выходных токенов), а новая версия лучше адаптируется к подводным камням, уточняет намерения пользователя и требует меньше ручного контроля. Теперь разработчики могут использовать её в Google AI Studio, Android Studio и через Gemini Enterprise, а обычные пользователи — в Spark внутри приложения Gemini.

by thisisauserid • 13 августа 2026 г. в 17:23 • 906 points

ОригиналHN

#android-studio#gemini#gemini-3.7-flash#gemini-enterprise#google#google-ai-studio#language-model#llm#spark

Комментарии (453)

Gemini 3.7 Flash лидирует по скорости и низкой задержке, что критично для интерактивных сценариев (например, Google AI Mode), но страдает от сложного парсинга «мыслей», академичного стиля ответов и неконкурентоспособной долгосрочной цены — после 2026 года тариф удваивается, при этом модель к тому времени устареет. Пользователи отмечают: - Модель лучше подходит для агентных задач и быстрых итераций, но слаба в сложном кодинге и рефакторинге — уступает GPT-5.6 Luna, DeepSeek и Opus. - Вывод требует значительной очистки от внутренних монологов, усложняя интеграцию. - Стиль ответов стал менее интуитивным, вероятно, из-за RLVR-тренировок. - Галлюцинации и ложные утверждения сохраняются в серии Flash (3.1–3.7), снижая доверие по сравнению с Claude или Sol. - Генерация SVG сломана в Firefox и Chrome из-за невалидных фильтров — проблема кросс-браузерной совместимости. - В image-to-html уступает Opus 5, но сопоставима с Grok 4.6. - Интеграция в Android-ассистента ухудшила UX: модель галлюцинирует инструкции и отказывается выполнять простые команды. - Google Cloud: запутанная номенклатура (Gemini, Anti-gravity, Vertex) и сложная регистрация CLI-инструментов отталкивают разработчиков. - Для специфических задач (анализ рынков на Rust) Stepfun AI Step-3.5-Flash дешевле и эффективнее. - AA-метрика выросла за счёт увеличения токенов вывода, а не качества — экономика использования изменилась. - Качество ответов («vibes») остаётся важнее бенчмарков: пользователи предпочитают Claude за стиль, несмотря на цифры. Споры о целесообразности: одни считают 3.7 Flash избыточным на фоне более дешёвых и быстрых альтернатив, другие — востребованным для быстрых задач, где превосходит Sonnet 5 и Opus.

Advancing the price-performance frontier with GPT‑5.6 (openai.com) 🔥 Горячее 💬 Длинная дискуссия

OpenAI представила GPT-5.6 — модель, значительно улучшившую соотношение цены и производительности. GPT-5.6 Luna, самый быстрый и дешёвый вариант, стал на 80% доступнее, а Terra — на 20%. Это позволяет бизнесам масштабно использовать ИИ для сложных задач: многопроцессные рабочие потоки, интеграция с инструментами и высококачественный анализ данных при минимальных затратах. При этом Sol, наиболее мощная версия, работает быстрее в API, ускоряя время отклика для критически важных приложений.

Эти изменения основаны на внутренней оптимизации архитектуры: каждый слой модели стал эффективнее, что позволило снизить стоимость вычислений без потери качества. OpenAI подчёркивает, что доступность передовых моделей — ключевой элемент её миссии по обеспечению выгод от AGI для всех. Снижение цен отражено и в подписках Codex и ChatGPT Work, что делает ИИ-инструменты более доступными для команд и разработчиков. Теперь даже малые компании могут внедрять сложные ИИ-решения без значительных инвестиций.

by tedsanders • 30 июля 2026 г. в 17:15 • 422 points

ОригиналHN

#agi#api#chatgpt-work#cloud-computing#codex#cost-optimization#gpt-5.6#language-model#llm#openai

Комментарии (276)

Пользователи делятся опытом эксплуатации GPT-5.6 Luna, отмечая её высокую скорость, конкурентоспособную производительность и лучшее соотношение цены и качества по сравнению с более дорогими моделями. Снижение цены на GPT-5.6 Luna воспринимается как значимое событие, способное увеличить спрос и расширить доступность для бизнеса и частных лиц. Рекомендуется использовать её как основную модель или в комбинации с другими для оптимизации затрат. Однако некоторые выражают сомнения: снижение цены может повысить нагрузку на инфраструктуру и увеличить затраты на поддержку.