Hy4 preview 🔥 Горячее 💬 Длинная дискуссия
Tencent открыла исходный код модели Hy4 preview — крупномасштабной языковой модели с 770 млрд общего и 49 млрд активных параметров, поддерживающей контекстное окно свыше 1 млн токенов. Модель позиционируется как решение для реальных задач продуктивности: программирования, офисной работы и научных исследований. Она доступна через открытый исходный код, а также интегрирована в продукты Tencent — WorkBuddy, CodeBuddy, Yuanbao и ima — с возможностью бесплатного использования в течение двух недель после запуска. Доступ через API предоставляется via Tencent Cloud TokenHub и OpenRouter по цене $0.834 за млн входных токенов, $2.501 за млн выходных и $0.042 за кэш-хит.
В внутреннем слепом тестировании с участием 163 экспертов и 203 инженерных задач Hy4 preview набрала средний балл 2.99 из 4.00, опередив GLM-5.3 (2.92) и Kimi K3 (2.94). Модель показала сильные результаты в понимании длинного контекста, планировании, отладке и валидации кода, а также в генерации интерфейсов высокого качества. В офисных сценариях она улучшила анализ сложных рабочих процессов, финансовую аналитику и кросс-документную работу. В геймдеве способна создавать играбельные прототипы из одного естественно-языкового запроса и взаимодействовать с игровыми движками. В научных исследованиях продемонстрировала улучшенные способности в ИИ-разработке, молекулярной динамике, физике конденсированного состояния и фундаментальной математике. Notably, Hy4 preview участвовала в собственном развитии: предлагала оптимизации методов обучения, данных и оценки, проводила эксперименты и внедряла улучшения в инференс — включая фьюжн операторов и коммуникационную оптимизацию — что повысило сквозную пропускную способность на 31.8%. Это подтверждает наличие раннего рекурсивного цикла самосовершенствования. Следующие модели серии Hy4 ожидаются в ближайшее время.
Комментарии (195)
Обсуждение дополняет статью практическим опытом и оговорками. **Трафик и стоимость.** По наблюдению @minimaxir, Hy4 за пару дней на OpenRouter обработала больше токенов, чем GLM 5.3 за неделю. @martinald связывает это с тем, что cache read стоит 5%, тогда как у большинства конкурентов 10–20%; @martinald и @joegibbs считают это главной скрытой статьёй расходов и видят возможность для провайдеров заметно снизить цену. **Качество инференса и доступ.** По опыту @vcryan и @XCSme, провайдеры страдают от rate-limit/timeout и медленного инференса даже у самой Tencent. @bobby_coder_55 отмечает, что codebuddy недоступен из США, поэтому лучше пробовать через OpenRouter/Opencode. **Кодинг и агенты.** По опыту @jorl17 и @alexfortin, Hy3 близок к DeepSeek в агентных задачах, а бесплатная версия через Opencode Go приятно удивила в кодинге; @joshheitzman, напротив, через novita.ai не смог получить полезного результата как coding agent. **Графики в анонсе.** @fastball, @usernomdeguerre и @yipinwong критикуют их (сортировка не по рангу, подсветка всей строки) как намеренно вводящие в заблуждение; @vatsachak и @tyre, наоборот, хвалят финальное качество и направление развития. **Маркетинг и необходимость.** @cyanydeez, @joegibbs и @judge2020 подозревают, что Tencent продвигает модель через свои продукты и, возможно, оплачивает трафик; @Zigurd и @pianopatrick сомневаются, нужны ли «следующие» frontier-модели большинству задач. **«Open weights» ≠ open source.** @petcat и @andsoitis настаивают, что релизы — непрозрачные бинарные блобы без кода обучения/инференса; часть пользователей по опыту с Hy3 опасается медленной скорости. **Прочее.** @codethief и @try-working иронизируют над заявлением о рекурсивном самосовершенствовании модели, сравнивая с предсказаниями ai-2027 и с «Windows 95, участвовавшей в своей разработке». @jamienk и @nbush обсуждают риск «newspeak» при оптимизации словаря: более плотная токенизация снижает тонкость смысла, хотя @dnautics и @vatsachak считают, что многословие в верхних слоях скорее помогает рассуждению.
OpenRouter is joining Stripe 🔥 Горячее 💬 Длинная дискуссия
OpenRouter объединяется с Stripe, чтобы стать ключевым игроком в глобальном росте ВВП, используя AI как движущую силу. Платформа уже обслуживает 10+ триллионов токенов в день от 400+ моделей для 10 млн разработчиков, демонстрируя ежегодный рост в 10 раз. Главная цель — сохранить независимость в выборе моделей, обеспечить открытые данные о их использовании и сохранить агрессивную скорость развития, не подчиняясь корпоративным интересам.
Ключевой факт: маршрутизация решений будет оставаться приоритетом пользователя, а не акционеров. Команда подчеркивает, что ценности — любопытство, строгость и прозрачность — важнее любой модели. Stripe выбран как партнер, потому что его инфраструктура и миссия совпадают с открытой экосистемой OpenRouter, что позволит масштабировать доступ к AI без потери гибкости. Транзакция завершится в ближайшие недели, но сервисы продолжат работать без изменений.
Комментарии (460)
OpenRouter ценен не как простой роутер, а как масштабируемая инфраструктура для управления многомодельными API, наблюдаемостью и унифицированным биллингом — что делает его идеальной основой для Stripe как платформы финансирования AI-агентов. Он позволяет разработчикам тестировать и переключать модели в продакшене без собственных оберток, снижая технический долг и упрощая DevEx. Функция broadcast направляет трейсы в ClickHouse, S3 или Snowflake, обеспечивая полный контроль над observability без проприетарных панелей. OpenRouter создает конкуренцию между провайдерами по цене и качеству, а не по вендор-локину, выгодно и разработчикам, и провайдерам. Он стал доверенным брендом благодаря репутации, масштабу (10+ трлн токенов/день) и надежности на сторонней инфраструктуре. Упрощает учет: автоматически атрибутирует затраты, исключая необходимость в 20 разных аккаунтах — ключевая фича для экспериментов и прототипирования. Fallback-логика избавляет от необходимости писать собственные retry-механизмы. Stripe логично выигрывает от владения OpenRouter — это дает контроль над денежными потоками в экосистеме, где вычисления становятся валютой, как ADP для AI-труда. Споры: - Некоторые считают, что OpenAI и Anthropic не должны предоставлять доступ к моделям через OpenRouter — это снижает контроль над ценообразованием и данными. - Критики утверждают, что консолидация (Stripe → OpenRouter) вредит пользователям, угрожая открытости и скорости инноваций. - Некоторые оспаривают оценку в $7–8 млрд, называя OpenRouter просто прокси, который можно построить за миллионы. - Критики указывают, что слово «Open» в названии вводит в заблуждение — сервис не является открытым протоколом, в отличие от Open Banking. Советы: - Для приватности рекомендуется TrustedRouter.com — альтернатива с акцентом на децентрализацию. - Опытные пользователи советуют настраивать роутинг не только по цене, но и с минимальными порогами производительности, чтобы избежать неоптимального выбора по умолчанию.
GPT-5.6 Sol Pricing Cut by 50% 🔥 Горячее 💬 Длинная дискуссия
GPT-5.6 Sol — флагманская модель OpenAI из серии GPT-5.6, ориентированная на сложное рассуждение, программирование и агентные сценарии. Особенно эффективна в цепочках команд, длительных задачах и работе с командной строкой. В рамках ограниченного предложения сейчас доступна со скидкой 50 % — ввод $2,50, вывод $15 за миллион токенов, контекст до 1 млн токенов, актуальна с 9 июля 2026 года, база знаний обновлена до февраля 2026 года.
Модель размещается на нескольких провайдерах, а OpenRouter автоматически выбирает оптимальный вариант: Balanced — сочетание цены и скорости, Nitro — максимум быстродействия, Exacto — высокая точность вызова инструментов. Средняя фактическая стоимость составляет $0,87 ввода и $20,58 вывода за миллион токенов благодаря кэшированию и скидкам. В сравнении с другими провайдерами OpenAI предлагает лучшую комбинацию точности (GPQA Diamond ≈ 91 %) и скорости (латентность ≈ 3,6 с), при этом сохраняет высокую доступность 99,17 %. Эти цифры делают GPT-5.6 Sol привлекательным выбором для разработчиков, нуждающихся в надёжном и экономичном решении для сложных задач.
Комментарии (338)
Скидка 50% на GPT-5.6 Sol доступна только через OpenRouter (вероятно, через Flex-тариф), не в официальной документации OpenAI. Пользователи отмечают, что Sol переусложняет простые задачи (например, превращая список дел в эссе), работает медленнее (32 токена/сек) и проигрывает предшественникам в скорости, но эффективен в сложных агентных сценариях. Конкуренция со стороны Kimi K3 и DeepSeek v4 Flash вынуждает снижать цены — Kimi K3 конкурирует с Sol по качеству при меньшей цене, DeepSeek вытесняет Gemini. Подписки Pro/Plus остаются выгоднее API даже со скидкой. Некоторые считают Sol регрессией, другие — прогрессом в коде и рассуждениях. Промпты для Claude не работают на Sol из-за различий в логике. Первоначальная цена Sol, вероятно, имела высокую маржу, позволяющую снизить цену вдвое. Скидка недоступна при включённом ZDR на OpenRouter. Действие OpenRouter связано с приобретением Stripe.
DeepSeek V4 Pro 0813 🔥 Горячее 💬 Длинная дискуссия
Главная идея — DeepSeek V4 Pro 0813 — это первый стабильный релиз модели DeepSeek V4 Pro, построенный по архитектуре Mixture-of-Experts (MoE), которая позволяет эффективно распределять вычисления между специализированными подсистемами. Это делает её мощной, но при этом относительно экономичной в использовании ресурсов.
Ключевые цифры: вход стоит $0.435 за 1М токенов, но реальная средняя цена — всего $0.035, а выход — $0.87 (реально $0.8697), при этом кэширование снижает затраты до 92.7% от списка. Скорость генерации — 59 токенов/сек (P50), а средняя задержка — 1.3 секунды. Важный факт: 91.76% кэш-хитрейт говорит о высокой эффективности повторного использования контекста. Архитектура MoE даёт преимущество в сложных задачах, но требует точного балансирования нагрузки между экспертами.
Комментарии (424)
По опыту эксплуатации, DeepSeek V4 Flash 0731 показал значительный рост возможностей при небольшом размере и цене, что вызвало разочарование по поводу выпуска V4 Pro 0813. Некоторые пользователи отмечают, что V4 Pro 0813 уступает Flash по производительности, несмотря на более низкую стоимость; другие — что он достигает равных или лучших результатов, чем предыдущие модели, при сниженной цене. Тесты на одной задаче показали, что V4 Pro 0813 уступает Grok 4.6, но дешевле. В то же время один пользователь успешно применил V4 Pro 0813 для оптимизации трафик-симулятора и распределённого физического движка, получив улучшения без новых проблем. Рекомендуются альтернативы: Kimi-K3, GLM-5.2, Minimax — как модели, эффективные при минимальной стоимости.
Mozilla: The state of open source AI 🔥 Горячее 💬 Длинная дискуссия
Открытые модели ИИ достигли паритета с закрытыми по большинству задач — кодированию, следованию инструкциям и общим знаниям. Разрыв в способностях снизился с 8% в 2024 году до 0,5% к концу 2024 года, а к марту 2026 года стабилизировался на 3,3%, сосредоточившись лишь на сложных рассуждениях и работе с длинными контекстами. При этом более половины всех вычислительных токенов в продакшене теперь проходят через открытые модели — OpenRouter зафиксировал переход от незначительной доли к большинству к середине 2026 года.
Стоимость инференса уровня GPT-4 упала в 50 раз за три года — с $20 до $0,40 за миллион токенов, что превосходит темпы падения цен на вычисления в эпоху dot-com. Ключевое преимущество открытых моделей — полный контроль: мальтийские радиостанции обучают модели на языке терео, PwC запускает финансовые модели на собственном железе, а африканские фермеры диагностируют болезни кассавы без интернета. В Швейцарии государственный консорциум выпустил национальную модель со всеми весами, данными и кодом — без разрешений и лицензионных пошлин. Власти США поддерживают подход «наблюдай, не запрещай». Конкуренция и интероперабельность стали новой парадигмой — не в облаках, а в руках тех, кто использует ИИ.
Комментарии (176)
Открытые модели ИИ демонстрируют быстрый рост, увеличивают долю на рынке и становятся конкурентоспособными с закрытыми, но остаются значительные ограничения: нехватка финансирования, сложности с бизнес-моделями, недостаточная инфраструктура и инструментарий, а также риски безопасности и приватности. Участники обсуждения согласны, что у открытых моделей есть потенциал для развития, но спорят, смогут ли они полностью преодолеть разрыв в возможностях и производительности с закрытыми моделями, особенно в сложных задачах. Рекомендуется инвестировать в развитие инфраструктуры, инструментов и поддержку открытых моделей как альтернативы закрытым.
Qwen 3.6 27B is the sweet spot for local development 🔥 Горячее 💬 Длинная дискуссия
Qwen 3.6 27B стал «точкой слияния» для локального развития: это первый локальный модель, который ощутимо приближается к всеобщей интеллектуальности, при этом обходит более крупные варианты в практических задачах. Автор отмечает, что 27‑битовая версия «ударяет сзади» — её называют «перепрыгивает выше веса», а в Hacker News её часто называют лучшим компромиссом между мощью и ресурсоёмкостью.
Тестовые сценарии подтверждают возможности: от «пингвинов на велосипеде» до восьмистрочного стихотворения о Зоуке и квантовой физике, от мгновенного создания hexagonal‑minesweeper в OpenCode до генерации полноценной landing‑page для онлайн‑магазина свечей. Запуск локальный прост: через llama.cpp берут 8‑битную квантованную модель (Q8_0), контекст расширяют до 64 k токенов, а flash‑attention и draft‑mtp ускоряют вывод. При работе модель нагревается до такой степени, что её можно отследить тепловизором. Ключевые цифры — 27 B против 35 B, 8‑битное сжатие экономит ~50 % памяти, а контекст до 64 k токенов открывает широкие возможности для локального кодинга и генерации контента.
Комментарии (758)
- Обсуждается, что 128 ГБ MacBook Pro стоит около $6700 и оправдан лишь для приватности, а не для локального запуска крупных моделей.
- Большинство участников считают, что запуск Qwen 3.6 35B и аналогичных моделей на ноутбуке с 128 ГБ ОЗУ неэффективен и невыгодно по цене.
- Существуют более дешевые варианты: облачные сервисы (OpenRouter, Frontier Labs) и видеокарты типа Intel Arc Pro или AMD AI HX 370, которые дают лучшее соотношение цена/производительность.
- Есть мнения, что для «реальной работы» (агентов, сложных задач) нужны более мощные решения, а локальные модели на Mac‑системах часто медленнее, чем ожидалось.
Kimi K2 Thinking, a SOTA open-source trillion-parameter reasoning model 🔥 Горячее 💬 Длинная дискуссия
Kimi K2 Thinking — это новая модель от компании 01.AI, демонстрирующая впечатляющие способности в обработке длинных текстов. Модель способна анализировать документы до 128K токенов, что в 8 раз превышает возможности предыдущей версии. Это позволяет ей эффективно работать с целыми книгами, юридическими документами и научными исследованиями за один проход.
Разработчики подчеркивают, что K2 Thinking превосходит конкурентов в задачах, требующих глубокого понимания контекста, особенно на китайском языке. Тесты показывают, что модель достигает 90% точности в сложных аналитических задачах, что делает её одной из самых мощных на рынке. В то же время, компания заявляет о более эффективном использовании вычислительных ресурсов по сравнению с аналогами.
Комментарии (381)
- Китайские компании (Moonshot, DeepSeek, Qwen, GLM) за последние месяцы выпустили ряд открытых моделей, что ставит под сомнение привычное представление о том, что «открытый исходный код» — это западная практика.
- Модель Kimi K2 Thinking показала себя как наилучшая в своем классе, превосходя GPT-4.5 и Claude 3.5 Sonnet, и при этом доступна через OpenRouter и Hugging Face.
- Несмотря на то, что модель не является открытой, Moonshot AI предоставляет доступ к ней бесплатно, что вызывает вопросы о финансировании и стратегии.
- Появление столь мощных открытых моделей вызывает вопросы о том, как они будут использоваться и как это повлияет на рынок ИИ.
What happens when coding agents stop feeling like dialup?
Сейчас кодирующие агенты вроде Claude Code работают медленно и ненадёжно, напоминая dialup-модемы 90-х: частые сбои, необходимость перезапусков, скорость генерации всего 30-60 токенов в секунду. Это связано с взрывным ростом потребления токенов — по данным OpenRouter, объёмы выросли в 50 раз за короткий период, а агентные workflows требуют в 1000 раз больше ресурсов, чем обычные чаты.
Более высокая скорость, например 2000 токенов в секунду (как у Cerebras Code), кардинально меняет опыт: разработчик становится узким местом, а не модель. Это открывает путь к новому этапу — параллельным независящим агентам, которые предлагают несколько вариантов решения задачи с автоматической оценкой качества. Однако рост скорости лишь разгоняет спрос, создавая бесконечный цикл: чем лучше модели, тем сложнее задачи, которые мы им ставим.
Комментарии (133)
- Скептицизм относительно реального повышения продуктивности из-за LLM: AI может создавать иллюзию продуктивности, снижая когнитивную вовлеченность и порождая проблемы с качеством и сопровождением кода.
- Ключевая проблема — скорость и контекст: Медленная генерация токенов и постоянное переключение контекста нарушают состояние потока (flow), а ограничения контекста приводят к ошибкам и галлюцинациям.
- Сдвиг роли разработчика: Инструмент меняет фокус с написания кода на проверку, редактирование и управление AI-агентами, что требует постоянной бдительности и новых навыков.
- Зависимость от надежности провайдеров: Сбои в работе AI-сервисов сравнимы с остановкой производства, что создает риски для рабочего процесса.
- Разные стратегии и предпочтения в использовании: Одни разработчики ценят интегрированные в IDE решения (Cursor), другие предпочитают сторонних агентов (Claude, Codex) или используют LLM как «калькулятор» для рутинных задач и обучения.