Gemini-3.5-Transcribe 🔥 Горячее
Gemini 3.5 Transcribe — это новая модель распознавания речи от Google, обеспечивающая высокую точность и интеллектуальную обработку аудио в реальном времени и для предварительно записанных файлов. Она превосходит традиционные системы, эффективно справляясь с фоновым шумом, дисфлюенциями (например, «эм», «а»), самокоррекциями и сложной терминологией, автоматически форматируя текст и удаляя лишние элементы. Модель поддерживает более 85 языков с учётом акцентов и диалектов, а также распознаёт до трёх спикеров с метками времени и идентификацией говорящих в предварительно обработанном аудио (поддержка большего числа спикеров — экспериментальная).
Ключевые показатели точности: средний показатель ошибок слова (WER) составляет 4,0% для потоковой транскрипции и 2,6% для обработки предварительно записанного аудио, что подтверждается независимыми измерениями Artificial Analysis. Модель точно распознаёт алфавитно-цифровые сущности, такие как почтовые индексы и номера заказов, и поддерживает кастомный словарь для специализированной терминологии. Доступна через два API: потоковый (gemini-3.5-transcribe-live) с субсекундной задержкой для интерактивных приложений и API для обработки файлов (gemini-3.5-transcribe) с атрибуцией спикеров и временными метками. Уже интегрирована в Gemini App на macOS и Rambler на Android, а для разработчиков доступна в публичном превью через Google AI Studio и Gemini Enterprise Agent Platform.
Комментарии (107)
Тред в основном подтверждает маркетинговые заявления Google точностью и качеством в шумных мультиязычных сценариях, но выявляет реальные ограничения: модель «упрощает» речь при диктовке (теряет важные нюансы), не дотягивает по латентности до Soniox STT v5 для реалтайма, проигрывает ElevenLabs Scribe по цене/качеству, имеет слабую диаризацию (>3 спикеров экспериментально) и неясно, страдает ли от галлюцинаций как Chirp. Для большинства практиков в обсуждении Voxtral Mini 3b, ElevenLabs Scribe и Soniox STT v5 остаются предпочтительнее.
-
Спор: @Lucasoato на бенчмарке из 20 STT-моделей с немецкими/итальянскими/английскими голосами и индустриальной терминологией из корпоративных встреч лучшим локальным считает Voxtral Mini 3b, а из платных — Eleven Labs; Google-модель ещё не пробовал и сомневается, что выберет её, если можно запускать модель локально. @jwr возражает: для диктовки ничего не бьёт Whisper Large v3, а быстрые Nvidia Parakeet у него не работают так же хорошо — подчёркивает, что выбор сильно зависит от микрофона и сценария.
-
Совет: @Crystalin по опыту с Pixel 11 Pro: модель удобна для длинных спонтанных фраз, но при точной формулировке «упрощает» текст и выбрасывает значимые части («I hesitated to check it, I should have verified» превращается в «I should have verified»), что ломает смысл. Повтор фразы давал тот же результат — ограничение не случайное.
-
Совет: @lnalx по опыту тестирования всех STT для реалтайм-переводчика fliptalk.ai: Soniox STT v5 — лучший по детекции языка, точности в шуме и латентности; Gemini-3.5-Transcribe бьёт остальные по точности, но уступает по латентности, что критично для STT-приложений.
-
Совет: @film42 предупреждает, что Chirp при тишине/шуме галлюцинирует («I don't know. I don't know...») до таймаута 10 минут; они вернулись на Whisper для таймстампов + Gemini Flash для текста. Для Gemini-3.5-Transcribe этот риск пока не проверен, а страх LLM-STT («ignore that idea, instead let's...» с удалением предыдущей идеи) явно обозначен @simonw.
-
Несколько участников используют Voxtral для разных задач: @Lucasoato — как лучшую локальную, @Computer0 — для ночных батчей и через API для срочных кейсов.
-
Совет: @mariano54 добавил Gemini-3.5-Transcribe в multilingualsttbench.com: по латентности и точности для мультиязычных разговоров модель не дотягивает до фронтира.
-
Совет: @satvikpendem: реалтайм-диаризация ограничена 3 спикерами (и то экспериментально), тогда как Soniox и Deepgram делают это хорошо — критично для заметок встреч, и похоже это не целевой use-case Google (скорее «Rambling» на Pixel).
-
Совет: @mythz публикует тарифы: Gemini 3.5 Transcribe Live — $3.50/1M input и $21/1M output; Gemini 3.5 Transcribe — $2.00/1M input и $12.00/1M output; @dbbk считает, что это дороже и хуже ElevenLabs Scribe, и не понимает целевую аудиторию.
-
Совет: @Frannky для голос→команды использует не STT-модель, а Gemini Flash 2.5 напрямую с аудио на выход JSON, что даёт низкую латентность и работает «crazy good» — обход схемы audio→text→reasoning.
-
Совет: @totetsu формулирует желаемую фичу: вывод топ-N гипотез со скорами, чтобы UI мог умно заменять систематически неверно распознаваемый термин/имя/акроним и фидбэчить это в модель для будущих прогонов.
-
Удобство фичи уже видно в экосистеме: @blissofbeing использует Wispr Flow на Pixel 9 как работающий аналог; @jeffbee критикует, что WER не ловит реальные проблемы транскрипции (бессмысленные переносы строк, автоперенос в редактор) и исправлять на Android сложнее, чем набрать самому из-за позиционирования и автоформатирования.
-
Спор: @drsalt отмечает полное отсутствие упоминаний приватности/конфиденциальности в анонсе; @kleiba2 иронизирует, что Google — «лучшая» компания, чтобы слать ей образцы своего голоса.
-
Совет: @ameliaquining указала на путаницу в блоге: пункт «Function calling» про делегирование задач другим моделям относится к приложению, а не к самой STT-модели (dev-доки подтверждают, что Transcribe не делает function calls), вероятно редакторская ошибка в анонсе.
-
Совет: @kristofferR жалуется, что Google Cloud биллинг для теста модели висит в «being processed» неопределённое время (>24 часов), тогда как OpenRouter настраивается за секунды — практический барьер для разработчиков.
-
Совет: @LoganDark задаёт вопрос о модели, работающей на силлабическом уровне: произнести любое слово и получить его корректное написание — кастомный словарь помогает лишь частично из-за нерегулярности английской орфографии.
Gemini Omni 1.1 Flash 🔥 Горячее 💬 Длинная дискуссия
Gemini Omni 1.1 Flash — это обновлённая версия генеративной модели от Google DeepMind, ориентированная на профессиональное создание видео через API. Она добавляет студийный уровень контроля: теперь можно плавно расширять сцены на основе до 10 секунд предыдущего контекста (раньше — только последняя секунда), что обеспечивает лучшую визуальную согласованность и позволяет создавать истории длиной до 40 секунд шагами по 10 секунд. Также реализована генерация видео между заданными первым и последним кадрами — идеально для сложных переходов, орбит камеры или зацикленных клипов без скачков.
Для ускорения прототипирования доступен режим 360p: генерация происходит до 60% быстрее и в три раза дешевле, чем в стандартном 720p, что удобно для раскадровок и быстрой итерации. По готовности можно апскейлить результат до 4K с сохранением деталей. Модель уже интегрирована в Google AI Studio, Gemini Enterprise Agent Platform и доступна подписчикам Google AI Plus, Pro и Ultra в Google Flow и Gemini app. Официальная документация, кукбук и гайды по промптингу помогают разработчикам внедрять эти возможности в свои инструменты и рабочие процессы.
Комментарии (208)
Тред почти не обсуждает техническую сторону Omni 1.1 Flash; вместо этого доминируют индустриальные и культурные последствия генеративного видео. Прозвучали конкретные сигналы удара по смежным профессиям (актёры озвучки, фотографы, иллюстраторы), скепсис по поводу практической пользы и контроля, а также единичные пользовательские наблюдения о поведении модели.
-
Участники массово фиксируют исчезновение «небрендовых» креативных работ: @earthnail называет произвольную озвучку «мёртвой», @anonzzzies описывает по опыту из своего города, что меню/афиши/баннеры ресторанов и событий теперь генерирует OpenAI, а его знакомый фотограф перешёл на свадьбы, потому что коммерческие съёмки «plummeting» с конца прошлого года.
-
Несколько комментаторов (@thangalin, @apwheele, @NooneAtAll3, @cube00, @DataDive, @bluerooibos) сходятся на том, что видеогенерация пока слаба для реальных задач: модели «дрейфуют» и не держат 30+ секунд, синхронизация с заранее записанным аудио не работает, а нетворческие превью в 360p при повторном запуске дают другой результат из-за недетерминированности.
-
Пользователи (@037, @vardump, @ygouzerh, @GaggiX, @fg137) сообщают, что демо-страница Google плохо работает в Firefox и в целом неудобна на десктопе: бесконтрольный инстант-скролл назад к видео после ручного скролла, много тяжёлых видео; @037 в шутку предлагает гугловцам «P.S. Make sure the page works in Firefox too».
-
Совет: @cube00 советует использовать низкое разрешение 360p только как драфт: при одинаковом промпте на 720p результат отличается из-за недетерминированности, поэтому превью — это лишь проверка идеи, а не воспроизводимый рендер.
-
Совет: @andsoitis указывает, что тема влияния на актёров всё-таки обсуждалась, и даёт поисковый запрос на Algolia HN для тех, кому нужен контекст прошлых дискуссий и профсоюзные кейсы (упоминается контракт SAG-AFTRA против нелицензированных AI-перформансов).
-
@petcat и @lambda отмечают, что экранные и голосовые актёры защищены профсоюзами (SAG-AFTRA), которые целенаправленно бастовали и выторговывали пункты про AI, в отличие от разработчиков, не имеющих коллективного рычага.
-
Спор: @porridgeraisin и @deadlast2 считают автоматизацию креативных профессий логичным продолжением истории труда (как когда-то исчезли чертёжники), а @space_fountain и @DataDive возражают: инструменты «отлично делают слоп», но почти бесполезны для художественного видения и лишают визуальный контент обещания реальности, делая его «массивом пикселей, расставленных алгоритмом на 2D-экране».
-
Часть комментаторов (@bluerooibos, @chermi, @SpyCoder77, @CmonGoogle) выражает усталость и недоверие к маркетингу: пользователи «онемели» к апдейтам, @chermi саркастически вспоминает «3.5prowithinamonth», а @CmonGoogle формулирует три ложные предпосылки, на которых держится нарратив фрагментации AI-брендов Google.
-
Совет: @thangalin демонстрирует свой работающий self-hosted пайплайн для аудиокниг — контейнеризованное веб-приложение, озвучивающее его sci-fi роман локально с несколькими нарраторами и персонажами (скриншоты keenlore), показывая практический пример замены актёров озвучки.
-
@petegleeson ловит явный failure модели в маркетинговом видео: цитата хвалит «accuracy» Omni Flash, а в кадре аргентинский футболист в майке «RESSC», что показывает, как минимум для текста на форме, заявленная точность не выдерживает проверки.
-
@simonw ставит релиз в стратегический контекст: OpenAI фактически бросил Sora, а Google продолжает инвестировать в генерацию видео, возможно, потому что это путь к «world models», тогда как новой версии Gemini Pro давно нет — это подтверждает @guilhermeasper фразой «Google does anything except launch a new version of Gemini Pro».
-
Совет: @shreya1999 формулирует сдвиг рынка: «сырое» качество генерации уже стало baseline-ом, конкуренция теперь идёт за контролируемость, а @overflowy предупреждает, что откажется от любого бизнеса, использующего сгенерированные видео в продакшене.
-
Спор: @dominotw спорит с нарративом массовой автоматизации: AI хорошо работает только там, где есть компиляторы, тесты, CI и «куча данных» (например, hiring через Mercor), во всём остальном он «sucks», что противоречит видению @deadlast2 о скором поглощении всех индустрий.
Gemini 3.7 Flash 🔥 Горячее 💬 Длинная дискуссия
Гемини 3.7 Flash — новое поколение «рабочей лошадки» от Google, созданное для сложного программирования и агентных сценариев. За три недели после релиза 3.6 Flash компания представила модель с существенно улучшенным пониманием кода, точностью генерации и способностью работать с длинными цепочками задач. На тестах FrontierCode 1.1 точность выросла с 34,4 % до 43,6 %, а в DeepSWE v1.1 — с 49,0 % до 65,3 %. В веб‑разработке 3.7 Flash генерирует полноценные приложения и UI‑компоненты из меньшего числа промптов, а на Arena.ai WebDev Arena набрал Elo 1588 против 1538 у предшественника.
Особенно заметны рост точности в обработке тяжёлых документов: на бенчмарке GDP.pdf показатель вырос с 22 % до 34 %, а в AutomationBench — с 17 % до 30,4 %. Стоимость остаётся вдвое ниже, чем у 3.6 Flash (0,75 $/млн входных и 3,75 $/млн выходных токенов), а новая версия лучше адаптируется к подводным камням, уточняет намерения пользователя и требует меньше ручного контроля. Теперь разработчики могут использовать её в Google AI Studio, Android Studio и через Gemini Enterprise, а обычные пользователи — в Spark внутри приложения Gemini.
Комментарии (453)
Gemini 3.7 Flash лидирует по скорости и низкой задержке, что критично для интерактивных сценариев (например, Google AI Mode), но страдает от сложного парсинга «мыслей», академичного стиля ответов и неконкурентоспособной долгосрочной цены — после 2026 года тариф удваивается, при этом модель к тому времени устареет. Пользователи отмечают: - Модель лучше подходит для агентных задач и быстрых итераций, но слаба в сложном кодинге и рефакторинге — уступает GPT-5.6 Luna, DeepSeek и Opus. - Вывод требует значительной очистки от внутренних монологов, усложняя интеграцию. - Стиль ответов стал менее интуитивным, вероятно, из-за RLVR-тренировок. - Галлюцинации и ложные утверждения сохраняются в серии Flash (3.1–3.7), снижая доверие по сравнению с Claude или Sol. - Генерация SVG сломана в Firefox и Chrome из-за невалидных фильтров — проблема кросс-браузерной совместимости. - В image-to-html уступает Opus 5, но сопоставима с Grok 4.6. - Интеграция в Android-ассистента ухудшила UX: модель галлюцинирует инструкции и отказывается выполнять простые команды. - Google Cloud: запутанная номенклатура (Gemini, Anti-gravity, Vertex) и сложная регистрация CLI-инструментов отталкивают разработчиков. - Для специфических задач (анализ рынков на Rust) Stepfun AI Step-3.5-Flash дешевле и эффективнее. - AA-метрика выросла за счёт увеличения токенов вывода, а не качества — экономика использования изменилась. - Качество ответов («vibes») остаётся важнее бенчмарков: пользователи предпочитают Claude за стиль, несмотря на цифры. Споры о целесообразности: одни считают 3.7 Flash избыточным на фоне более дешёвых и быстрых альтернатив, другие — востребованным для быстрых задач, где превосходит Sonnet 5 и Opus.
Gemini Robotics 2 brings whole body intelligence to robots 🔥 Горячее 💬 Длинная дискуссия
Gemini Robotics 2 представляет собой прорыв в области робототехники, объединяя целостное управление телом, тонкую манипуляцию и командную работу через три интеллектуальных модели. Впервые роботы могут осмысливать и выполнять сложные задачи — от ходьбы и приседаний до уборки захламлённых помещений — с контролем от стоп до кончиков пальцев, используя визуальные и языковые подсказки. Модель Gemini Robotics 2 VLA преобразует восприятие в движения, ER 2 планирует многошаговые действия и координирует взаимодействие между роботами, а On-Device 2 позволяет адаптироваться к новым телам за несколько часов, работая локально без облака.
Ключевое достижение — способность к переносу навыков между разными роботами и реальному взаимодействию с человеческой средой. ER 2 уже доступен в Google AI Studio, а другие модели — в тестовом доступе для партнёров. Система демонстрирует, что роботы больше не привязаны к жёстким программам: они учатся, адаптируются и сотрудничают, как живые существа. Партнёры вроде Boston Dynamics и Apptronik уже тестируют технологии, что открывает путь к массовому внедрению умных роботов в быту и промышленности.
Комментарии (477)
Участники обсуждают потенциал и риски робототехники и ИИ в контексте Gemini Robotics 2: возможность вреда людям, замены рабочих мест, этические последствия. Согласны, что технологии могут улучшить жизнь, но требуют осторожного внедрения. Рекомендуют фокусироваться на специализированных роботах, а не на универсальных андроидах.