Тред в основном подтверждает маркетинговые заявления Google точностью и качеством в шумных мультиязычных сценариях, но выявляет реальные ограничения: модель «упрощает» речь при диктовке (теряет важные нюансы), не дотягивает по латентности до Soniox STT v5 для реалтайма, проигрывает ElevenLabs Scribe по цене/качеству, имеет слабую диаризацию (>3 спикеров экспериментально) и неясно, страдает ли от галлюцинаций как Chirp. Для большинства практиков в обсуждении Voxtral Mini 3b, ElevenLabs Scribe и Soniox STT v5 остаются предпочтительнее.
-
Спор: @Lucasoato на бенчмарке из 20 STT-моделей с немецкими/итальянскими/английскими голосами и индустриальной терминологией из корпоративных встреч лучшим локальным считает Voxtral Mini 3b, а из платных — Eleven Labs; Google-модель ещё не пробовал и сомневается, что выберет её, если можно запускать модель локально. @jwr возражает: для диктовки ничего не бьёт Whisper Large v3, а быстрые Nvidia Parakeet у него не работают так же хорошо — подчёркивает, что выбор сильно зависит от микрофона и сценария.
-
Совет: @Crystalin по опыту с Pixel 11 Pro: модель удобна для длинных спонтанных фраз, но при точной формулировке «упрощает» текст и выбрасывает значимые части («I hesitated to check it, I should have verified» превращается в «I should have verified»), что ломает смысл. Повтор фразы давал тот же результат — ограничение не случайное.
-
Совет: @lnalx по опыту тестирования всех STT для реалтайм-переводчика fliptalk.ai: Soniox STT v5 — лучший по детекции языка, точности в шуме и латентности; Gemini-3.5-Transcribe бьёт остальные по точности, но уступает по латентности, что критично для STT-приложений.
-
Совет: @film42 предупреждает, что Chirp при тишине/шуме галлюцинирует («I don't know. I don't know...») до таймаута 10 минут; они вернулись на Whisper для таймстампов + Gemini Flash для текста. Для Gemini-3.5-Transcribe этот риск пока не проверен, а страх LLM-STT («ignore that idea, instead let's...» с удалением предыдущей идеи) явно обозначен @simonw.
-
Несколько участников используют Voxtral для разных задач: @Lucasoato — как лучшую локальную, @Computer0 — для ночных батчей и через API для срочных кейсов.
-
Совет: @mariano54 добавил Gemini-3.5-Transcribe в multilingualsttbench.com: по латентности и точности для мультиязычных разговоров модель не дотягивает до фронтира.
-
Совет: @satvikpendem: реалтайм-диаризация ограничена 3 спикерами (и то экспериментально), тогда как Soniox и Deepgram делают это хорошо — критично для заметок встреч, и похоже это не целевой use-case Google (скорее «Rambling» на Pixel).
-
Совет: @mythz публикует тарифы: Gemini 3.5 Transcribe Live — $3.50/1M input и $21/1M output; Gemini 3.5 Transcribe — $2.00/1M input и $12.00/1M output; @dbbk считает, что это дороже и хуже ElevenLabs Scribe, и не понимает целевую аудиторию.
-
Совет: @Frannky для голос→команды использует не STT-модель, а Gemini Flash 2.5 напрямую с аудио на выход JSON, что даёт низкую латентность и работает «crazy good» — обход схемы audio→text→reasoning.
-
Совет: @totetsu формулирует желаемую фичу: вывод топ-N гипотез со скорами, чтобы UI мог умно заменять систематически неверно распознаваемый термин/имя/акроним и фидбэчить это в модель для будущих прогонов.
-
Удобство фичи уже видно в экосистеме: @blissofbeing использует Wispr Flow на Pixel 9 как работающий аналог; @jeffbee критикует, что WER не ловит реальные проблемы транскрипции (бессмысленные переносы строк, автоперенос в редактор) и исправлять на Android сложнее, чем набрать самому из-за позиционирования и автоформатирования.
-
Спор: @drsalt отмечает полное отсутствие упоминаний приватности/конфиденциальности в анонсе; @kleiba2 иронизирует, что Google — «лучшая» компания, чтобы слать ей образцы своего голоса.
-
Совет: @ameliaquining указала на путаницу в блоге: пункт «Function calling» про делегирование задач другим моделям относится к приложению, а не к самой STT-модели (dev-доки подтверждают, что Transcribe не делает function calls), вероятно редакторская ошибка в анонсе.
-
Совет: @kristofferR жалуется, что Google Cloud биллинг для теста модели висит в «being processed» неопределённое время (>24 часов), тогда как OpenRouter настраивается за секунды — практический барьер для разработчиков.
-
Совет: @LoganDark задаёт вопрос о модели, работающей на силлабическом уровне: произнести любое слово и получить его корректное написание — кастомный словарь помогает лишь частично из-за нерегулярности английской орфографии.