Hacker News Digest

Тег: #speech-recognition

Постов: 6

Gemini-3.5-Transcribe (blog.google) 🔥 Горячее

Gemini 3.5 Transcribe — это новая модель распознавания речи от Google, обеспечивающая высокую точность и интеллектуальную обработку аудио в реальном времени и для предварительно записанных файлов. Она превосходит традиционные системы, эффективно справляясь с фоновым шумом, дисфлюенциями (например, «эм», «а»), самокоррекциями и сложной терминологией, автоматически форматируя текст и удаляя лишние элементы. Модель поддерживает более 85 языков с учётом акцентов и диалектов, а также распознаёт до трёх спикеров с метками времени и идентификацией говорящих в предварительно обработанном аудио (поддержка большего числа спикеров — экспериментальная).

Ключевые показатели точности: средний показатель ошибок слова (WER) составляет 4,0% для потоковой транскрипции и 2,6% для обработки предварительно записанного аудио, что подтверждается независимыми измерениями Artificial Analysis. Модель точно распознаёт алфавитно-цифровые сущности, такие как почтовые индексы и номера заказов, и поддерживает кастомный словарь для специализированной терминологии. Доступна через два API: потоковый (gemini-3.5-transcribe-live) с субсекундной задержкой для интерактивных приложений и API для обработки файлов (gemini-3.5-transcribe) с атрибуцией спикеров и временными метками. Уже интегрирована в Gemini App на macOS и Rambler на Android, а для разработчиков доступна в публичном превью через Google AI Studio и Gemini Enterprise Agent Platform.

by k9294 • 27 августа 2026 г. в 18:03 • 321 points

ОригиналHN

#android#api#gemini-3.5-transcribe#gemini-enterprise-agent-platform#google#google-ai-studio#macos#speech-recognition

Комментарии (107)

Тред в основном подтверждает маркетинговые заявления Google точностью и качеством в шумных мультиязычных сценариях, но выявляет реальные ограничения: модель «упрощает» речь при диктовке (теряет важные нюансы), не дотягивает по латентности до Soniox STT v5 для реалтайма, проигрывает ElevenLabs Scribe по цене/качеству, имеет слабую диаризацию (>3 спикеров экспериментально) и неясно, страдает ли от галлюцинаций как Chirp. Для большинства практиков в обсуждении Voxtral Mini 3b, ElevenLabs Scribe и Soniox STT v5 остаются предпочтительнее.

  • Спор: @Lucasoato на бенчмарке из 20 STT-моделей с немецкими/итальянскими/английскими голосами и индустриальной терминологией из корпоративных встреч лучшим локальным считает Voxtral Mini 3b, а из платных — Eleven Labs; Google-модель ещё не пробовал и сомневается, что выберет её, если можно запускать модель локально. @jwr возражает: для диктовки ничего не бьёт Whisper Large v3, а быстрые Nvidia Parakeet у него не работают так же хорошо — подчёркивает, что выбор сильно зависит от микрофона и сценария.

  • Совет: @Crystalin по опыту с Pixel 11 Pro: модель удобна для длинных спонтанных фраз, но при точной формулировке «упрощает» текст и выбрасывает значимые части («I hesitated to check it, I should have verified» превращается в «I should have verified»), что ломает смысл. Повтор фразы давал тот же результат — ограничение не случайное.

  • Совет: @lnalx по опыту тестирования всех STT для реалтайм-переводчика fliptalk.ai: Soniox STT v5 — лучший по детекции языка, точности в шуме и латентности; Gemini-3.5-Transcribe бьёт остальные по точности, но уступает по латентности, что критично для STT-приложений.

  • Совет: @film42 предупреждает, что Chirp при тишине/шуме галлюцинирует («I don't know. I don't know...») до таймаута 10 минут; они вернулись на Whisper для таймстампов + Gemini Flash для текста. Для Gemini-3.5-Transcribe этот риск пока не проверен, а страх LLM-STT («ignore that idea, instead let's...» с удалением предыдущей идеи) явно обозначен @simonw.

  • Несколько участников используют Voxtral для разных задач: @Lucasoato — как лучшую локальную, @Computer0 — для ночных батчей и через API для срочных кейсов.

  • Совет: @mariano54 добавил Gemini-3.5-Transcribe в multilingualsttbench.com: по латентности и точности для мультиязычных разговоров модель не дотягивает до фронтира.

  • Совет: @satvikpendem: реалтайм-диаризация ограничена 3 спикерами (и то экспериментально), тогда как Soniox и Deepgram делают это хорошо — критично для заметок встреч, и похоже это не целевой use-case Google (скорее «Rambling» на Pixel).

  • Совет: @mythz публикует тарифы: Gemini 3.5 Transcribe Live — $3.50/1M input и $21/1M output; Gemini 3.5 Transcribe — $2.00/1M input и $12.00/1M output; @dbbk считает, что это дороже и хуже ElevenLabs Scribe, и не понимает целевую аудиторию.

  • Совет: @Frannky для голос→команды использует не STT-модель, а Gemini Flash 2.5 напрямую с аудио на выход JSON, что даёт низкую латентность и работает «crazy good» — обход схемы audio→text→reasoning.

  • Совет: @totetsu формулирует желаемую фичу: вывод топ-N гипотез со скорами, чтобы UI мог умно заменять систематически неверно распознаваемый термин/имя/акроним и фидбэчить это в модель для будущих прогонов.

  • Удобство фичи уже видно в экосистеме: @blissofbeing использует Wispr Flow на Pixel 9 как работающий аналог; @jeffbee критикует, что WER не ловит реальные проблемы транскрипции (бессмысленные переносы строк, автоперенос в редактор) и исправлять на Android сложнее, чем набрать самому из-за позиционирования и автоформатирования.

  • Спор: @drsalt отмечает полное отсутствие упоминаний приватности/конфиденциальности в анонсе; @kleiba2 иронизирует, что Google — «лучшая» компания, чтобы слать ей образцы своего голоса.

  • Совет: @ameliaquining указала на путаницу в блоге: пункт «Function calling» про делегирование задач другим моделям относится к приложению, а не к самой STT-модели (dev-доки подтверждают, что Transcribe не делает function calls), вероятно редакторская ошибка в анонсе.

  • Совет: @kristofferR жалуется, что Google Cloud биллинг для теста модели висит в «being processed» неопределённое время (>24 часов), тогда как OpenRouter настраивается за секунды — практический барьер для разработчиков.

  • Совет: @LoganDark задаёт вопрос о модели, работающей на силлабическом уровне: произнести любое слово и получить его корректное написание — кастомный словарь помогает лишь частично из-за нерегулярности английской орфографии.

EEG shows brain can simultaneous encode two speech streams (journals.plos.org)

В мозгу одновременно отслеживаются два разговорных потока, когда человек переключает внимание от одного говорящего к другому. С помощью ЭЭГ измеряли временные отклики (TRF) и обнаружили, что сигнал, соответствующий новому потоку, появляется ещё до того, как полностью отключается предыдущий, что свидетельствует о коротком моменте совместного кодирования обоих потоков. При этом мощность альфа‑ритма заметно падает, отражая усиление умственных затрат в фазе переключения. Участники слышали несколько голосов в фоновом шуме и каждые 15–30 секунд меняли фокус, что позволяло отследить динамику переключения и фиксировать нейронные реакции.

Дальнейший анализ выявил, что после смены внимания мозг временно стирает прежний лексический контекст и начинает формировать новый на его основе. Для этого исследователи использовали четыре подхода к накоплению контекста и сравнили их эффективность. Оказалось, что в большинстве случаев обновление словаря происходит мгновенно, что подтверждается снижением альфа‑активности и ростом TRF‑сигналов, указывающих на перезагрузку предсказаний. Таким образом, слушатели не просто переключают фокус, но и готовят мозг к восприятию новых смысловых связей и поддерживают высокую точность распознавания речи в условиях многоговорящего фона.

by giuliomagnifico • 17 июля 2026 г. в 05:51 • 170 points

ОригиналHN

#brain#eeg#journal-article#neural-processing#neuroscience#plos#speech-recognition

Комментарии (104)

Мозг способен одновременно обрабатывать несколько речевых потоков — это подтверждают участники обсуждения, приводящие примеры: чтение и счет, слушание аудиокниг, игра на инструменте, копирование кода Морзе при разговоре, приём двух аудиопотоков как пилот и радист. Возможность зависит от автоматизации задач, уровня внимания и индивидуальных различий. Тренировка может развивать эту способность. Однако споры остаются: одни считают это реальной параллельной обработкой, другие — приоритизацией и фильтрацией. @vanderZwan и @latentframe подчёркивают необходимость объективных измерений (например, ЭЭГ) и осторожности в интерпретации результатов.

Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor (get-inscribe.com) 🔥 Горячее 💬 Длинная дискуссия

Apple представила новый SpeechAnalyzer, который в тестах на 5 559 utterance‑ах показал лучшую точность среди всех сравниваемых систем. На чистом наборе LibriSpeech его WER составил 2,12 %, а на шумном — 4,56 %, что вдвое‑трижды лучше, чем у Whisper Small (3,74 % и 7,95 %) и в четыре раза лучше, чем у устаревшего SFSpeechRecognizer (9,02 % и 16,25 %). Модель работает полностью на устройстве, в три раза быстрее, чем Whisper Small, при этом требует в три раза меньше вычислительных ресурсов.

Переход с SFSpeechRecognizer на SpeechAnalyzer оправдан: ошибка в тексте снижается в 3‑4 раза, а качество транскрибирования становится более пунктуационно правильным и заглавным. Для английского распознавания на iPhone или Mac встроенный движок теперь превосходит даже Whisper Small как по точности, так и по скорости, хотя Whisper сохраняет преимущество в поддержке множества языков и кроссплатформенности. Поэтому разработчикам стоит мигрировать сразу, а остальные системы использовать только там, где требуется многоязычность.

Все результаты и исходные транскрипции открыты для проверки: вы можете загрузить JSON‑файлы с WER‑значениями и оценить их самостоятельно, что делает выводы независимыми и публично проверяемыми и легко интегрируемыми.

by get-inscribe • 13 июля 2026 г. в 16:06 • 515 points

ОригиналHN

#api#apple#benchmarking#ios#macos#sfspeechrecognizer#speech-recognition#speechanalyzer#whisper

Комментарии (207)

  • Apple SpeechAnalyzer показывает в 3‑4 раз лучшую точность и в 3 раз быстрее, чем Whisper Small, при этом работает полностью офлайн на устройстве.
  • Обсуждаются преимущества стриминговой транскрипции и поддержка тайм‑стампов, чего не хватает у большинства открытых моделей.
  • Участники отмечают, что сравнение с лишь Whisper Small/​Base / Tiny бессмысленно – нужны тесты против Whisper V3‑Large, V3‑Turbo, Parakeet и Cohere Transcribe.
  • Есть запросы добавить автодетекцию языка, более широкий набор языков и интеграцию в системный клавиатурный ввод.

Neural audio codecs: how to get audio into LLMs (kyutai.org) 🔥 Горячее

Текущие речевые LLM работают как обертка: преобразуют речь в текст, обрабатывают его и затем синтезируют ответ обратно в речь, что не позволяет улавливать нюансы интонации, сарказма или эмоций. Даже передовые модели вроде Gemini или ChatGPT с продвинутым голосовым режимом не могут ответить на вопрос о высоте голоса, демонстрируя отставание речевых моделей от текстовых. Проблема в том, что за одну секунду аудио содержится десятки тысяч выборок, в отличие от нескольких слов в тексте, что делает обработку аудио значительно сложнее.

Решением являются нейроаудио-кодеки, такие как Mimi от Kyutai, которые сжимают аудио в более управляемые дискретные токены, аналогично токенизации текста. Вместо предсказания аудио выборка за выборкой, как в ранних моделях вроде WaveNet, кодеки преобразуют непрерывные значения в 256 дискретных "вёдер" с помощью μ-law алгоритма. Этот подход позволяет LLM обрабатывать аудио как последовательность токенов, предсказывать продолжение и затем декодировать обратно в аудио, открывая путь к настоящему пониманию речи.

by karimf • 21 октября 2025 г. в 12:55 • 410 points

ОригиналHN

#audio-codecs#audio-processing#kyutai#law#llm#neural-networks#speech-recognition#tokenization#tts#wavenet

Комментарии (115)

  • Обсуждение охватывает широкий спектр тем: от токенизации аудио до фундаментальных вопросов о том, как моделируются речь и звук, и почему это важно для будущего ИИ.
  • Участники обсуждают, что вместо попыток заставить модели распознавать и генерировать речь, мы должны сосредоточиться на создании моделей, которые могут работать с непрерывными сигналами и, таким образом, избегая необходимости в токенизации аудио.
  • Обсуждается, что вместо того, чтобы полагаться на существующие аудио кодеки, такие как MP3, мы должны развивать нейрональные кодеки, которые могут быть обучены вместе с моделью и, таким образом, позволяя ей напрямую работать с компактным, дискретным представлением аудио.
  • Участники также обсуждают, что вместо того, чтобы пытаться обучить модель на транскрибированном тексте, мы должны использовать аудио-ориентированные данные, которые включают в себе всю информацию, которая теряется при транскрибции. Это может включать в себе обучение модели на транскрибированном тексте, который может быть использован для тренировки TTS-моделей.

How AI hears accents: An audible visualization of accent clusters (accent-explorer.boldvoice.com)

Исследователи обучили модель для идентификации акцентов, используя 25 тысяч часов английской речи. Теперь можно услышать, как ИИ «слышит» разные акценты, преобразуя их в единый нейтральный голос. Это позволяет сравнивать акценты, скрывая личные особенности голосов. Например, испанский и итальянский акценты оказались рядом, что ожидаемо из-за схожести языков. Интересно, что ирландский акцент ближе к американскому, чем британский.

by ilyausorov • 14 октября 2025 г. в 16:07 • 244 points

ОригиналHN

#data-bias#llm#machine-learning#natural-language-processing#speech-recognition

Комментарии (113)

  • Обсуждение охватывает широкий спектр тем: от трудностей распознавания акцентов до визуализации кластеров акцентов и их влияния на обучение моделей.
  • Участники делятся личным опытом, включая то, как их собственные акценты были распознаны и интерпретированы.
  • Обсуждаются ограничения и предвзятость в данных, используемых для обучения таких систем.
  • Также обсуждается влияние акцента на распознавание речи и как это влияет на пользователей с акцентом.

Qwen3-Omni: Native Omni AI model for text, image and video (github.com) 🔥 Горячее

Команда Alibaba Cloud представила Qwen3-Omni — первую в мире модель, способную одновременно обрабатывать текст, аудио, изображения и видео, а также генерировать речь в реальном времени. Она работает как единая end-to-end система, без необходимости разделения задач на отдельные модули, что повышает эффективность и снижает задержки.

Модель поддерживает мультимодальный ввод и вывод, включая распознавание объектов на видео, анализ аудиодорожек и синтез голоса с естественной интонацией. Это открывает возможности для создания более интерактивных приложений, таких как голосовые ассистенты с визуальным контекстом или системы автоматизированного контент-модерации.

by meetpateltech • 22 сентября 2025 г. в 17:50 • 522 points

ОригиналHN

#alibaba-cloud#computer-vision#github#gpu#llm#multimodal-ai#natural-language-processing#real-time-processing#speech-recognition#speech-synthesis

Комментарии (132)

  • Обсуждается мультимодальная модель Qwen3 с поддержкой голосового ввода/вывода, переводом в реальном времени и впечатляющими демонстрациями.
  • Участники отмечают её доступность для локального запуска (70GB весов) и потенциал для интеграции в умный дом и другие приложения.
  • Поднимаются вопросы о производительности на разных языках, "нативной поддержке видео" и сравнении с закрытыми моделями типа Gemini.
  • Высказываются опасения о возможном доминировании Китая на рынке открытых AI-моделей и реакции на это со стороны США.
  • Обсуждаются технические аспекты: необходимое железо (GPU), квантование, портирование на macOS и стоимость использования.