Hacker News Digest

27 августа 2026 г. в 18:03 • blog.google • ⭐ 321 • 💬 107

OriginalHN

#android#api#gemini-3.5-transcribe#gemini-enterprise-agent-platform#google#google-ai-studio#macos#speech-recognition

Gemini-3.5-Transcribe

Gemini 3.5 Transcribe — это новая модель распознавания речи от Google, обеспечивающая высокую точность и интеллектуальную обработку аудио в реальном времени и для предварительно записанных файлов. Она превосходит традиционные системы, эффективно справляясь с фоновым шумом, дисфлюенциями (например, «эм», «а»), самокоррекциями и сложной терминологией, автоматически форматируя текст и удаляя лишние элементы. Модель поддерживает более 85 языков с учётом акцентов и диалектов, а также распознаёт до трёх спикеров с метками времени и идентификацией говорящих в предварительно обработанном аудио (поддержка большего числа спикеров — экспериментальная).

Ключевые показатели точности: средний показатель ошибок слова (WER) составляет 4,0% для потоковой транскрипции и 2,6% для обработки предварительно записанного аудио, что подтверждается независимыми измерениями Artificial Analysis. Модель точно распознаёт алфавитно-цифровые сущности, такие как почтовые индексы и номера заказов, и поддерживает кастомный словарь для специализированной терминологии. Доступна через два API: потоковый (gemini-3.5-transcribe-live) с субсекундной задержкой для интерактивных приложений и API для обработки файлов (gemini-3.5-transcribe) с атрибуцией спикеров и временными метками. Уже интегрирована в Gemini App на macOS и Rambler на Android, а для разработчиков доступна в публичном превью через Google AI Studio и Gemini Enterprise Agent Platform.