Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
Apple представила новый SpeechAnalyzer, который в тестах на 5 559 utterance‑ах показал лучшую точность среди всех сравниваемых систем. На чистом наборе LibriSpeech его WER составил 2,12 %, а на шумном — 4,56 %, что вдвое‑трижды лучше, чем у Whisper Small (3,74 % и 7,95 %) и в четыре раза лучше, чем у устаревшего SFSpeechRecognizer (9,02 % и 16,25 %). Модель работает полностью на устройстве, в три раза быстрее, чем Whisper Small, при этом требует в три раза меньше вычислительных ресурсов.
Переход с SFSpeechRecognizer на SpeechAnalyzer оправдан: ошибка в тексте снижается в 3‑4 раза, а качество транскрибирования становится более пунктуационно правильным и заглавным. Для английского распознавания на iPhone или Mac встроенный движок теперь превосходит даже Whisper Small как по точности, так и по скорости, хотя Whisper сохраняет преимущество в поддержке множества языков и кроссплатформенности. Поэтому разработчикам стоит мигрировать сразу, а остальные системы использовать только там, где требуется многоязычность.
Все результаты и исходные транскрипции открыты для проверки: вы можете загрузить JSON‑файлы с WER‑значениями и оценить их самостоятельно, что делает выводы независимыми и публично проверяемыми и легко интегрируемыми.