Исследование Hugging Face: ИИ для распознавания речи не так хорош, а просто заучил стандартные тесты
Свежий отчет Hugging Face показывает, что модели распознавания речи (ASR) показывают высокие результаты в бенчмарках из-за заучивания структуры тестов, а не реальных навыков восприятия на слух.
21 августа 2026 года Hugging Face опубликовал статью «Measuring benchmark optimization in speech recognition», в которой освещается проблема оптимизации бенчмарков в системах автоматического распознавания речи (ASR). В настоящее время такие системы часто набирают настолько высокие баллы в публичных тестах, что кажутся сопоставимыми с человеком, однако это не отражает их реальную эффективность.
Согласно исследованию и анализу, проведенному совместно с Artificial Analysis в отношении 11 открытых (open-source) моделей ASR, было выявлено интересное поведение: эти модели часто расшифровывают аудио в соответствии с тестовым датасетом (например, VoxPopuli), даже если реальный звук в файле не совпадает с текстом в этом наборе.
Кроме того, в исследовании были обнаружены ошибки в эталонных данных (reference errors) тестового набора VoxPopuli, достигающие 40%. Самое шокирующее, что модели с наилучшими результатами повторяли ошибки из этого датасета в 18–30% тестовых случаев.
Для решения этой проблемы авторы рекомендуют разработчикам избегать зависимости исключительно от независимых и одинаково распределенных (IID) тестовых наборов, а вместо этого разделять тестовые данные по временным интервалам (temporal) или по спикерам (speaker), чтобы предотвратить подгонку моделей под конкретные тестовые датасеты.
Это отражает проблему надежности результатов тестирования ИИ, о которой следует помнить тайским разработчикам и пользователям: высокие баллы «на бумаге» могут не соответствовать реальной эффективности при работе с тайским языком.