ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Инструменты/опенсорсVerified

Исследование: почти половина бенчмарков LLM «насытилась» и больше ничего не измеряет

Новая работа, опубликованная на ICML 2026, проанализировала 60 бенчмарков LLM и обнаружила, что почти половина из них утратила способность различать самые сильные модели между собой

📅 5 авг. 2026 г., 04:06
Исследование: почти половина бенчмарков LLM «насытилась» и больше ничего не измеряет

Команда исследователей во главе с Mubashara Akhtar и Anka Reuel, в которую вошли 36 соавторов из проекта EvalEval Coalition, опубликовала работу в Proceedings of the 43rd International Conference on Machine Learning (ICML) 2026, где систематически анализируется проблема benchmark saturation (насыщения бенчмарков). Для исследования они отобрали 60 бенчмарков LLM из технических отчётов крупных разработчиков моделей.

Команда определяет saturation как состояние, когда бенчмарк «теряет способность надёжно различать наиболее производительные модели». Проще говоря, сильные модели набирают почти максимум баллов, и понять, какая из них лучше, уже невозможно. Исследователи разработали uncertainty-aware индекс насыщения (учитывающий неопределённость) на основе данных leaderboard'ов, а также определили 14 характеристик бенчмарков, охватывающих дизайн задач, создание данных и формат оценки, чтобы проверить 5 гипотез о том, что ускоряет или замедляет насыщение.

Анализ показал, что почти половина бенчмарков уже демонстрирует признаки saturation, и эта доля растёт с возрастом бенчмарка. Интересный вывод, противоречащий распространённому в отрасли мнению: сокрытие тестовых данных от публики (private test set) никак не защищает от насыщения, тогда как бенчмарки, задачи для которых отбираются экспертами, устойчивее к saturation, чем созданные в формате crowdsourced (когда данные готовит множество людей).

State of AI Substack, независимый аналитический блог, назвал эту работу строгой аналитической рамкой и отметил, что возраст и размер тестового набора предсказывают saturation сильнее, чем меры, которые многие считали надёжными, — например, секретность тестовых данных или состязательный (adversarial) дизайн. Irene Solaiman, одна из авторов исследования, резюмировала в X: по мере развития ИИ-моделей многие бенчмарки насыщаются и больше не способны различать модели.

Why it matters
Баллы бенчмарков — то, чем ИИ-компании хвалятся, демонстрируя мощь своих моделей. Если измерительные инструменты насытились, пользователи и бизнес в Таиланде, выбирающие модели по этим оценкам, могут быть введены в заблуждение. Эта новость напоминает: к результатам бенчмарков стоит относиться более критично.
#Benchmark#LLM#งานวิจัย AI#ICML

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated