ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Ferramentas/Open SourceVerified

Pesquisa revela que quase metade dos benchmarks de LLM está "saturada" e já não mede nada

Novo estudo publicado no ICML 2026 analisou 60 benchmarks de LLM e descobriu que quase metade perdeu a capacidade de distinguir os melhores modelos entre si

📅 5 de ago. de 2026, 04:06
Pesquisa revela que quase metade dos benchmarks de LLM está "saturada" e já não mede nada

Uma equipe de pesquisadores liderada por Mubashara Akhtar e Anka Reuel, com um total de 36 coautores do projeto EvalEval Coalition, publicou um estudo nos Proceedings of the 43rd International Conference on Machine Learning (ICML) 2026 que analisa sistematicamente o problema da benchmark saturation (saturação de benchmarks). O trabalho selecionou 60 benchmarks de LLM a partir de relatórios técnicos dos principais desenvolvedores de modelos.

A equipe define saturação como o momento em que um benchmark "perde a capacidade confiável de distinguir entre os modelos de melhor desempenho". Em termos simples: os modelos mais avançados já atingem pontuações quase máximas, tornando impossível saber qual é melhor. Os pesquisadores desenvolveram um índice de saturação uncertainty-aware (que leva em conta a incerteza) a partir de dados de leaderboards, e definiram 14 características dos benchmarks — abrangendo design de tarefas, criação de dados e formato de avaliação — para testar cinco hipóteses sobre o que acelera ou retarda a saturação.

A análise revelou que quase metade dos benchmarks já apresenta sinais de saturação, e que essa proporção aumenta com a idade do benchmark. Uma descoberta interessante, que contraria a crença comum no setor, é que manter os dados de teste privados (private test set) não ajuda em nada a prevenir a saturação. Por outro lado, benchmarks com questões selecionadas por especialistas resistem melhor à saturação do que os baseados em crowdsourcing (criados colaborativamente por um grande número de pessoas).

O State of AI Substack, blog independente de análise, resumiu o trabalho como uma estrutura analítica rigorosa, destacando que a idade e o tamanho do conjunto de testes são os principais preditores de saturação — mais do que medidas que muitos consideravam seguras, como manter os dados de teste em sigilo ou usar design adversarial. Já Irene Solaiman, uma das pesquisadoras, resumiu no X que, à medida que os modelos de IA evoluem, muitos benchmarks estão saturando e deixando de conseguir diferenciar os modelos.

Why it matters
As pontuações de benchmarks são o que as empresas de IA usam para exibir a capacidade de seus modelos. Se os instrumentos de medição estão saturados, usuários e empresas que escolhem modelos com base nesses números podem ser induzidos ao erro. Esta notícia serve de alerta para ler as pontuações de benchmarks com mais senso crítico.
#Benchmark#LLM#งานวิจัย AI#ICML

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated