Un estudio revela que casi la mitad de los benchmarks de LLM están "saturados" y ya no miden nada
Una nueva investigación publicada en ICML 2026 analizó 60 benchmarks de LLM y descubrió que casi la mitad ya han perdido la capacidad de distinguir entre los modelos más potentes
Un equipo de investigadores liderado por Mubashara Akhtar y Anka Reuel, junto con 36 coautores del proyecto EvalEval Coalition, publicó un estudio en Proceedings of the 43rd International Conference on Machine Learning (ICML) 2026 que analiza de forma sistemática el problema de la saturación de benchmarks. Para ello, seleccionaron 60 benchmarks de LLM a partir de los informes técnicos de los principales desarrolladores de modelos.
El equipo define la saturación como el momento en que un benchmark "pierde la capacidad de distinguir de forma fiable entre los modelos de mayor rendimiento". Dicho de manera sencilla: los modelos más avanzados obtienen puntuaciones casi perfectas y ya no se puede saber cuál es mejor. Los investigadores desarrollaron un índice de saturación que tiene en cuenta la incertidumbre (uncertainty-aware) basado en datos de los leaderboards, y definieron 14 características de los benchmarks —que abarcan el diseño de las tareas, la creación de datos y los formatos de evaluación— para poner a prueba cinco hipótesis sobre qué factores aceleran o ralentizan la saturación.
El análisis reveló que casi la mitad de los benchmarks ya muestran signos de saturación, y que esta proporción aumenta con la antigüedad del benchmark. Un hallazgo interesante, que contradice la creencia común en el sector, es que mantener en privado los datos de prueba (private test set) no ayuda en absoluto a prevenir la saturación, mientras que los benchmarks con problemas seleccionados por expertos resisten mejor la saturación que los de tipo crowdsourced (creados con la colaboración de un gran número de personas).
State of AI Substack, un blog de análisis independiente, describió el trabajo como un marco de análisis riguroso y señaló que la antigüedad y el tamaño del conjunto de pruebas son los principales predictores de saturación, más que las medidas que muchos creían seguras, como mantener en secreto los datos de prueba o el diseño adversarial. Por su parte, Irene Solaiman, una de las investigadoras del equipo, resumió en X que, a medida que los modelos de IA avanzan, muchos benchmarks se están saturando y ya no logran diferenciar entre modelos.
Las puntuaciones de los benchmarks son lo que las empresas de IA utilizan para presumir de la potencia de sus modelos. Si las herramientas de medición están saturadas, los usuarios y las empresas que eligen modelos basándose en estas puntuaciones pueden dejarse llevar por conclusiones erróneas. Esta noticia sirve de advertencia para leer las puntuaciones de los benchmarks con mayor espíritu crítico.