研究显示近半数 LLM 基准测试已"饱和" 无法区分模型优劣
发表于 ICML 2026 的一项新研究分析了 60 项 LLM 基准测试,发现近半数已失去区分顶尖模型能力的作用
由 Mubashara Akhtar 和 Anka Reuel 领衔、来自 EvalEval Coalition 项目共 36 位研究者组成的团队,在第 43 届国际机器学习大会(ICML)2026 会议论文集上发表研究,系统性分析了基准测试饱和(benchmark saturation)问题。他们从各大模型厂商的技术报告中选取了 60 项 LLM 基准测试进行研究
研究团队将饱和(saturation)定义为基准测试"失去了在顶尖模型之间进行可靠区分的能力",通俗地说,就是优秀的模型几乎都拿到满分,已经无法分辨谁更强。他们基于排行榜(leaderboard)数据开发了考虑不确定性的(uncertainty-aware)饱和指数用于衡量,并定义了涵盖任务设计、数据构建和评估形式等 14 个维度的基准特征,以检验关于什么因素导致基准测试饱和速度快慢的 5 个假设
分析结果显示,近半数基准测试已呈现饱和迹象,且这一比例随基准测试的年龄增长而上升。一个有趣的发现与业界普遍认知相悖:不公开测试数据(私有测试集)并不能防止饱和;而由专家精心策划题目的基准测试,比众包(由大量人员共同创建数据)的基准测试更能抵抗饱和
独立分析博客 State of AI Substack 总结称,该研究提出了严谨的分析框架,并指出测试集的年龄和规模是预测饱和的重要因素,其影响力超过许多人认为有效的措施,如保密测试数据或对抗式设计。研究团队成员之一 Irene Solaiman 也在 X 上总结道:随着 AI 模型不断进步,大量基准测试正在饱和,无法再有效区分模型
基准测试分数是 AI 公司展示模型实力的工具。如果这些衡量工具已经饱和,依赖这些分数来选型模型的泰国用户和企业可能被误导。这条新闻提醒人们应更具批判性地看待基准分数