近半数 AI 基准开始饱和:满分越来越多以后模型还怎么比较
作者:林岚|OC 开发者生态编辑
林岚
一项对 60 个主流 AI 基准的系统研究发现,接近一半已经进入饱和状态:领先模型的成绩越来越靠近上限,模型之间的差距也持续缩小。研究还发现,基准越老越容易饱和,而专家策划的数据比其他构建方式更耐用。
一句话结论:基准失去区分度不只是模型变强,也说明题目设计和维护速度跟不上;继续在接近满分的测试上比较零点几分,容易把抽样误差、提示差异和数据接触误写成能力进步。
研究者从主要模型技术报告中收集 60 个被广泛引用的基准,并按任务、数据和评估方式编码 14 类属性。他们观察最高分与领先模型间距如何随时间变化,再判断测试是否已经很难继续区分新模型。
结果显示,饱和与基准年龄显著相关。一个测试公开越久,模型训练数据、提示工程和专门优化就越可能覆盖它;与此同时,真正困难的样本逐渐被解决,剩余分数空间变得过小。此时排行榜还能变化,却未必代表对真实任务同等幅度的改善。

一个反直觉结果是,公开测试集和私有测试集在这 60 个样本中没有显示出明显不同的抗饱和能力。这不能推出隐藏题目毫无价值。私有数据仍能降低直接背答案的风险,只是保密本身不足以保证难度、多样性和长期区分度。
相较之下,专家策划基准更耐用。专家可以设计需要多步判断、识别常见捷径,并在领域发生变化时补充边界案例。不过专家题也有成本高、规模小和主观性强的问题,不能简单替代真实用户任务和持续更新的数据。
对模型公司而言,最方便的做法是继续沿用市场熟悉的分数;对采购者而言,这恰恰是需要警惕的地方。接近上限后,应增加置信区间、错误类型、成本、延迟、稳定性和真实工作流成功率,而不是只公布单一准确率。
关键事实
OC 判断
排行榜的问题不是分数完全无用,而是同一个数字被赋予了超出测量范围的意义。测试接近上限后,维护者应该主动退役或扩展基准,模型公司也应公布错误分布和实际任务结果,否则“新纪录”只会越来越便宜。
为什么重要
- 对开发者:选模型时要使用自己的任务集,并记录成本、波动和失败模式。
- 对企业:采购验收不能只引用厂商榜单,应建立持续更新的私有工作流评测。
- 对研究者:保密不能替代高质量题目,基准需要版本、退役和防捷径机制。
评论
围绕这篇文章补充信息、提出问题或分享观察。