OC

Knowledge OS
近半数 AI 基准开始饱和:满分越来越多以后模型还怎么比较
科技 · 2026-08-05 · AI 评测 · 阅读 0

近半数 AI 基准开始饱和:满分越来越多以后模型还怎么比较

作者:林岚|OC 开发者生态编辑

作者 林岚 林岚

一项对 60 个主流 AI 基准的系统研究发现,接近一半已经进入饱和状态:领先模型的成绩越来越靠近上限,模型之间的差距也持续缩小。研究还发现,基准越老越容易饱和,而专家策划的数据比其他构建方式更耐用。

一句话结论:基准失去区分度不只是模型变强,也说明题目设计和维护速度跟不上;继续在接近满分的测试上比较零点几分,容易把抽样误差、提示差异和数据接触误写成能力进步。

研究者从主要模型技术报告收集 60 个被广泛引用的基准,并按任务、数据和评估方式编码 14 类属性。他们观察最高分与领先模型间距如何随时间变化,再判断测试是否已经很难继续区分新模型。

结果显示,饱和与基准年龄显著相关。一个测试公开越久,模型训练数据、提示工程和专门优化就越可能覆盖它;与此同时,真正困难的样本逐渐被解决,剩余分数空间变得过小。此时排行榜还能变化,却未必代表对真实任务同等幅度的改善。

公开时间策划方式和题目难度共同影响基准还能区分模型多久

一个反直觉结果是,公开测试集和私有测试集在这 60 个样本没有显示出明显不同的抗饱和能力。这不能推出隐藏题目毫无价值。私有数据仍能降低直接背答案的风险,只是保密本身不足以保证难度、多样性和长期区分度。

相较之下,专家策划基准更耐用。专家可以设计需要多步判断、识别常见捷径,并在领域发生变化时补充边界案例。不过专家题也有成本高、规模小和主观性强的问题,不能简单替代真实用户任务和持续更新的数据。

对模型公司而言,最方便的做法是继续沿用市场熟悉的分数;对采购者而言,这恰恰是需要警惕的地方。接近上限后,应增加置信区间、错误类型、成本、延迟、稳定性和真实工作流成功率,而不是只公布单一准确率。

关键事实

  • 研究覆盖 60 个主要模型技术报告常用的 AI 基准
  • 接近一半被判断已经饱和,且基准年龄与饱和程度相关
  • 专家策划的数据集表现出更强的抗饱和能力
  • 在这组样本,测试集公开或私有与饱和没有显著关联

OC 判断

排行榜的问题不是分数完全无用,而是同一个数字被赋予了超出测量范围的意义。测试接近上限后,维护者应该主动退役或扩展基准,模型公司也应公布错误分布和实际任务结果,否则“新纪录”只会越来越便宜。

为什么重要

  • 对开发者:选模型时要使用自己的任务集,并记录成本、波动和失败模式。
  • 对企业:采购验收不能只引用厂商榜单,应建立持续更新的私有工作流评测。
  • 对研究者:保密不能替代高质量题目,基准需要版本、退役和防捷径机制。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论