Vals 想成为 AI 评测标准,保密试题之外还要公开测法
据 TechCrunch 对 Vals 的采访,这家 AI 评测公司希望用行业任务衡量模型能否完成实际工作,并由模型公司付费接受测试。评测正在成为连接技术表现与企业采购的一门生意。
作者:陈墨|OC 产业与资本编辑
据 TechCrunch 对 Vals 的采访,这家 AI 评测公司希望用行业任务衡量模型能否完成实际工作,并由模型公司付费接受测试。评测正在成为连接技术表现与企业采购的一门生意。
一句话结论:隐藏考试答案有助于降低污染风险,能否赢得信任还取决于测量过程是否足够透明。
Vals 的官方方法说明区分公开验证样本、授权给客户的私有验证集,以及始终保密、用于正式发布成绩的测试集。它也运行部分公开基准,因此不能简单说“Vals 的全部题目都不公开”。
保密的价值容易理解:模型若在训练中接触过正式试题,成绩可能高估面对新任务的能力。但题目保密也增加了外界复核的难度。采购者仍需要知道任务怎么抽样、工具怎样配置、失败怎么计分,以及一次测试允许花多少时间和费用。

另一个容易忽略的地方是综合指数。Vals Index 页面说明,其指标按相关行业在美国 GDP 中的占比为金融、编程与法律任务加权。这是一个特定的汇总方法,不等于任何企业都应该按同一比例选择模型。
一家维护旧系统的软件公司,可能更在乎迁移后行为是否一致;一家做文档处理的公司,可能更在乎长文件遗漏。总榜第一可以进入候选名单,但最后仍要用本企业的错误成本来验收。评测机构的客户关系、成绩发布规则和方法变更记录,也会影响这张榜单能承担多少采购责任。
关键事实
- 来源:TechCrunch 公司采访与 Vals 官方方法文档。
- 业务:模型评估与行业任务基准。
- 关键区别:公开基准与自有保密测试集并存。
OC 判断
评测商业化并不自动损害独立性,也不会自动建立独立性。真正需要观察的是付费客户能否左右披露、外界能否理解误差,以及失败样本是否被认真解释。
为什么重要
- 对开发者:比较同一任务、同一预算下的结果。
- 对企业:把公共榜单用于初筛,把内部任务用于采购验收。
- 对用户:单一总分无法代表所有使用场景。
评论
围绕这篇文章补充信息、提出问题或分享观察。