两个设置让 ARC-AGI-3 得分从 7.8% 升到 38.3%:基准测到的是模型还是脚手架
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
据 OpenAI 披露,GPT-5.6 Sol 在 ARC-AGI-3 上最初只得到 7.8%,启用“保留推理”和“压缩”两项设置后,得分升至 38.3%,接近该评测给出的人类基准 48%。
一句话结论:模型没有在一夜之间变聪明,变化的是它能否保留过去尝试和压缩长期轨迹;这说明 Agent 基准测量的是模型与运行脚手架的组合,而不是一颗脱离系统的“大脑”。
ARC-AGI-3 要求系统在互动环境中观察、行动、从反馈学习。一次任务可能包含多轮尝试,如果评测工具在每轮后清掉隐藏推理,或上下文过长时简单滚动截断,模型就会忘记已经失败的策略,再次从头摸索。
“保留推理”让后续步骤能够继承此前的内部工作状态;“压缩”则把不断增长的历史整理成更短表示,避免最早但关键的信息被窗口挤出去。两项设置开启后,模型不仅分数上升,输出 token 还减少,说明重复探索下降了。

这会让排行榜更难解释。若一家实验室使用原生 Responses API,另一家使用会清除推理的通用 harness,分数差异可能来自接口。反过来,厂商也可能把大量任务特定工程包装成“模型能力”,让外部团队无法复现。
问题不在应该禁止脚手架。生产环境本来就需要记忆、工具和上下文管理。评测必须分别报告模型版本、推理预算、工具、记忆策略、压缩方式和总成本,读者才能知道提升来自哪里。
38.3% 接近 48% 也不代表模型已经“接近人类通用智能”。人类参考值取决于参与者、训练说明、交互次数和评分方式,只能说明在这套任务中的相对位置。ARC-AGI-3 测试的是在陌生互动环境中发现规则的能力,不覆盖现实工作的知识、可靠性和安全责任。
关键事实
- 来源:OpenAI 技术说明、ARC Prize 项目资料
- 涉及模型:GPT-5.6 Sol
- 核心技术:保留推理、上下文压缩、互动式 Agent 评测
- 关键数字:得分从 7.8% 升至 38.3%,人类参考约 48%
OC 判断
这是一次有价值的评测纠错,也是一记提醒:Agent 能力从来不是单一模型参数。任何“领先数倍”的结论,都应先检查 harness 是否保存状态、怎样截断以及花了多少 token。没有这些信息,榜单比较的是不同实验装置。
为什么重要
- 对开发者:长任务失败可能源于状态管理,不必立刻更换模型。
- 对评测机构:需要同时发布脚手架配置和成本,保证可复现。
- 对用户:更高分数可能依赖特定 API 能力,未必能在其他产品中重现。
评论
围绕这篇文章补充信息、提出问题或分享观察。