OC
ARC-AGI-3 公开题接近 99 分:先别庆祝,真正的考试还没开始
科技 · 2026-07-17 · AI / 模型评测 · 阅读 18

ARC-AGI-3 公开题接近 99 分:先别庆祝,真正的考试还没开始

林岚|OC 开发者生态编辑

林岚|OC 开发者生态编辑

Schema 团队在项目页面公布,其系统在 ARC-AGI-3 的公开交互游戏上取得 98.98% 的 RHAE 分数。这个数字非常醒目,但 ARC Prize 官方把公开游戏用于开发和熟悉环境,最终能力需要在未公开的私有游戏上评估。

一句话结论: 98.98% 说明团队很会解决已公开的 ARC-AGI-3 环境,不说明系统已经通过私有测试,更不说明 AGI 已被实现。

ARC-AGI-3 不再只是看几张格子图猜答案,而是让 Agent 操作陌生小游戏。系统要通过动作观察反馈、推断规则,再尽量高效地完成目标。RHAE 会同时考虑任务成功和行动效率,所以它比单纯“过了几关”更严格。

问题出在公开集的角色。公开关卡会被所有研究者反复观察、调试和针对性优化。一个系统可以真正学到通用探索方法,也可以混入关卡特化策略,甚至利用环境漏洞。只看最终分数,很难分辨两者各占多少。

已经有研究者对公开集提出强烈警告。一篇分析认为,25 个公开游戏中的许多可以通过简单、非智能策略取得很高成绩,其中一个坐标处理问题甚至能绕过 18 个游戏。另一项可执行世界模型研究在公开集上的平均 RHAE 为 32.58%,同时明确表示私有集仍未测试。这些差异恰好说明,同一个榜单数字背后的方法可能完全不同。

公开开发集与私有测试集的区别

关键事实

  • Schema 报告的是 ARC-AGI-3 公开游戏上的 98.98% RHAE。
  • ARC Prize 保留了 55 个私有游戏,用来评估系统面对真正未知环境时的泛化能力。
  • 公开集可用于开发,因此高分可能同时包含通用能力、人工经验和关卡特化。
  • 有论文指出公开环境存在可被简单策略或实现漏洞利用的问题。

OC 判断

Schema 的成绩值得报道,因为接近满分的公开集结果会迫使基准设计者检查题目、评分和漏洞,也让其他团队看到哪些工程方法有效。但把它写成“AGI 基准被攻克”,就把开发集当成了高考真题提前泄露后的模拟成绩。

真正决定含金量的有三件事:系统能否在没有人为查看的新游戏上保持表现;是否限制每关的调试和计算预算;修复已知漏洞后成绩还能剩多少。私有集结果出来前,最准确的说法就是“公开集接近满分”。

为什么重要

  • 对研究者: 必须区分公开开发分数与私有泛化能力,并披露调试和计算预算。
  • 对企业: 基准高分不能直接换算成产品在陌生业务中的可靠性。
  • 对普通读者: 标题里的“99%”不是人类智能完成度,更不是 AGI 的百分比。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

OC有3万多注册用户,但是这些人哪些活跃,哪些不活跃?哪些发过帖子,哪些没有,其实以前都很麻烦去计算。这两天想了下,在后台,加入了注册用户细分的界面,然后一下子一目了然了。图片是测试服务器的测试数据,跟真实OC的数据不同步,但是大概可以看一个感觉了。

tinyfool 0 0

正在做OC产品频道,支持独立开发者提交自己的app,网站,在OC得到宣传和外链。基础功能已经实现,还有一堆在路上。我们独特的是有一个能力让你把产品的用户写的文章视频也可以列在你的产品页下方。方便更多用户了解,这不是想替代你自己的产品页面,而是帮你把做每个产品页各种复杂的互动都自动化,这个产品页还是可以导流到你自己的产品页的

tinyfool 1 2

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

一个体会,Codex 这种现代 Agent,每天一个变,几天不用就有新惊喜

<p>当然我说的也包括 Claude Code,新功能日新月异,还有就是 AI 能力提升以后,可以做的东西日新月异。还有各种工作流方法日新月异。</p> <p>更好玩的是,我最近经历过很多次,你跟人介绍现在 Codex 可以做到什么样子,他们都觉得很厉害。但是你现场一演示,他们的震撼就更加完全不同了。所以,这种东西,需要大量的 Workshop 去沟通交流,光看文字很难讲清楚,直播、视频也越来越重要了。</p>

tinyfool 1 89

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15

你在用 Codex 的什么套餐,我是100美金的,已经想升级了

<p>你们呢?</p> <p>我最近主要是做了很多 Blender mcp 的事情,感觉效果很好,当然同时也很耗费 Token</p>

tinyfool 4 160