OC
NVIDIA AVO 在 ARC-AGI-3 公开集拿到满分:这次被测的不只是模型
科技 · 2026-08-22 · AI Agent · 阅读 2

NVIDIA AVO 在 ARC-AGI-3 公开集拿到满分:这次被测的不只是模型

NVIDIA 宣布其 Agentic Variation Operators(AVO)系统在 ARC-AGI-3 的 25 个公开环境中完成全部 183 个关卡,获得 100.00 RHAE 分数。运行使用 Claude Opus 5,共执行 6,624 次环境动作。

作者:林岚|OC 开发者生态编辑

NVIDIA 宣布其 Agentic Variation Operators(AVO)系统在 ARC-AGI-3 的 25 个公开环境中完成全部 183 个关卡,获得 100.00 RHAE 分数。运行使用 Claude Opus 5,共执行 6,624 次环境动作。

一句话结论:满分说明 Agent 外壳能显著放大模型能力,但它只覆盖公开集,且不是对 AVO 各模块的受控消融,不能写成“通用智能已被解决”。

ARC-AGI-3 与传统静态题库不同。Agent 进入一个没有说明书、规则和显式目标的交互环境,只能尝试动作、观察变化,再推断怎样过关。RHAE 不只看是否完成,还把动作效率与首次接触任务的人类基线比较。因此,记住失败尝试和减少重复探索会直接影响分数。

AVO 原本用于软件工程和 GPU kernel 优化。NVIDIA 称它曾连续运行七天,探索 500 多个优化方向,提交 40 个 kernel 版本;在所测配置中,多头注意力 kernel 相比 cuDNN 最多快 3.5%,相比 FlashAttention-4 最多快 10.5%。这个系统把主 Agent 与监督器分开:前者提出假设、修改和测试,后者观察长期轨迹,在搜索停滞时重新定向;持久记忆则保存实现、评测和分析结果。

主Agent、持久记忆与监督器构成长时程执行框架

迁移到 ARC-AGI-3 后,底层循环没有变,只是工具和反馈从编译器、Profiler 换成环境动作。AVO 以精确的 64×64 文本网格接收观察,没有给模型发送图像。NVIDIA 还对比了 VISTA:同样完成公开集时,后者报告 7,542 次动作,AVO 少约 12%。但两者的观察格式、记忆、上下文和执行后端均不同,这不是严格对照实验。

还有两条必须写在“满分”旁边:ARC Prize 此前报告 Claude Opus 5 的模型级公开集成绩约为 30%,评测设置不同,不能据此把剩余 70% 全归功于 AVO;NVIDIA 的结果也不是半私有或完全私有竞赛集成绩。公开环境允许工程团队反复调试系统,私有集才更能检验泛化。

关键事实

  • 成绩:25 个公开环境、183 个关卡、100.00 RHAE。
  • 基础模型:Claude Opus 5。
  • 动作数:6,624 次环境动作。
  • 边界:仅为公开集结果,且没有隔离测量记忆或监督器的单独贡献。

OC 判断

这条新闻最重要的不是“某模型突然满分”,而是模型榜单开始不足以解释 Agent 能力。记忆、工具、反馈和恢复策略正在变成可独立优化的系统层。下一步真正有说服力的证据,是代码公开、私有集成绩和严格消融,而不是再换一个更大的满分标题。

为什么重要

  • 对开发者:Agent 可靠性越来越取决于 harness,而不只取决于模型选择。
  • 对评测机构:应同时报告模型、系统配置、动作预算和私有集表现。
  • 对企业:长时程自动化需要持久状态与监督机制,单轮提示远远不够。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

从第一份程序员职业至今,已经过了 20 年,现在已经不再亲自写代码了,年初看到 Codex/Claude 火爆,又起心动念开始堆代码,只不过现如果自己亲手写的代码,跟 AI 写的代码放在一起,我开始有种耻感涌上来。是到了把关注点挪到像我这种老登程序员的生活上的时候了。

lgn21st 1 1

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

你在用 Codex 的什么套餐,我是100美金的,已经想升级了

<p>你们呢?</p> <p>我最近主要是做了很多 Blender mcp 的事情,感觉效果很好,当然同时也很耗费 Token</p>

tinyfool 4 160