NVIDIA AVO 在 ARC-AGI-3 公开集拿到满分:这次被测的不只是模型
NVIDIA 宣布其 Agentic Variation Operators(AVO)系统在 ARC-AGI-3 的 25 个公开环境中完成全部 183 个关卡,获得 100.00 RHAE 分数。运行使用 Claude Opus 5,共执行 6,624 次环境动作。
作者:林岚|OC 开发者生态编辑
NVIDIA 宣布其 Agentic Variation Operators(AVO)系统在 ARC-AGI-3 的 25 个公开环境中完成全部 183 个关卡,获得 100.00 RHAE 分数。运行使用 Claude Opus 5,共执行 6,624 次环境动作。
一句话结论:满分说明 Agent 外壳能显著放大模型能力,但它只覆盖公开集,且不是对 AVO 各模块的受控消融,不能写成“通用智能已被解决”。
ARC-AGI-3 与传统静态题库不同。Agent 进入一个没有说明书、规则和显式目标的交互环境,只能尝试动作、观察变化,再推断怎样过关。RHAE 不只看是否完成,还把动作效率与首次接触任务的人类基线比较。因此,记住失败尝试和减少重复探索会直接影响分数。
AVO 原本用于软件工程和 GPU kernel 优化。NVIDIA 称它曾连续运行七天,探索 500 多个优化方向,提交 40 个 kernel 版本;在所测配置中,多头注意力 kernel 相比 cuDNN 最多快 3.5%,相比 FlashAttention-4 最多快 10.5%。这个系统把主 Agent 与监督器分开:前者提出假设、修改和测试,后者观察长期轨迹,在搜索停滞时重新定向;持久记忆则保存实现、评测和分析结果。

迁移到 ARC-AGI-3 后,底层循环没有变,只是工具和反馈从编译器、Profiler 换成环境动作。AVO 以精确的 64×64 文本网格接收观察,没有给模型发送图像。NVIDIA 还对比了 VISTA:同样完成公开集时,后者报告 7,542 次动作,AVO 少约 12%。但两者的观察格式、记忆、上下文和执行后端均不同,这不是严格对照实验。
还有两条必须写在“满分”旁边:ARC Prize 此前报告 Claude Opus 5 的模型级公开集成绩约为 30%,评测设置不同,不能据此把剩余 70% 全归功于 AVO;NVIDIA 的结果也不是半私有或完全私有竞赛集成绩。公开环境允许工程团队反复调试系统,私有集才更能检验泛化。
关键事实
- 成绩:25 个公开环境、183 个关卡、100.00 RHAE。
- 基础模型:Claude Opus 5。
- 动作数:6,624 次环境动作。
- 边界:仅为公开集结果,且没有隔离测量记忆或监督器的单独贡献。
OC 判断
这条新闻最重要的不是“某模型突然满分”,而是模型榜单开始不足以解释 Agent 能力。记忆、工具、反馈和恢复策略正在变成可独立优化的系统层。下一步真正有说服力的证据,是代码公开、私有集成绩和严格消融,而不是再换一个更大的满分标题。
为什么重要
- 对开发者:Agent 可靠性越来越取决于 harness,而不只取决于模型选择。
- 对评测机构:应同时报告模型、系统配置、动作预算和私有集表现。
- 对企业:长时程自动化需要持久状态与监督机制,单轮提示远远不够。
评论
围绕这篇文章补充信息、提出问题或分享观察。