OC
最强模型只能解决 25.3% 的生产故障:Agent 离真正值班还有多远
科技 · 2026-08-01 · 开发者工具 · 阅读 10

最强模型只能解决 25.3% 的生产故障:Agent 离真正值班还有多远

作者:林岚|OC 开发者生态编辑

作者 林岚 林岚

据最新发布的 ORCA-bench 论文,研究团队让五种前沿代码 Agent 调查一个接近真实生产环境的微服务系统。表现最好的 Agent 在中等难度故障上的根因分析准确率只有 25.3%,到高难度任务降至 10.0%。

一句话结论:会读代码、修测试的 Agent,不等于能接住凌晨三点的生产事故;真正的值班调查需要在不完整报告、数天遥测数据和不断变化的系统状态之间重建因果链,而当前模型大部分时候还做不到。

ORCA-bench 包含 1079 个根因分析任务。测试系统开放了六天、约 50GB 的指标、日志和调用追踪,并提供 Prometheus、Jaeger、OpenSearch、Grafana 等真实接口及完整源码。任务还会改变用户报告的具体程度、发现故障的延迟,以及是否同时发生多个异常。

这和常见代码基准有根本区别。代码题通常把问题、仓库和通过条件放在同一个上下文里;值班工程师拿到的可能只有一句“结账变慢了”,然后要判断延迟来自数据库、缓存、下游 API、部署变更还是监控本身。日志多不等于证据多,几十条异常里可能只有一条与用户故障有关。

生产故障调查从用户报告经过遥测筛选到根因定位的过程

论文给出的失败模式也比总分更值得看。最弱的模型在 40% 的事故报告中编造了不可信的根因;去掉源码访问后,所有模型的各项表现都会下降。这说明遥测并不能独立回答所有问题,Agent 仍要把运行现象和具体实现连起来。

研究团队让 SRE 专家确认标准答案,并用人工复核模型裁判,报告的加权 Cohen's kappa 为 0.90。不过,这仍是一个整理过的公开测试床:每个任务单独调查,代码和监控接口已知,也没有真实公司的权限审批、历史包袱和临时脚本。作者因此认为,测试得到的差距更像生产投入的下限,而不是最坏情况。

这不代表 Agent 对 SRE 没用。它可以先汇总时间线、检索相关部署、生成查询、对照历史事故,并把候选根因交给人。危险的是直接让一个准确率约四分之一的系统决定回滚、扩容或修改数据库。问题不在这里有没有 AI,而在动作权限是否和证据强度绑定。

关键事实

  • 来源:ORCA-bench 论文及公开数据集
  • 测试规模:1079 个任务、六天遥测数据、约 50GB 测试床
  • 关键结果:中等难度最佳准确率 25.3%,高难度 10.0%
  • 重要边界:测试环境比真实生产系统更小、更稳定,而且任务被单独调查

OC 判断

先别急着把 Agent 塞进值班表。当前更合理的位置是“调查助手”,不是“事故指挥官”。团队应要求它展示查询、时间线和证据来源,把停止服务、回滚和写操作留给明确审批;只有在长期回放自家事故并测出稳定表现后,才逐步增加自动化权限。

为什么重要

  • 对开发者:评估运维 Agent 时,要测试脏日志、迟报、并发故障和缺失上下文,而不只是单一错误栈。
  • 对企业:接入生产可观测性会同时扩大数据访问面,准确率评估必须和最小权限一起做。
  • 对工具厂商:比“自动修复”更重要的是给出可复核证据,并在不确定时停下来。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

正在做OC产品频道,支持独立开发者提交自己的app,网站,在OC得到宣传和外链。基础功能已经实现,还有一堆在路上。我们独特的是有一个能力让你把产品的用户写的文章视频也可以列在你的产品页下方。方便更多用户了解,这不是想替代你自己的产品页面,而是帮你把做每个产品页各种复杂的互动都自动化,这个产品页还是可以导流到你自己的产品页的

tinyfool 1 2

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15