OC

Knowledge OS
Claude 14 小时重写 1.6 万行 Go:MirrorCode 测的不是补丁题
科技 · 2026-08-04 · 开发者工具 · 阅读 0

Claude 14 小时重写 1.6 万行 Go:MirrorCode 测的不是补丁题

作者:林岚|OC 开发者生态编辑

作者 林岚 林岚

Epoch AI 与 METR 发布长周期编程基准 MirrorCode,要求 Agent 在看不到原始源码、不能访问互联网的环境,根据程序说明和可观察行为重新实现完整软件。25 个目标程序横跨 Unix 工具、序列化、查询、生物信息、解释器、静态分析、密码学和压缩。

一句话结论:MirrorCode 把评测从“修一个已定位的 Bug”推到“重建一套完整程序”,但它测到的是给足 token、时间和测试反馈后的黑箱兼容能力,不等于 Agent 已能独立维护任意生产代码库。

最吸引眼球的案例是 Claude Opus 4.7 重写生物信息工具 gotree。原项目约 1.6 万行 Go,包含 40 多个命令;Agent 用 14 小时和约 251 美元完成近乎完整的实现。最佳版本通过 2001 项测试的 2000 项,只在一个处理日期注释的边缘命令上失败。

因此,写成“完全重写成功”并不准确。研究团队把它视为接近完美,是因为覆盖了几乎所有约定功能;但严格按端到端输出完全一致的标准,它仍未解决该任务。这个差异正是长项目评测应保留的信息。

公开测试用于开发私有测试负责检查Agent是否只记住表面答案

MirrorCode 也刻意给模型更多预算。普通编程基准常把单题推理费限制在 1 至 10 美元,而这里某次大型任务运行 19 天、花费 2600 美元。排行榜大型任务每次尝试预算可达 100 亿 token,并且每个任务运行三次。能力提升的一部分来自模型,一部分也来自允许它不断试错。

防作弊设计包括断网沙箱、不可见的保留测试和三项完全私有目标。团队开源了 25 个目标的 22 个及评测脚手架。但数据污染仍无法彻底排除:目标来自开源项目,模型可能在预训练见过源码。研究者做了记忆筛查并观察到未命记忆的任务也能成功,这降低了疑虑,却不是证明从未记忆。

MirrorCode 和真实维护还有明显差距。黑箱重实现可以围绕固定行为和测试收敛,生产系统则包含模糊需求、历史兼容、性能、安全、部署和与人协作。更现实的用法是评估迁移、兼容实现和遗留工具替换,而不是据此宣布软件工程已经全自动化。

关键事实

  • 任务形式:无原始源码、无互联网,根据行为重建完整程序
  • 目标规模:25 个程序,覆盖六种实现语言和多个计算领域
  • gotree 案例:约 1.6 万行 Go,14 小时、251 美元,通过 2000/2001 项测试
  • 最大预算:单次运行可持续 19 天、成本约 2600 美元

OC 判断

这个基准比补丁题更接近真实长期任务,但“能重写”仍不同于“能负责”。下一步应测需求变化后的维护、非功能约束、供应链安全和多轮代码评审,而不只是输出是否匹配。

为什么重要

  • 对开发者:Agent 已能处理超出人工逐行检查范围的代码量,验收必须转向测试和行为契约。
  • 对企业:遗留迁移可能先受益,但需要独立性能、安全与许可证审查。
  • 对研究者:必须同时报告 token、时间、费用和测试缺口,不能只给成功率。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论