AI Agent 开始维护科学软件:研究人员从写代码转向证明代码没错
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
据 OpenAI 发布的科学计算实地报告,研究团队在八个以生命科学为主的项目中使用代码 Agent 完成软件维护、性能优化、语言迁移和 GPU 重构。其中五个项目主要使用 Codex,三个同时使用 Codex 与 Claude Code。
一句话结论:代码 Agent 正在把科学家的时间从实现细节转向任务设计和结果验证,但它最危险的失败方式,仍是生成一套能运行、看起来合理、科学上却不正确的代码。
科学软件与普通应用不同。一个网页按钮错位容易被看见,数值算法在边界条件下偏一点,可能安静地影响整批实验结果。很多项目还背负多年历史代码、特殊硬件和稀缺维护者,重构成本高,却又必须保持结果可重复。
OpenAI 的案例显示,Agent 擅长接手范围明确、能用测试和性能指标验收的任务。研究人员不再逐行编写全部实现,而是准备外部文献、参考输出和可测目标,让 Agent 迭代代码。困难最大的往往是最后一段:特殊输入、数值精度、跨平台行为以及与上游项目的兼容。

报告也承认,Agent 会在错误时保持自信。代码通过编译,只能证明语法和类型大致成立;测试通过,也可能是测试与实现共享了同一错误假设。可靠流程需要独立基准数据、守恒量或已知解析解,并由领域专家判断输出是否符合科学意义。
另一个风险是生态碎片化。Agent 很容易为一个实验快速重写依赖,却可能绕开上游维护者,产生无法长期合并的分支。报告因此强调软件 stewardship:把修复贡献回原项目、保留版本和实验记录,比一次性得到更快代码更重要。
关键事实
- 来源:OpenAI 科学计算 Agent 实地报告
- 涉及工具:Codex、Claude Code
- 核心技术:科学软件维护、语言迁移、GPU 重构、数值验证
- 关键数字:八个项目;五个主要用 Codex,三个同时用 Codex 与 Claude Code
OC 判断
这是一份公司实地报告,不是独立、统一控制变量的性能基准。它最有价值的部分不是证明某个 Agent 赢了,而是明确指出工作重心已经变化:实现可以委托,验收不能。团队若没有可靠测试数据和领域专家,Agent 只会更快地产生难以察觉的科学错误。
为什么重要
- 对研究人员:需要把参考数据、容差和失败条件写成可执行验收标准。
- 对维护者:Agent 生成补丁应进入上游评审,避免项目被快速重写成孤岛。
- 对资助机构:软件维护、测试数据和复现基础设施应被视为研究投入。
评论
围绕这篇文章补充信息、提出问题或分享观察。