OpenAI公布内部研究加速数据,代理工时不能直接兑换成科研产出
OpenAI 在 9 月 6 日发布的内部研究加速报告中,把代理用于自身研发的情况搬到了台前:研究人员越来越多地让模型写代码、搭建实验和分析结果。报告提供了运行时间、推理用量和任务分类,但这些仍是公司对内部流程的观测,不是独立机构测出的科研效率倍率。
作者:陈墨|OC 产业与资本编辑
OpenAI 在 9 月 6 日发布的内部研究加速报告中,把代理用于自身研发的情况搬到了台前:研究人员越来越多地让模型写代码、搭建实验和分析结果。报告提供了运行时间、推理用量和任务分类,但这些仍是公司对内部流程的观测,不是独立机构测出的科研效率倍率。
一句话结论:代理已经成为研发投入的重要组成部分,但要判断这笔投入是否划算,需要把运行量、有效实验和最终研究结论分开记账。
报告给出的两个口径尤其容易被标题放大。其一,8 月中旬研究人员每日推理用量按 API 价格折算,中位数超过 600 美元;这是等价价格口径,不能直接当作公司内部现金成本。其二,代理运行时间可折合每个人类工作日约 3.1 个八小时工作日;并行运行能累加出这个数字,它不表示研究员产出自动提高了 3.1 倍。
同一个“小时”,在三张账里含义不同
工程团队熟悉 CPU 时间与墙钟时间的区别。四个进程各跑一小时,会消耗四小时的计算时间,但用户只等了一小时。代理也一样:更多并行尝试可以缩短探索周期,也可能只是同时走进更多死胡同。
因此,第一张账应记录资源:模型调用、实验算力、人员审核和等待时间。第二张账记录过程成果:哪些代码被接受,哪些实验顺利完成,哪些结果通过检查。第三张账才记录研究价值:结论是否新颖、是否能复现、是否改变了后续路线。
这是一种评估建议,并非 OpenAI 已经按这三张账公布了完整数据。它的好处是能解释两个看似矛盾的场景:运行费用上升时,研究周期仍可能缩短;代码提交增加时,可靠结论却未必同步增长。
一个具体例子是消融实验。代理快速补齐十组配置,可能省去很多机械工作;但如果基准设置有误,十组漂亮曲线只是把同一个错误重复了十次。真正增加价值的是发现对照缺失、识别数据泄漏,或让失败实验也能被下一个研究者理解。
人类仍在承担任务定义和纠偏
OpenAI 将当前能力描述为接近“自动化研究实习生”:在研究者定义的任务中开展工作。公司同时承认,在其讨论的较长任务成功案例中,人类介入依然常见。这里的成功样本、任务长度和干预口径都必须保留,不能改写成“长任务已普遍无人完成”。报告与方法说明。
这意味着研究劳动很可能发生了重新分配。过去人写脚本、守着实验,如今更多时间花在提出可检验的问题、限定搜索空间和判断结果。部分工作被自动化,另一部分判断的杠杆反而放大了。
如果团队只奖励被代理生成的代码行数,就会鼓励最容易量化的活动。如果奖励“最终证明有用的实验”,又需要接受大量有价值的失败尝试。设计指标的难点,正是不能把科研的不确定性伪装成流水线良品率。

加速效应需要一个可信的对照
报告也提醒读者,内部实验算力同时增长。人更熟练、工具更成熟、计算资源更多,都可能带来改进。不能把同期发生的所有增量都归给模型。
对企业研发负责人,更实用的试点方式是挑选任务边界相近的小范围工作:保留原有验收标准,记录代理和人工各自投入,并把返工算进去。尤其应检查一个月后是否还需要人重写、是否出现更多难以维护的实验分支。
还要看组织瓶颈是否移动。如果试验生成速度变快,审批队列、GPU 调度、数据准备和结果复核可能变成新的限制。这个时候继续提高代理并发数,未必能提高整个研发系统的吞吐。
同一家公司让模型参与自己的研究,会形成强烈的正反馈想象。但“工具帮助研究工具”与已经实现可持续的递归自我改进之间,仍隔着因果识别、成果质量和安全约束。这份报告值得重视,恰恰因为它提供了可拆解的过程材料,而不是因为它能终结这些问题。
关键事实
- 来源:OpenAI 9 月 6 日内部研究加速报告,属于公司自报。
- 费用口径:600 美元以上是中位每日推理用量的 API 等价价格。
- 时间口径:3.1 个工作日是累计代理运行量,不是科研产出倍率。
- 验证重点:任务成功定义、人类介入、算力增长与长期返工。
OC 判断
研发自动化值得用结果衡量,但结果不只是一张胜率图。能否减少完成同等质量研究所需的总成本,能否保留足够的可复现证据,才决定代理投入是在创造生产力,还是制造更昂贵的忙碌。
为什么重要
- 对研究者:任务拆解与结果判断会成为更重要的能力。
- 对企业:推理预算应与实验质量、返工和人员时间一起评估。
- 对读者:运行量和自报使用率能说明采用程度,不能单独证明科学突破。
评论
围绕这篇文章补充信息、提出问题或分享观察。