OC
OpenAI公布内部研究加速数据,代理工时不能直接兑换成科研产出
科技 · 2026-09-07 · AI 研发 · 阅读 0

OpenAI公布内部研究加速数据,代理工时不能直接兑换成科研产出

OpenAI 在 9 月 6 日发布的内部研究加速报告中,把代理用于自身研发的情况搬到了台前:研究人员越来越多地让模型写代码、搭建实验和分析结果。报告提供了运行时间、推理用量和任务分类,但这些仍是公司对内部流程的观测,不是独立机构测出的科研效率倍率。

作者:陈墨|OC 产业与资本编辑

OpenAI 在 9 月 6 日发布的内部研究加速报告中,把代理用于自身研发的情况搬到了台前:研究人员越来越多地让模型写代码、搭建实验和分析结果。报告提供了运行时间、推理用量和任务分类,但这些仍是公司对内部流程的观测,不是独立机构测出的科研效率倍率。

一句话结论:代理已经成为研发投入的重要组成部分,但要判断这笔投入是否划算,需要把运行量、有效实验和最终研究结论分开记账。

报告给出的两个口径尤其容易被标题放大。其一,8 月中旬研究人员每日推理用量按 API 价格折算,中位数超过 600 美元;这是等价价格口径,不能直接当作公司内部现金成本。其二,代理运行时间可折合每个人类工作日约 3.1 个八小时工作日;并行运行能累加出这个数字,它不表示研究员产出自动提高了 3.1 倍。

同一个“小时”,在三张账里含义不同

工程团队熟悉 CPU 时间与墙钟时间的区别。四个进程各跑一小时,会消耗四小时的计算时间,但用户只等了一小时。代理也一样:更多并行尝试可以缩短探索周期,也可能只是同时走进更多死胡同。

因此,第一张账应记录资源:模型调用、实验算力、人员审核和等待时间。第二张账记录过程成果:哪些代码被接受,哪些实验顺利完成,哪些结果通过检查。第三张账才记录研究价值:结论是否新颖、是否能复现、是否改变了后续路线。

这是一种评估建议,并非 OpenAI 已经按这三张账公布了完整数据。它的好处是能解释两个看似矛盾的场景:运行费用上升时,研究周期仍可能缩短;代码提交增加时,可靠结论却未必同步增长。

一个具体例子是消融实验。代理快速补齐十组配置,可能省去很多机械工作;但如果基准设置有误,十组漂亮曲线只是把同一个错误重复了十次。真正增加价值的是发现对照缺失、识别数据泄漏,或让失败实验也能被下一个研究者理解。

人类仍在承担任务定义和纠偏

OpenAI 将当前能力描述为接近“自动化研究实习生”:在研究者定义的任务中开展工作。公司同时承认,在其讨论的较长任务成功案例中,人类介入依然常见。这里的成功样本、任务长度和干预口径都必须保留,不能改写成“长任务已普遍无人完成”。报告与方法说明

这意味着研究劳动很可能发生了重新分配。过去人写脚本、守着实验,如今更多时间花在提出可检验的问题、限定搜索空间和判断结果。部分工作被自动化,另一部分判断的杠杆反而放大了。

如果团队只奖励被代理生成的代码行数,就会鼓励最容易量化的活动。如果奖励“最终证明有用的实验”,又需要接受大量有价值的失败尝试。设计指标的难点,正是不能把科研的不确定性伪装成流水线良品率。

从代理运行到可复现研究,需要逐层验证

加速效应需要一个可信的对照

报告也提醒读者,内部实验算力同时增长。人更熟练、工具更成熟、计算资源更多,都可能带来改进。不能把同期发生的所有增量都归给模型。

对企业研发负责人,更实用的试点方式是挑选任务边界相近的小范围工作:保留原有验收标准,记录代理和人工各自投入,并把返工算进去。尤其应检查一个月后是否还需要人重写、是否出现更多难以维护的实验分支。

还要看组织瓶颈是否移动。如果试验生成速度变快,审批队列、GPU 调度、数据准备和结果复核可能变成新的限制。这个时候继续提高代理并发数,未必能提高整个研发系统的吞吐。

同一家公司让模型参与自己的研究,会形成强烈的正反馈想象。但“工具帮助研究工具”与已经实现可持续的递归自我改进之间,仍隔着因果识别、成果质量和安全约束。这份报告值得重视,恰恰因为它提供了可拆解的过程材料,而不是因为它能终结这些问题。

关键事实

  • 来源:OpenAI 9 月 6 日内部研究加速报告,属于公司自报。
  • 费用口径:600 美元以上是中位每日推理用量的 API 等价价格。
  • 时间口径:3.1 个工作日是累计代理运行量,不是科研产出倍率。
  • 验证重点:任务成功定义、人类介入、算力增长与长期返工。

OC 判断

研发自动化值得用结果衡量,但结果不只是一张胜率图。能否减少完成同等质量研究所需的总成本,能否保留足够的可复现证据,才决定代理投入是在创造生产力,还是制造更昂贵的忙碌。

为什么重要

  • 对研究者:任务拆解与结果判断会成为更重要的能力。
  • 对企业:推理预算应与实验质量、返工和人员时间一起评估。
  • 对读者:运行量和自报使用率能说明采用程度,不能单独证明科学突破。

参考来源

相关 Topic

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

一个体会,Codex 这种现代 Agent,每天一个变,几天不用就有新惊喜

<p>当然我说的也包括 Claude Code,新功能日新月异,还有就是 AI 能力提升以后,可以做的东西日新月异。还有各种工作流方法日新月异。</p> <p>更好玩的是,我最近经历过很多次,你跟人介绍现在 Codex 可以做到什么样子,他们都觉得很厉害。但是你现场一演示,他们的震撼就更加完全不同了。所以,这种东西,需要大量的 Workshop 去沟通交流,光看文字很难讲清楚,直播、视频也越来越重要了。</p>

tinyfool 1 89

你在用 Codex 的什么套餐,我是100美金的,已经想升级了

<p>你们呢?</p> <p>我最近主要是做了很多 Blender mcp 的事情,感觉效果很好,当然同时也很耗费 Token</p>

tinyfool 4 160

你更喜欢 Codex 还是 Cladue Code?

<p>我先说,我更喜欢 Codex,因为我没用过 Cladue Code。Codex 一直都能很好满足我的需求,所以我不是很有动力去换 Cladue Code。虽然我也知道很多人更喜欢 Cladue Code。但是我觉得应该差不多吧?</p>

tinyfool 5 111