OC
SWE-2 把少走弯路写进训练目标,便宜不能只看一个榜单
科技 · 2026-09-12 · AI 编程模型 · 阅读 0

SWE-2 把少走弯路写进训练目标,便宜不能只看一个榜单

据 Cognition 9 月 10 日公告,SWE-2 在 Kimi K3 基础上进行后训练,把任务成功率与执行成本同时纳入优化。厂商报告其 FrontierCode 1.1 Main 成绩为 50.0%,但不同基准的相对表现并不一致。

作者:林岚|OC 开发者生态编辑

Cognition 9 月 10 日公告,SWE-2 在 Kimi K3 基础上进行后训练,把任务成功率与执行成本同时纳入优化。厂商报告其 FrontierCode 1.1 Main 成绩为 50.0%,但不同基准的相对表现并不一致。

一句话结论:SWE-2 值得关注的不是“又一个第一”,而是把少读无关代码、减少重复尝试也变成训练目标;是否便宜,最终仍要以你自己的任务验收来结账。

编程 Agent 为什么会贵在“还没动手”

让 Agent 修一个小错误,最让人无奈的场面往往不是它不会改,而是它一直在准备改。目录看了一遍又一遍,同一份文件重复读取,计划越来越完整,代码却迟迟没有变化。

这些步骤不是天然浪费。陌生项目中的依赖、约束和历史行为,确实需要调查。问题在于调查是否改变了下一步决策。如果一个动作不会减少不确定性,它就可能只是把谨慎演成了过程。

Cognition 给出的观察是,新模型可以更早聚焦相关代码。在其 FrontierCode 测试中,medium 档首次实质修改的中位步骤由旧模型的 48 步降到 18 步。这是特定测试下的行为统计,不代表任何项目都应该在第十八步开始写代码。来源:模型公告

工程上值得借鉴的是换一个衡量单位:不是问模型读了多少,而是问每次读取排除了什么可能。快速定位真正相关的文件,比盲目缩短上下文更有价值;后者可能省下输入,却在漏掉约束后付出返工成本。

惩罚成本,不等于奖励草率

公告介绍的训练思路,可以理解为“完成任务的收益,减去执行成本的惩罚”,不同推理档位采用不同权重。

这里有一个容易忽略的陷阱:如果只把成本惩罚调高,模型当然可能更便宜——因为它少做了必要工作,成功率也一起下降。这只是沿着原来的取舍曲线移动,并没有得到更好的工具。

真正有意义的进步,是在差不多的预算下完成更多任务,或者以更低预算达到原来的完成水平。对购买方而言,这比一个脱离费用的最高分更接近实际决策。

任务成功率、耗时与成本需要同时衡量的概念图

可以用一个不涉及厂商数据的例子理解:两个方案每次运行的费用不同,但便宜的方案如果经常需要重试和人工重做,平均每个合格补丁的成本未必低。反过来,昂贵模型如果只是让简单任务多想一会,也未必值得默认用于所有工作。

榜单名字相近,也不能拼成一个结论

SWE-2 的发布表中,Terminal-Bench 2.1 和 Terminal-Bench 4 是不同测试,结果不能跨版本直接比较。公告的评估说明还写明,部分成绩采用公开结果,其他使用相应工具框架测得,并选择各模型的最佳推理档位。

因此,榜单既受到模型能力影响,也受到任务分布、执行框架、预算和工具条件影响。“在一个测试接近某模型”不能扩写成“所有软件工程任务都已追平”。

这并不让测试失去价值。公开方法至少允许读者知道该问什么:是否同一套任务?是否同样允许重试?工具失败算不算失败?收费是否采用同一时期的价格?只有这些条件对齐,性价比数字才有可比性。

给团队的更实用做法:先分任务,再分模型

一个内部验收集不必很大,但应该包含真实差异:有明确错误日志的小修补、跨模块行为变更、旧代码兼容任务,以及需要查清业务语义的问题。

对每类任务同时记录通过率、总费用、等待时间和人工接管原因。某模型如果总在数据库变更上漏掉迁移约束,即便平均分很好,也不适合直接承担这类工作;如果它处理重复性修补非常稳定,就可以在这个范围扩大使用。

还应保留“拒绝自动完成”的空间。模型发现需求互相矛盾并停下来提问,可能比迅速提交一份错误补丁更省钱。验收体系如果只奖励完成数量,会把这种正确的谨慎算成失败。

关键事实

  • 发布方:Cognition,SWE-2 为 Kimi K3 衍生后训练模型。
  • 方法重点:同时优化任务完成与执行成本,区分推理档位。
  • 证据边界:主要为厂商披露,不同基准和框架不能混成统一排名。

OC 判断

编程模型的竞争正在从“能不能解决”进入“能否以合理过程解决”。但减少步骤只有在保留必要验证时才是进步。对开发者最有意义的,不是看着 Agent 忙得更少,而是用更少的总投入得到可信的修改。

为什么重要

  • 对开发者:定位质量和验证质量应与代码生成速度一起评估。
  • 对企业:按合格任务成本选型,而非只按 token 单价。
  • 对用户:更快开始编辑,不自动等于更快交付可用结果。

参考来源

相关 Topic

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

一个体会,Codex 这种现代 Agent,每天一个变,几天不用就有新惊喜

<p>当然我说的也包括 Claude Code,新功能日新月异,还有就是 AI 能力提升以后,可以做的东西日新月异。还有各种工作流方法日新月异。</p> <p>更好玩的是,我最近经历过很多次,你跟人介绍现在 Codex 可以做到什么样子,他们都觉得很厉害。但是你现场一演示,他们的震撼就更加完全不同了。所以,这种东西,需要大量的 Workshop 去沟通交流,光看文字很难讲清楚,直播、视频也越来越重要了。</p>

tinyfool 1 89

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15

重返OurCoders

<p>从2014年以来好久没逛过这个谈论了,不知道这个谈论的运营现在怎么样,开发人员是不是原来的人,前端UI做得不太好</p>

梁建溢 5 36