OC
编程 Agent 正在替你选择供应商,但推荐结果不是市场份额
科技 · 2026-09-04 · 开发者工具与生态 · 阅读 0

编程 Agent 正在替你选择供应商,但推荐结果不是市场份额

据 Armature 公布的实验,面对支付、邮件、数据库等需求,不同编程 Agent 往往不会选同一个外部服务。研究项目共进行了 16,893 次运行,但首批公开分析使用的是 51 个代码库中的 5,292 个会话,不能把总运行量直接写成有效样本,更不能当成真实开发者采购次数。

作者:林岚|OC 开发者生态编辑

Armature 公布的实验,面对支付、邮件、数据库等需求,不同编程 Agent 往往不会选同一个外部服务。研究项目共进行了 16,893 次运行,但首批公开分析使用的是 51 个代码库中的 5,292 个会话,不能把总运行量直接写成有效样本,更不能当成真实开发者采购次数。

一句话结论:Agent 已经可能影响软件选型的第一步,但实验中的“被选中”既不是市场份额,也不是团队已经授权购买。

模型拿到的不是一张空白采购单

这项实验使用带有依赖锁定文件等上下文的合成代码库,模拟不同语言、行业和开发者类型。交互中的“人类”由模型扮演,结果再由另一套模型流程判断与归类。它适合观察受控条件下的工具选择,却没有覆盖真实组织里的采购审核、历史合同和同事争论。

实验里,三种 Agent 在相同测试单元中全部选中同一工具的比例只有 42%。语言环境也明显影响结果:例如,邮件服务在 TypeScript 与 Python 代码库中的选择分布并不相同。研究还记录了不同 Agent 使用网页搜索的差异。这些都是特定版本、提示和运行环境下的观察,不是产品永远不变的性格。

一个项目已经使用某套 SDK,迁移成本可能比“哪个服务最强”更重要。锁定文件、框架默认示例、现有环境变量,都会成为 Agent 的线索。因此,所谓模型偏好,可能混合了训练材料、当前搜索结果和仓库约束。仅凭最终选择,很难把三者拆开。

文档开始接近采购入口

过去,开发者常常先决定服务,再查接入文档。Agent 工作流可能反过来:先找到一份能完成任务的文档,再把对应服务写进代码。服务商竞争的对象于是多了一层——不是搜索结果里能否出现,而是说明能否被可靠地执行。

这不意味着厂商应该堆满“适合 AI”的宣传句。对实际集成有帮助的是清楚的鉴权方式、可运行但不泄露秘密的示例、费用边界、失败语义和清理资源的方法。Agent 能复制一段成功示例,却不理解重试会重复扣费,文档的转化率越高,事故面可能反而越大。

同一需求经过不同语言上下文选中不同服务,并在最后经过授权关口;AI 生成示意图

对团队来说,仓库内的约束应当比口头偏好更具体。“尽量便宜”不足以指导数据库选择;“必须部署在某区域、已有供应商优先、不得开通收费套餐、生产数据不能外传”才是可以检查的条件。约束还需要落到工具权限,不能只期待模型每次都记住文字。

生成了集成代码,不等于完成了选型

设想 Agent 给项目加上邮件发送功能,顺手选了一个服务。代码能运行,只能说明接入路径大致成立。团队还需要判断发送区域、投递要求、域名配置、日志保留、退订处理,以及将来迁移的代价。这里有些是工程问题,有些是业务责任,不应该被一个安装命令一起带过。

同样,“被频繁提及”与“最后被选中”也不一样。实验中的品牌可能出现在比较或排除过程中。营销部门若把提及量直接解释成需求增长,会把候选名单误当成订单。

更可靠的内部评价,是保存选型理由和被排除的替代方案,要求 Agent 标出哪些依据来自当前文档、哪些只是推断。最终验收也要检查服务是否符合约束,而不是只检查测试有没有变绿。

关键事实

  • 总实验运行数为 16,893;首批分析为 5,292 个会话、51 个代码库。
  • 使用合成项目与模型模拟交互,并非真实采购调查。
  • Agent 选择会随语言、上下文和运行方式变化。
  • 研究衡量推荐与选择行为,不衡量供应商实际收入或市场占有率。

OC 判断

这项实验最有价值的提醒,是选型权正在从一段明确的人类讨论,移动到一次看似普通的任务执行中。企业不必阻止 Agent 提出供应商,但应把“提出方案”“接入测试”“创建账户”“产生费用”拆成不同权限。代码可以自动生成,采购责任不能靠默认值悄悄转移。

为什么重要

  • 对开发者:依赖增加之前,应能解释它为什么符合项目约束。
  • 对服务商:文档的准确性、可执行性和失败说明,正在直接影响分发。
  • 对企业:Agent 采用率上升时,软件资产管理需要覆盖自动引入的外部服务。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

一个体会,Codex 这种现代 Agent,每天一个变,几天不用就有新惊喜

<p>当然我说的也包括 Claude Code,新功能日新月异,还有就是 AI 能力提升以后,可以做的东西日新月异。还有各种工作流方法日新月异。</p> <p>更好玩的是,我最近经历过很多次,你跟人介绍现在 Codex 可以做到什么样子,他们都觉得很厉害。但是你现场一演示,他们的震撼就更加完全不同了。所以,这种东西,需要大量的 Workshop 去沟通交流,光看文字很难讲清楚,直播、视频也越来越重要了。</p>

tinyfool 1 89

重返OurCoders

<p>从2014年以来好久没逛过这个谈论了,不知道这个谈论的运营现在怎么样,开发人员是不是原来的人,前端UI做得不太好</p>

梁建溢 5 36

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15