OC
同等 AI 能力半年降价 56 倍,下一轮变化来自“把任务跑一万遍”
科技 · 2026-08-22 · AI 产业 · 阅读 1

同等 AI 能力半年降价 56 倍,下一轮变化来自“把任务跑一万遍”

CatalystNeuro 的一项数据整理显示,按 Artificial Analysis Intelligence Index 衡量,2026 年 2 月每项任务需 1.22 美元才能达到的能力水平,如今最低约为 0.022 美元,六个月内下降约 56 倍。作者据此提出:给定能力的成本下降 100 倍,可能只需要一年

作者:陈墨|OC 产业与资本编辑

CatalystNeuro 的一项数据整理显示,按 Artificial Analysis Intelligence Index 衡量,2026 年 2 月每项任务需 1.22 美元才能达到的能力水平,如今最低约为 0.022 美元,六个月内下降约 56 倍。作者据此提出:给定能力的成本下降 100 倍,可能只需要一年左右。

一句话结论:模型进步不只发生在能力天花板,也发生在价格地板;当“够用的智能”便宜两个数量级,最先改变的不是聊天,而是过去因预算无法覆盖的全量扫描任务。

这套分析使用 Artificial Analysis Intelligence Index v4.1.1。指数由九项评测加权组成,其中 Agent 任务占 34%、编码 24%、科学推理 24%、通用能力 18%。成本也不是简单的每百万 token 标价,而是跑一次指数任务时实际产生的输入、推理和输出 token 平均账单。

作者整理了 137 个仍能获得成本数据的模型,重建不同时间点的帕累托前沿。结果显示,指数 40 以上能力的最低成本从 Claude Sonnet 4.6 的每任务 1.22 美元,经过开源模型竞争,降到 GPT-5.6 Luna 高推理强度的 0.022 美元;指数 50 以上的最低成本五个月下降约 35 倍。

原本只能抽样的文献与合同任务转向全量处理

这解释了为何“读一万篇论文”“查完整合同库”“汇总全部论坛线程”突然可行。作者所在团队需要判断约一万篇候选论文是否复用了 DANDI Archive 数据:按当前价格,用半年前沿能力跑完整语料只需一百多美元;在几个月前,同等工作要数千美元,一年前则没有同等能力可买。

但 56 倍不是一条无条件的摩尔定律。数据用模型发布日期配当前测得价格重建,历史价格切换并不完整;退役模型覆盖不全;指数是加权平均,同分模型的专业能力可能不同;推理型评测的成本结构也未必代表短对话。作者还单独校正了 GPT-5.6 Luna 7 月 30 日的 80% 降价,这说明竞争事件会突然改变曲线。

关键事实

  • 指标:Artificial Analysis Intelligence Index v4.1.1 与实测每任务成本。
  • 样本:作者整理 137 个有价格和分数的模型。
  • 代表变化:指数 40 级能力从 1.22 美元降至 0.022 美元,约 56 倍。
  • 局限:历史价格、退役模型覆盖和工作负载差异会影响结论。

OC 判断

“更聪明”带来新任务,“更便宜”带来任务覆盖率。企业预算会从少量高价值调用,转向对全部代码、文档和记录持续运行模型。新的瓶颈也会随之出现:验证成本、误报处理、隐私边界和批量错误的放大效应。

为什么重要

  • 对开发者:模型路由与推理强度会成为常规成本控制旋钮。
  • 对企业:以前只能抽样的审查和分析可能转向全量覆盖。
  • 对模型厂商:中低能力区间的价格竞争将快速压缩利润空间。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

从有这个想法,在OC做一个碎碎念 https://x.com/tinyfool/status/2084451008298791131 到做好,https://x.com/tinyfool/status/2084490288681386154 总共花了几个小时,Codex让讨论变得没价值,有想法就先做出来,上线看看,好用就留下,没价值再说,讨论is cheap,let's use ai make it to try

tinyfool 1 0

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

你更喜欢 Codex 还是 Cladue Code?

<p>我先说,我更喜欢 Codex,因为我没用过 Cladue Code。Codex 一直都能很好满足我的需求,所以我不是很有动力去换 Cladue Code。虽然我也知道很多人更喜欢 Cladue Code。但是我觉得应该差不多吧?</p>

tinyfool 5 111