同等 AI 能力半年降价 56 倍,下一轮变化来自“把任务跑一万遍”
CatalystNeuro 的一项数据整理显示,按 Artificial Analysis Intelligence Index 衡量,2026 年 2 月每项任务需 1.22 美元才能达到的能力水平,如今最低约为 0.022 美元,六个月内下降约 56 倍。作者据此提出:给定能力的成本下降 100 倍,可能只需要一年
作者:陈墨|OC 产业与资本编辑
CatalystNeuro 的一项数据整理显示,按 Artificial Analysis Intelligence Index 衡量,2026 年 2 月每项任务需 1.22 美元才能达到的能力水平,如今最低约为 0.022 美元,六个月内下降约 56 倍。作者据此提出:给定能力的成本下降 100 倍,可能只需要一年左右。
一句话结论:模型进步不只发生在能力天花板,也发生在价格地板;当“够用的智能”便宜两个数量级,最先改变的不是聊天,而是过去因预算无法覆盖的全量扫描任务。
这套分析使用 Artificial Analysis Intelligence Index v4.1.1。指数由九项评测加权组成,其中 Agent 任务占 34%、编码 24%、科学推理 24%、通用能力 18%。成本也不是简单的每百万 token 标价,而是跑一次指数任务时实际产生的输入、推理和输出 token 平均账单。
作者整理了 137 个仍能获得成本数据的模型,重建不同时间点的帕累托前沿。结果显示,指数 40 以上能力的最低成本从 Claude Sonnet 4.6 的每任务 1.22 美元,经过开源模型竞争,降到 GPT-5.6 Luna 高推理强度的 0.022 美元;指数 50 以上的最低成本五个月下降约 35 倍。

这解释了为何“读一万篇论文”“查完整合同库”“汇总全部论坛线程”突然可行。作者所在团队需要判断约一万篇候选论文是否复用了 DANDI Archive 数据:按当前价格,用半年前沿能力跑完整语料只需一百多美元;在几个月前,同等工作要数千美元,一年前则没有同等能力可买。
但 56 倍不是一条无条件的摩尔定律。数据用模型发布日期配当前测得价格重建,历史价格切换并不完整;退役模型覆盖不全;指数是加权平均,同分模型的专业能力可能不同;推理型评测的成本结构也未必代表短对话。作者还单独校正了 GPT-5.6 Luna 7 月 30 日的 80% 降价,这说明竞争事件会突然改变曲线。
关键事实
- 指标:Artificial Analysis Intelligence Index v4.1.1 与实测每任务成本。
- 样本:作者整理 137 个有价格和分数的模型。
- 代表变化:指数 40 级能力从 1.22 美元降至 0.022 美元,约 56 倍。
- 局限:历史价格、退役模型覆盖和工作负载差异会影响结论。
OC 判断
“更聪明”带来新任务,“更便宜”带来任务覆盖率。企业预算会从少量高价值调用,转向对全部代码、文档和记录持续运行模型。新的瓶颈也会随之出现:验证成本、误报处理、隐私边界和批量错误的放大效应。
为什么重要
- 对开发者:模型路由与推理强度会成为常规成本控制旋钮。
- 对企业:以前只能抽样的审查和分析可能转向全量覆盖。
- 对模型厂商:中低能力区间的价格竞争将快速压缩利润空间。
评论
围绕这篇文章补充信息、提出问题或分享观察。