GPT-6.1 Sol 把高端模型价格打下来,企业仍要算每次任务的总账
据 TechCrunch 报道,OpenAI 在 9 月 29 日 DevDay 发布 GPT-6.1 Sol,称其在编程、计算机操作和专业工作等任务上接近 GPT-6 Astra,同时降低标准输入输出价格。
作者:陈墨|OC 产业与资本编辑
据 TechCrunch 报道,OpenAI 在 9 月 29 日 DevDay 发布 GPT-6.1 Sol,称其在编程、计算机操作和专业工作等任务上接近 GPT-6 Astra,同时降低标准输入输出价格。
一句话结论:便宜的高能力模型会扩大 Agent 的使用范围,但企业应比较任务成功率、重试和工具调用后的总成本。
模型价格下降,最直接的变化是过去需要慎重分配的高能力调用,可以进入更多日常流程。代码修改、资料整理、浏览器操作都可能从偶尔使用,变成默认工作步骤。不过,“接近 Astra”是 OpenAI 对特定评测结果的描述,不能直接推导为两者在每个企业任务中可以无差别互换。
TechCrunch 引述的公司数据还显示,低推理档位下的事实错误率从上一代的 11.4% 降到 7.7%。它说明同一评测中的改进,不能理解为所有回答都具有 92.3% 的事实可靠性。评测材料、错误定义和任务分布都会影响这个数字;企业数据库查询与开放网页问答也不是同一种工作。
官方 API 文档列出的标准价格为每百万输入 token 2 美元、输出 token 10 美元,默认推理档位是 medium。长上下文、缓存、运行模式等条件还会影响实际账单。接入团队需要按照自己的输入长度和输出习惯测算,而不是只把首页价格乘以调用次数。官方模型文档

一次任务的费用通常超过模型返回一段文本的费用。Agent 可能读取多轮文件、调用浏览器、重复运行测试;一个价格更低但经常需要重试的配置,最终未必更省。反过来,如果新模型减少了返工,即使单次输出更长,整个流程仍可能更划算。
这也是为什么模型升级应该有一组真实工作样本:从旧版本复制相同输入,记录完成时间、人工修订量、调用总量和失败原因。对于可以修改文件或操作外部服务的 Agent,还应把授权越界单独统计。公司在安全测试中没有观察到某类行为,并不等于真实部署可以省略权限限制。
关键事实
- 来源:TechCrunch 的 DevDay 报道与 OpenAI API 文档。
- 涉及公司:OpenAI。
- 核心技术:面向代码、计算机操作及专业任务的推理模型。
- 关键数字:标准输入与输出分别为每百万 token 2 美元、10 美元;错误率改进属于公司评测。
OC 判断
GPT-6.1 Sol 值得关注的地方,是高能力模型开始向高频工作下沉。采购和接入的衡量单位也应随之变化:从“买了哪一档模型”转向“花多少钱完成了一件经过验收的工作”。
为什么重要
- 对开发者:可以扩大测试范围,同时保留稳定的模型版本与回退路径。
- 对企业:把重试、审核和工具调用计入成本,才能判断是否适合替换现有配置。
- 对用户:响应质量可能改善,重要事实仍需要来源支持。
评论
围绕这篇文章补充信息、提出问题或分享观察。