Grok 4.7 保持 token 单价,长任务升级仍要看每次完成花多少钱
据 xAI 发布公告,Grok 4.7 重点改进长时间编码与知识工作,标准价格仍从每百万输入 token 2美元、输出 token 6美元起。公司称,新模型更擅长检查自己的工作并管理较长上下文。
作者:林岚|OC 开发者生态编辑
据 xAI 发布公告,Grok 4.7 重点改进长时间编码与知识工作,标准价格仍从每百万输入 token 2美元、输出 token 6美元起。公司称,新模型更擅长检查自己的工作并管理较长上下文。
一句话结论:单价不变可以降低尝试门槛,真实性价比要把任务完成率、重试和验证成本一起算进去。
此前 OC 在《Grok 4.6 用低价重返模型前沿:基准领先还要过真实任务这一关》中讨论过价格与基准的关系。此次新增的是4.7模型与更长任务训练方向,旧版本的判断需要用新版本在同一工作负载上的表现更新。
发布方给出的 CursorBench 4.0 分数由4.6的40.4%升至4.7的46.3%。比较同时使用了不同推理档位,因此不宜把差异全部归因于同等计算预算下的模型改进。厂商表格提供的是选测线索,不能代替团队自身评估。

开发者文档还区分标准版本与 Fast 版本:后者使用更快服务基础设施,价格为标准版两倍,当前仅在 Cursor 和 Grok Build 提供,不在公开 xAI API 中提供。读者不能因为发布稿提到高速版,就假定任意 API 客户端都能调用。
对长任务来说,token 单价只是乘法中的一项。一次任务如果生成更多推理、调用更多工具,或者需要人反复修补,总成本仍可能增加。OC 建议选取真实失败样例,记录达到验收标准前的完整花费,而不只比较第一轮响应。
关键事实
- 标准价格:每百万输入2美元、输出6美元起,以官方当期文档为准。
- 改进方向:长编码任务、知识工作和自我检查,属于发布方描述。
- 高速版边界:两倍价格,当前提供渠道与标准 API 不同。
OC 判断
模型升级的价值最终应体现在更少返工、更可靠交付或更短等待。对 Agent 而言,能够持续工作更久固然重要,但知道何时已完成、何时需要停下,同样影响成本。
为什么重要
- 对开发者:在固定验收条件下比较整项任务,而不是只比较每百万 token 报价。
- 对团队:记录模型版本与推理档位,避免把不同预算下的结果混在一起。
评论
围绕这篇文章补充信息、提出问题或分享观察。