Grok 4.6 用低价重返模型前沿:基准领先还要过真实任务这一关
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
SpaceXAI 发布 Grok 4.6,重点强化长时间运行的 Agent、代码库分析和交互式应用构建。官方 API 起价为每百万输入 token 2 美元、输出 token 6 美元,快速版本价格翻倍。
一句话结论:Grok 4.6 最值得注意的不是某张榜单上超过了谁,而是在接近前沿模型的评测成绩下维持较低价格;开发者接下来要验证的是,它能否在自己的代码库里稳定工作几十轮,而不是只完成一次漂亮演示。
独立评测机构 Artificial Analysis 给 Grok 4.6 的 Intelligence Index 打出 61 分,与 GPT-5.6 Sol Max 相同,低于 Claude Opus 5 和 Claude Fable 5。该指数是九项测试的组合分数,不等于所有能力并列,更不代表在每种 Agent 框架中都有相同性能。
Grok 4.6 更突出的部分是 Agent 任务。Artificial Analysis 报告其 GDPval-AA v2 Elo 为 1753,Terminal-Bench v2.1 为 88.4%;在长周期知识工作测试 AA-Briefcase 中,它平均使用约 53 轮、约 5 亿输入 token 完成任务,轮数和上下文消耗低于该机构测试的 Claude Opus 5 Max。

但这些数字不能直接拼成“最强且最便宜”。不同模型使用的 Agent 外壳、工具、思考强度和超时规则并不完全一致。xAI 自己公布的部分竞品成绩来自各家公司系统卡或公开榜单,也不是统一环境下的盲测。每百万 token 的价格同样只是账单起点;如果模型频繁重试、读入整个仓库或生成冗长轨迹,低单价仍可能变成高任务成本。
官方称,新模型使用了更长的补充训练、模型生成的推理与工程数据,并用 Grok 4.5 重建监督微调轨迹。它已进入 Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare。真正有意义的新事实是:Grok 不再只靠社交产品分发,而是在主动争夺开发者已经使用的 Agent 入口。
关键事实
- 来源:SpaceXAI、Artificial Analysis
- 核心能力:长周期 Agent、代码分析、应用构建、自测与验证
- 上下文:50 万 token
- API 起价:输入 2 美元、输出 6 美元/百万 token;快速版价格翻倍
OC 判断
Grok 4.6 已经值得进入企业模型候选清单,但还不值得仅凭综合指数替换现有生产模型。先用固定任务集测成功率、总 token、重试次数和人工返工,再谈单价优势。Agent 时代,最便宜的不是 token 报价最低的模型,而是最少把任务做错又重来的模型。
为什么重要
- 对开发者:多了一个价格较低的前沿 Agent 模型,但需要重新验证工具调用和长任务稳定性。
- 对企业:模型采购从单一供应商转向按任务路由,价格竞争会继续加剧。
- 对行业:模型能力差距缩小时,分发入口、推理效率和真实任务成本变得更重要。
评论
围绕这篇文章补充信息、提出问题或分享观察。