NVIDIA 不满足于卖 GPU:Vera CPU 要把 Agent 每次“停下来干活”的钱也赚走
陈墨|OC 产业与资本编辑
陈墨|OC 产业与资本编辑
据 NVIDIA 最新技术说明,公司开始详细披露自研 Vera 数据中心 CPU 的架构与性能,称其在满负载下的持续单核性能可达到主流 x86 平台的 1.8 倍。Vera 不只作为 Rubin GPU 机架的配套部件,也会以独立 CPU 服务器进入 AMD EPYC 和 Intel Xeon 长期控制的市场。
一句话结论: Vera 的野心不是用 CPU 替代 GPU,而是把 Agent 调工具、跑代码、处理数据这些 GPU 等待期间的工作也纳入 NVIDIA 的整套系统,从“卖加速卡”进一步走向控制整座 AI 数据中心。
普通聊天模型主要让人盯着 GPU,因为生成 Token 的矩阵运算在那里完成。但 Agent 不会一直生成文字。它会暂停推理,调用搜索、编译代码、启动 Python、查询数据库、解压文件、检查结果,然后把新信息交回模型。每一次暂停,CPU 都可能成为下一轮推理前的瓶颈。

Vera 就是为这个间隙设计的。它有 88 个 NVIDIA 自研 Olympus 核心,采用 Arm 指令集,配套最高 1.2TB/s 的 LPDDR5X 内存带宽,并通过 NVLink-C2C 与 GPU 保持一致性连接。NVIDIA 强调的不是传统服务器最爱讲的核心数量,而是满载时每个核心仍能维持的单线程速度、较低尾延迟,以及同时运行大量沙箱的密度。
这套论述很聪明,也有现实基础。Agent 执行步骤往往有前后依赖:前一个工具没返回,后一个模型调用就不能开始。此时再多 GPU 也只能等。NVIDIA 称 Vera 相比领先 x86 CPU,在编译、代码分析和 Python 等沙箱负载上最高快约 1.8 倍,还能以更低功耗提供更高内存带宽。不过这些数字来自 NVIDIA 自测,测试配置和软件栈决定很大,不能直接理解为所有服务器应用快 80%。
更关键的是商业模式。NVIDIA 过去已通过 CUDA、GPU、NVLink、交换机和整机柜占据 AI 预算的大部分。CPU 原本还是 AMD、Intel 或云厂商自研芯片的地盘。Vera 如果作为 Rubin NVL72 的主机 CPU,又以独立 CPU 机架运行 Agent 沙箱,客户会从训练到工具执行都留在 NVIDIA 的软硬件体系里。对云厂商来说,采购更简单;对竞争和议价来说,则更依赖单一供应商。
AMD 和 Intel 并不会因为一款 Vera 立刻失去通用服务器市场。x86 有庞大的软件兼容性、运维经验和供应链,数据库、虚拟化、企业应用也不是都按 Agent 特征运行。Vera 的真正突破口是新建 AI 集群:这些机器的软件栈本来就在重做,迁移 Arm 的历史包袱较小,而且 GPU 利用率每提高一点都能对应可计算的收入。
市场传出的 5000 美元单价和百万级出货预测仍属于分析师估算,不是 NVIDIA 正式价目表。更可靠的信号是,NVIDIA 已将首批系统交给 Anthropic、OpenAI、Oracle Cloud 和 SpaceXAI,多家服务器厂商也宣布采用。它是否真能挑战 EPYC 和 Xeon,要看 2026 年下半年量产后的独立基准、软件兼容和整机价格,而不是只看一张厂商柱状图。
关键事实
- Vera 使用 88 个 Olympus Arm 核心,配备最高 1.2TB/s 内存带宽,可独立部署或与 Rubin GPU 组成机架。
- NVIDIA 宣称 Agent 沙箱负载最高约为领先 x86 平台的 1.8 倍,数据来自厂商测试。
- Anthropic、OpenAI 和 Oracle Cloud 等已接收早期系统,商业供货计划在 2026 年推进。
OC 判断
Vera 最值得注意的不是又多一款 Arm CPU,而是 NVIDIA 开始把 Agent 的完整计算循环定义成自己的市场。只要“GPU 在等 CPU”能被换算成损失,它就有理由继续吞掉服务器里的下一层利润。
为什么重要
- 对开发者: Agent 性能优化不能只盯模型吞吐,工具执行、编译和数据管线同样影响端到端延迟。
- 对企业: NVIDIA 一体化平台可能提高部署效率,也会增加供应商锁定和迁移成本。
- 对用户: 厂商所说的 1.8 倍是特定沙箱负载,不代表网站、数据库和所有应用都同幅加速。
评论
围绕这篇文章补充信息、提出问题或分享观察。