Vera 芯片很强,NVIDIA 白皮书却把 x86 画错了
作者:林岚|OC 开发者生态编辑
林岚
芯片分析网站 Chips and Cheese 逐项检查 NVIDIA Vera 白皮书后认为,这颗 88 核 Arm 服务器 CPU 的硬件设计和早期性能很强,但 NVIDIA 对传统 SMT、NUMA、跨架构 IPC 和内存带宽的部分解释具有误导性。
一句话结论:Vera 不需要靠把 x86 画成落后架构来证明自己;当白皮书把可配置 NUMA 当成固定缺陷、把编译器测试称为 Agent 基准,再用不可比的性能计数器解释因果时,真实硬件优势反而被营销口径削弱。
Vera 本身有足够多值得关注的设计:88 个自研 Olympus 核心,单核 2MB L2、共享 164MB 末级缓存,八路 LPDDR5X 提供最高 1.2TB/s 带宽。早期 Phoronix 测试的几何平均成绩比 5GHz EPYC 9575F 高约 10%,不过测试范围由 NVIDIA 限制,且没有开放频率和功耗监测。
第一个争议是 SMT。NVIDIA 图示把传统 x86 同时多线程画成两个线程轮流占用流水线,好像会持续留下空闲资源。实际上,不同流水线阶段会按周期选择线程或同时处理两个线程的微操作。Vera 的静态分区可能改善隔离和尾延迟,但不等于天然提高总吞吐。

第二个争议是 NUMA。白皮书称双路 x86 系统可能暴露 32 个 NUMA 域,却没有强调 AMD 平台可配置 NPS0、NPS1、NPS2 或 NPS4。32 个域是追求最大局部性的一个极端选项,不是所有用户被迫面对的默认拓扑。
基准口径也把差距放大。NVIDIA 选取 Python、GCC、LLVM 和 Cppcheck 等 SPEC 组件称作“Agentic benchmarks”,它们确实代表 Agent 会调用的 CPU 程序,却没有覆盖模型推理、工具调度、沙箱启动和网络等待。完整双路整数吞吐分数是 Vera 925、EPYC 9755 为 898,系统差距约 3%;按物理核归一后,Vera 的优势才显著扩大。
内存方面,NVIDIA 测得 EPYC 约 400GB/s,Chips and Cheese 自己则得到约 570GB/s。按后一个数字,Vera 总带宽优势约为 1.9 倍,而不是白皮书图表接近 3 倍。Vera 依然领先,只是主要因为它配置了更高峰值带宽,不足以证明单片 Arm 天然击败芯粒 x86。
关键事实
- Vera 配备 88 个 Olympus 核心、164MB 共享缓存和最高 1.2TB/s 内存带宽
- 早期独立测试显示性能强劲,但测试范围、频率和功耗信息受到限制
- 白皮书把传统 SMT 画成简单时间轮换,并把可配置的 32 NUMA 域当成一般情况
- 完整双路整数吞吐差约 3%,精选且按核心归一的结果可达到约 1.7 至 1.8 倍
OC 判断
厂商白皮书不是论文,更不是中立采购报告。开发者应该分别审查硬件规格、测试方法和解释性结论。Vera 看起来是一颗真正强大的 CPU,但强芯片不应该获得较低的证据标准。
为什么重要
- 对开发者:所谓 Agent 基准要看是否包含完整运行时,而不是只测 Agent 可能调用的四个程序。
- 对企业:跨架构采购应比较系统吞吐、功耗、软件兼容和尾延迟,不能只看按核心归一数字。
- 对行业:营销材料错误描述竞争架构,会让真实创新也难以获得信任。
评论
围绕这篇文章补充信息、提出问题或分享观察。