AMD 把 Helios 推到机架级:挑战 NVIDIA 不再只靠一张 GPU
作者:陈墨|OC 产业与资本编辑
作者:陈墨|OC 产业与资本编辑
据 TechCrunch 报道,AMD 在 Advancing AI 大会上展示了 Helios 机架级 AI 系统,并计划在 2026 年下半年推动合作伙伴批量部署。微软、OpenAI、Meta、Oracle 和 Anthropic 等公司已经公布相关采用计划。
一句话结论:AMD 真正要挑战的不是 NVIDIA 某一张 GPU,而是 NVIDIA 把计算、网络、CPU、软件、供电和散热打包成整套数据中心产品的能力。
Helios 一套设计包含 72 颗 Instinct MI455X GPU、EPYC Venice CPU、Pensando 网络和 ROCm 软件栈。AMD 公布的规格包括 31TB HBM4、1.4 exaFLOPS FP8 和 2.9 exaFLOPS FP4 算力,以及机架内 260TB/s 的聚合互联带宽。
这些数字看起来很强,但要先理解 Helios 是什么。AMD 官方 FAQ 明确写道,Helios 是参考设计,不是一台由 AMD 直接出售的整机。OEM 和 ODM 厂商会依据这份开放机架蓝图生产自己的系统。客户最终拿到的交付质量、网络配置、散热和运维体验,仍取决于合作伙伴。

这正是 AMD 与 NVIDIA 竞争最难的一步。GPU 跑分可以在实验室比较,机架级系统却需要数千个部件一起稳定工作。训练和大规模推理的瓶颈也不只在计算核心,还包括 GPU 之间的数据移动、跨机架网络、内存容量、故障更换和软件调度。
AMD 把开放标准当作突破口。Helios 使用 OCP Open Rack Wide、UALink 和 Ultra Ethernet,试图让客户拥有更多组件和供应商选择。对不愿被 NVIDIA 专有互联和软件栈完全锁定的云厂商,这个方向有吸引力;代价是开放生态往往需要更多集成工作。
AMD 还与 Cerebras 达成合作。Cerebras 计划在自己的数据中心部署 Helios,并让服务器客户配置其晶圆级芯片,用低延迟推理补充 GPU 系统。双方宣称组合方案的每瓦 token 速度可达到竞品五倍,但这仍是厂商口径,尚不能当成独立测试结论。
昨天 OC 报道了 Anthropic 最多 2GW 的 AMD GPU 部署计划。今天的新增事实是,AMD 正把这些大单落到一套可交付的机架架构上。订单证明客户愿意尝试,Helios 则要证明 AMD 能把芯片、网络和软件真正装成稳定系统。
陈墨认为,NVIDIA 的护城河从来不只是 CUDA,也包括客户买回去就能扩成集群的完整交付。Helios 的关键指标不是发布会上的理论峰值,而是今年下半年能交付多少套、ROCm 在真实集群里是否稳定,以及合作伙伴能否把开放标准的选择权变成更低的总体成本。
关键事实
- 来源:AMD、TechCrunch、CNBC
- 涉及公司:AMD、NVIDIA、Cerebras、Microsoft、OpenAI、Meta、Oracle、Anthropic
- 核心技术:Instinct MI455X、EPYC Venice、Pensando、ROCm、UALink、Ultra Ethernet
- 关键数字:72 颗 GPU;31TB HBM4;1.4 EF FP8;2.9 EF FP4;预计 2026 年下半年批量部署
OC 判断
Helios 让 AMD 第一次更像在出售一套 AI 工厂蓝图,而不只是加速卡。它能否真正削弱 NVIDIA,取决于系统交付、网络和软件生态,不取决于一张规格表。
为什么重要
- 对开发者:ROCm 和开放网络标准如果成熟,会增加训练与推理平台的可移植性。
- 对企业:开放机架可能降低单一供应商锁定,但会把更多集成责任转给采购方和系统厂商。
- 对用户:基础设施竞争增加后,AI 服务价格和容量才可能出现更真实的竞争。
评论
围绕这篇文章补充信息、提出问题或分享观察。