Groq 机架进入量产后,NVIDIA 开始把推理流水线拆给不同芯片
NVIDIA 表示 Groq 3 LPX 机架已进入全面量产,将与 Vera CPU 和 Rubin GPU 一起部署到云厂商 Nebius,并于今年稍晚上线。这让此前 200 亿美元资产交易从资本故事进入第一批真实交付。
作者:陈墨|OC 产业与资本编辑
NVIDIA 表示 Groq 3 LPX 机架已进入全面量产,将与 Vera CPU 和 Rubin GPU 一起部署到云厂商 Nebius,并于今年稍晚上线。这让此前 200 亿美元资产交易从资本故事进入第一批真实交付。
一句话结论:NVIDIA 买 Groq 不是要用 LPU 替换 GPU,而是把提示处理、模型计算和逐 Token 解码拆给不同硬件,再把整套系统作为高价低延迟服务出售。
Groq 的架构把大量 SRAM 放到芯片上,减少解码阶段不断访问外部显存造成的等待。CNBC 报道称,单颗 Groq 3 包含 500MB 片上 SRAM,LPX 机架集成 256 颗芯片;NVIDIA 官方资料给出的整机片上 SRAM 为 128GB、扩展带宽 640TB/s。
NVIDIA 引用 Artificial Analysis 基准称系统可达到每秒 3400 Token。这个数字不能直接与所有在线 API 比较:模型规模、量化、并发、上下文长度和测量口径都会改变速度。更可靠的信息是产品定位——LPX 优先解决对交互延迟敏感的 decode,而训练和更通用的推理继续由 GPU 承担。

低延迟为什么值得单独买硬件?Agent 编码、语音和交互式工具会连续等待下一批 Token,吞吐量很高但单请求排队很久,用户仍会觉得慢。NVIDIA 认为云商可以为这类需求设置 premium tier,把更低延迟变成更高单价和服务等级协议。
Nebius 是首个被公开点名的部署方之一。它同时采购 Vera、Rubin 和 Groq 机架,说明 NVIDIA 正把收购技术塞进完整 AI 工厂,而不是单独销售一块新加速卡。三星制造 Groq 芯片,TSMC 制造 NVIDIA GPU,也让供应链从单一代工路径变得更复杂。
竞争也不只在 NVIDIA 内部。AMD 与 Cerebras 组合、OpenAI 的超高速模式等都在争夺低延迟推理。账最后会回到机架利用率和客户付费上:如果只有少数请求愿意为速度加价,专用硬件可能长期闲置;如果 Agent 工作负载成为主流,decode 才会成为独立的大市场。
关键事实
- Groq 3 LPX 已进入全面量产,计划年内在 Nebius 上线。
- 一台机架集成 256 颗 LPU,重点优化低延迟解码。
- NVIDIA 强调 LPU 与 Vera Rubin 配合,而非取代 GPU。
- 每秒 3400 Token 是特定第三方基准,不是所有模型的通用速度。
OC 判断
这次新增事实是量产与客户,不是更大的发布会数字。NVIDIA 正把“GPU 公司”改造成处理器组合供应商,并把每个推理阶段的瓶颈都变成自己的产品。接下来要看 Nebius 的真实服务价格和利用率。
为什么重要
- 对开发者:低延迟模型可能成为单独计价的服务层级。
- 对云厂商:异构机架提升效率,也增加调度和容量规划难度。
- 对芯片行业:专用解码芯片开始进入主流 GPU 平台的产品组合。
评论
围绕这篇文章补充信息、提出问题或分享观察。