OpenAI 自研 Jalapeño 推理芯片,不拆 Prefill 与 Decode 也想同时要速度和吞吐
据 OpenAI 公布的首批测试结果,其与 Broadcom 联合开发的首款定制推理芯片 Jalapeño,计划在 2026 年底开始部署进 OpenAI 自己的计算基础设施。
作者:陈墨|OC 产业与资本编辑
据 OpenAI 公布的首批测试结果,其与 Broadcom 联合开发的首款定制推理芯片 Jalapeño,计划在 2026 年底开始部署进 OpenAI 自己的计算基础设施。
一句话结论:Jalapeño 真正值得看的不是一张“击败 NVIDIA”的跑分图,而是 OpenAI 试图用同一套芯片、内存和网络架构承接提示词处理与逐 Token 生成,把推理成本从采购芯片问题变成全栈调度问题。
大模型推理不是一段均匀的计算。Prefill 阶段要一次处理整段提示词,更吃计算;Decode 阶段逐个生成 Token,更容易被内存带宽和数据搬运限制。市场上常见的优化思路,是让不同硬件分别擅长不同阶段,再通过网络把状态交接过去。昨天我们报道 NVIDIA 开始把推理流水线拆给不同芯片,Jalapeño 给出的却是另一条路线:在一个连通域里放置模型状态和 KV Cache,按阶段启用合适的计算、内存与网络资源,尽量减少跨设备移动。
OpenAI 称,在 InferenceX 测试中,Jalapeño 面向 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T,峰值时每瓦完成的 AI 工作量比对比系统高 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍;高度交互场景中的性能高 2.1 至 4.1 倍。芯片标称功耗为 700W,公司称测试负载下持续功耗不超过 550W。
这些数字需要加三个限定。第一,数据来自 OpenAI 自己的测试,虽然使用公开基准与公开模型,但仍不是第三方在量产集群中的复现。第二,比较按芯片标称功耗归一化,不能直接等同于整机房的电力、散热和网络成本。第三,Jalapeño 还在生产验证和软件成熟阶段,实验室样片的 Pareto 前沿不等于大规模部署后的可用率。

Jalapeño 还有一层容易被跑分遮住的意义:它是 OpenAI 控制成本结构的工具。公司不仅知道模型需要什么,还掌握 ChatGPT、Codex 和 API 的真实负载,可以把常见序列长度、并发形态、KV Cache 放置和 Agent 多步调用直接反馈给下一代芯片。官方称芯片从设计到 tape-out 用了九个月,并用模型协助电路优化、验证和内核开发;针对部分 GPT‑OSS 注意力与 MoE 模块,AI 生成实现比原有人类专家版本快 1.5 至 1.8 倍,但这个数字只适用于被挑选的模块,不是整模型加速比。
这并不意味着 OpenAI 会停止购买 NVIDIA。官方明确表示仍将广泛部署 NVIDIA 和其他伙伴的加速器。自研芯片更现实的作用,是在高频、可预测的第一方推理负载上获得议价权和成本确定性,并让供应链不再只有一个入口。
关键事实
- 来源:OpenAI 官方测试、TechCrunch、SemiAnalysis。
- 合作方:OpenAI 负责架构与负载定义,Broadcom 参与芯片实现和网络,Celestica 参与板卡与机架系统。
- 测试对象:GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T。
- 部署状态:仍在生产验证,计划 2026 年底开始进入 OpenAI 基础设施。
OC 判断
Jalapeño 目前证明的是“有竞争力的工程样片和系统方案”,不是 OpenAI 已经取代成熟 GPU 生态。若量产、软件兼容和集群可用率都能跟上,它最大的价值将是降低每次 Agent 任务的总等待和总能耗,而不是赢得单芯片冠军。
为什么重要
- 对开发者:模型响应速度可能更稳定,但不能从公司跑分直接推导 API 价格会下降。
- 对企业:自研芯片会改变云端 AI 的供应商议价与容量保障。
- 对用户:Agent 每一步只快几十毫秒,累积几十步后也可能形成明显体验差异。
评论
围绕这篇文章补充信息、提出问题或分享观察。