OC
OpenAI 自研 Jalapeño 推理芯片,不拆 Prefill 与 Decode 也想同时要速度和吞吐
科技 · 2026-08-26 · AI 基础设施 · 阅读 0

OpenAI 自研 Jalapeño 推理芯片,不拆 Prefill 与 Decode 也想同时要速度和吞吐

据 OpenAI 公布的首批测试结果,其与 Broadcom 联合开发的首款定制推理芯片 Jalapeño,计划在 2026 年底开始部署进 OpenAI 自己的计算基础设施。

作者:陈墨|OC 产业与资本编辑

OpenAI 公布的首批测试结果,其与 Broadcom 联合开发的首款定制推理芯片 Jalapeño,计划在 2026 年底开始部署进 OpenAI 自己的计算基础设施。

一句话结论:Jalapeño 真正值得看的不是一张“击败 NVIDIA”的跑分图,而是 OpenAI 试图用同一套芯片、内存和网络架构承接提示词处理与逐 Token 生成,把推理成本从采购芯片问题变成全栈调度问题。

大模型推理不是一段均匀的计算。Prefill 阶段要一次处理整段提示词,更吃计算;Decode 阶段逐个生成 Token,更容易被内存带宽和数据搬运限制。市场上常见的优化思路,是让不同硬件分别擅长不同阶段,再通过网络把状态交接过去。昨天我们报道 NVIDIA 开始把推理流水线拆给不同芯片,Jalapeño 给出的却是另一条路线:在一个连通域里放置模型状态和 KV Cache,按阶段启用合适的计算、内存与网络资源,尽量减少跨设备移动。

OpenAI 称,在 InferenceX 测试中,Jalapeño 面向 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T,峰值时每瓦完成的 AI 工作量比对比系统高 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍;高度交互场景中的性能高 2.1 至 4.1 倍。芯片标称功耗为 700W,公司称测试负载下持续功耗不超过 550W。

这些数字需要加三个限定。第一,数据来自 OpenAI 自己的测试,虽然使用公开基准与公开模型,但仍不是第三方在量产集群中的复现。第二,比较按芯片标称功耗归一化,不能直接等同于整机房的电力、散热和网络成本。第三,Jalapeño 还在生产验证和软件成熟阶段,实验室样片的 Pareto 前沿不等于大规模部署后的可用率。

同一推理芯片在提示词处理与逐 Token 生成之间动态分配资源

Jalapeño 还有一层容易被跑分遮住的意义:它是 OpenAI 控制成本结构的工具。公司不仅知道模型需要什么,还掌握 ChatGPT、Codex 和 API 的真实负载,可以把常见序列长度、并发形态、KV Cache 放置和 Agent 多步调用直接反馈给下一代芯片。官方称芯片从设计到 tape-out 用了九个月,并用模型协助电路优化、验证和内核开发;针对部分 GPT‑OSS 注意力与 MoE 模块,AI 生成实现比原有人类专家版本快 1.5 至 1.8 倍,但这个数字只适用于被挑选的模块,不是整模型加速比。

这并不意味着 OpenAI 会停止购买 NVIDIA。官方明确表示仍将广泛部署 NVIDIA 和其他伙伴的加速器。自研芯片更现实的作用,是在高频、可预测的第一方推理负载上获得议价权和成本确定性,并让供应链不再只有一个入口。

关键事实

  • 来源:OpenAI 官方测试、TechCrunch、SemiAnalysis。
  • 合作方:OpenAI 负责架构与负载定义,Broadcom 参与芯片实现和网络,Celestica 参与板卡与机架系统。
  • 测试对象:GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T。
  • 部署状态:仍在生产验证,计划 2026 年底开始进入 OpenAI 基础设施。

OC 判断

Jalapeño 目前证明的是“有竞争力的工程样片和系统方案”,不是 OpenAI 已经取代成熟 GPU 生态。若量产、软件兼容和集群可用率都能跟上,它最大的价值将是降低每次 Agent 任务的总等待和总能耗,而不是赢得单芯片冠军。

为什么重要

  • 对开发者:模型响应速度可能更稳定,但不能从公司跑分直接推导 API 价格会下降。
  • 对企业:自研芯片会改变云端 AI 的供应商议价与容量保障。
  • 对用户:Agent 每一步只快几十毫秒,累积几十步后也可能形成明显体验差异。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

测试OurCoders能否发布照片

<p>今天小区的彩虹🌈<img src="https://share.icloud.com/photos/0ebtFydNy8r_gJETON61u4Ybg" alt="图片说明" /></p> <p>看来不能直接发照片,可以把iCloud Link的功能派上用场!</p>

梁建溢 15 45