OC
vLLM 0.28 不只是支持新模型,推理引擎正在变成分层存储系统
科技 · 2026-08-30 · AI 基础设施 · 阅读 0

vLLM 0.28 不只是支持新模型,推理引擎正在变成分层存储系统

vLLM 0.28.0 合入 584 次提交,来自 270 位贡献者,其中 76 位是首次贡献。版本说明看起来像一张很长的模型支持清单,但真正改变部署方式的主线,是执行阶段拆分、权重卸载和分层 KV 缓存开始同时进入一套推理系统。

作者:林岚|OC 开发者生态编辑

vLLM 0.28.0 合入 584 次提交,来自 270 位贡献者,其中 76 位是首次贡献。版本说明看起来像一张很长的模型支持清单,但真正改变部署方式的主线,是执行阶段拆分、权重卸载和分层 KV 缓存开始同时进入一套推理系统。

一句话结论:vLLM 正从“让 GPU 更高效地吐 token”的服务器,变成一套在计算、显存、主存、磁盘和网络之间安排模型状态的运行时。

新版本继续优化 Kimi K3 和 DeepSeek V4,包括解码上下文并行、融合内核以及面向序列并行的通信方案。Model Runner V2 则推进 E/P/D 分离,也就是把嵌入、预填充和解码阶段按资源特征拆开。预填充更吃计算,解码更受显存带宽和批处理调度影响;把它们分离后,服务商可以独立扩缩容,而不是为最坏情况整套复制实例。

另一个关键变化是权重卸载与多层 KV 缓存。大模型服务的显存不只放参数,还要保存每个会话已经计算过的注意力状态。长上下文和大量并发会让 KV Cache 很快吞掉容量。vLLM 0.28 增加把缓存卸载到磁盘的分层能力,意味着冷会话不必永久占据最昂贵的 GPU 显存,但恢复时会付出 I/O 延迟。

一次请求在预填充、解码和分层缓存中的路径

所以“支持磁盘缓存”不是免费的容量魔法。运营者要确定什么数据留在 GPU、什么下沉到主存或本地盘,以及何时预取回来。热度判断错误,会把省下的显存变成尾延迟;磁盘吞吐不足,也会让长会话恢复卡住。监控指标需要从 tokens/s 扩展到各层命中率、迁移字节数和恢复延迟。

0.28 还推进 speculative decoding,扩展 NVIDIA、AMD ROCm、Intel XPU 和 CPU 支持,并加入 Rust API 前端、gRPC 多模态推理与安全修复。广泛硬件支持很重要,但也增加测试矩阵:同一个模型在不同后端上能启动,不代表数值、吞吐和显存峰值完全一致。

对自建推理的团队,这个版本值得升级前做专项压测。至少要覆盖长短请求混跑、缓存下沉与恢复、prefill/decode 节点故障、模型热切换和多租户隔离。vLLM 的功能越像分布式数据库,运维方法也越不能停留在“进程起来、接口返回 200”。

关键事实

  • 来源:vLLM GitHub 0.28.0 发布说明与官方文档
  • 核心技术:E/P/D 分离、权重卸载、分层 KV Cache、推测解码
  • 硬件范围:NVIDIA、AMD ROCm、Intel XPU、CPU
  • 社区规模:584 次提交、270 位贡献者、76 位首次贡献者

OC 判断

推理优化的下一阶段不是再挤出一个漂亮的单卡数字,而是管理不同成本和速度的状态层。vLLM 0.28 把这条路线说得很清楚:模型服务正在获得数据库式的分层存储与调度问题。收益很真实,复杂度也很真实。

为什么重要

  • 对开发者:新模型能更快进入统一服务层,但升级必须验证 API 与数值兼容。
  • 对平台团队:容量规划要同时考虑显存、主存、磁盘和网络,而非只数 GPU。
  • 对行业:开源推理引擎正在承担越来越多云厂商内部运行时才有的职责。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 1

正在做OC产品频道,支持独立开发者提交自己的app,网站,在OC得到宣传和外链。基础功能已经实现,还有一堆在路上。我们独特的是有一个能力让你把产品的用户写的文章视频也可以列在你的产品页下方。方便更多用户了解,这不是想替代你自己的产品页面,而是帮你把做每个产品页各种复杂的互动都自动化,这个产品页还是可以导流到你自己的产品页的

tinyfool 1 2

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

一个体会,Codex 这种现代 Agent,每天一个变,几天不用就有新惊喜

<p>当然我说的也包括 Claude Code,新功能日新月异,还有就是 AI 能力提升以后,可以做的东西日新月异。还有各种工作流方法日新月异。</p> <p>更好玩的是,我最近经历过很多次,你跟人介绍现在 Codex 可以做到什么样子,他们都觉得很厉害。但是你现场一演示,他们的震撼就更加完全不同了。所以,这种东西,需要大量的 Workshop 去沟通交流,光看文字很难讲清楚,直播、视频也越来越重要了。</p>

tinyfool 0 0