OC
DFlash2推测解码:模型变快开始依赖草稿质量
科技 · 2026-08-20 · 开发者工具 · 阅读 1

DFlash2推测解码:模型变快开始依赖草稿质量

据 Inco AI 发布,DFlash 2 通过并行推测解码提升大模型推理吞吐,官方称相较传统自回归解码可达到约 2.7 至 3.4 倍吞吐提升,并已适配 SGLang、vLLM 等推理框架。

作者 林岚 林岚

Inco AI 发布,DFlash 2 通过并行推测解码提升大模型推理吞吐,官方称相较传统自回归解码可达到约 2.7 至 3.4 倍吞吐提升,并已适配 SGLang、vLLM 等推理框架。

一句话结论: LLM 推理提速不再只靠更大 GPU,也开始靠更聪明的“先猜再验”。

传统自回归解码像一个人逐字写句子:生成一个 token,再生成下一个。推测解码则让小模型或草稿路径提前提出多个候选,主模型再一次性验证。这种方式如果草稿足够接近主模型,就能减少等待;如果草稿质量差,反而会浪费验证成本。

DFlash 2 的重点在于并行草稿和路径选择。它试图解决推测解码常见问题:越往后猜得越不准,收益衰减明显。通过轻量路径选择器和局部卷积等设计,系统希望让草稿在更长片段里保持可用。

草稿路径、主模型验证和吞吐提升之间的流程

这类优化对普通用户看起来只是“回答更快”,但对企业是直接成本问题。同样模型、同样硬件,如果吞吐提升稳定,单位请求成本会下降,延迟预算也更好控。真正要看的是不同任务下收益是否稳定,尤其是代码、长文本和工具调用场景。

关键事实

  • 来源:Inco AI 官方博客
  • 涉及项目:DFlash 2、SGLang、vLLM、Qwen、Muse Glimmer 等
  • 核心事实:DFlash 2 使用并行推测解码提升大模型推理吞吐
  • 关键数字:官方称吞吐提升约 2.7 至 3.4 倍,模型下载量超过 350 万次

OC 判断

  • 推理优化正在从硬件堆叠转向算法和系统协同。
  • 草稿质量会成为推测解码的核心工程指标。
  • 吞吐提升必须按任务类型验证,不能只看平均数。

为什么重要

  • 对开发者:推理框架选择会直接影响线上成本和响应速度。
  • 对企业:算力预算可以通过系统优化缓解,而不是只买更多卡。
  • 对用户:更快响应可能来自推理架构改变,而不只是模型升级。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

从第一份程序员职业至今,已经过了 20 年,现在已经不再亲自写代码了,年初看到 Codex/Claude 火爆,又起心动念开始堆代码,只不过现如果自己亲手写的代码,跟 AI 写的代码放在一起,我开始有种耻感涌上来。是到了把关注点挪到像我这种老登程序员的生活上的时候了。

lgn21st 1 1

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

在我的windows游戏本,也安装了codex,现在叫chatgpt app。然后用遥控的方式操作这个codex去做很多事情,比如以前windows游戏本没空间了,我需要打开steam、gog、战网,然后手工看一堆目录的占用。现在直接用codex做个扫描。然后决定要不要暂时删除某个游戏啥的。 以前要在windows游戏本实验一些必须N卡的AI项目要自己去安装,现在也都交给Codex来做,我就在我习惯的mac环境下遥控即可

tinyfool 0 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

重返OurCoders

<p>从2014年以来好久没逛过这个谈论了,不知道这个谈论的运营现在怎么样,开发人员是不是原来的人,前端UI做得不太好</p>

梁建溢 4 18

测试OurCoders能否发布照片

<p>今天小区的彩虹🌈<img src="https://share.icloud.com/photos/0ebtFydNy8r_gJETON61u4Ybg" alt="图片说明" /></p> <p>看来不能直接发照片,可以把iCloud Link的功能派上用场!</p>

梁建溢 15 45