OC
扩散语言模型不再逐字排队,但并行生成还没免费
科技 · 2026-08-31 · AI 模型与产品 · 阅读 0

扩散语言模型不再逐字排队,但并行生成还没免费

主流大模型按从左到右的顺序一次生成一个 token。扩散语言模型试图打破这条队伍:它先面对一整段被遮住或被噪声扰动的文本,再经过多轮去噪,同时填补多个位置。2026 年集中出现的教程与研究,已经把 masked、block 和 continuous diffusion 串成一条越来越清楚的技术路线。

作者:林岚|OC 开发者生态编辑

主流大模型按从左到右的顺序一次生成一个 token。扩散语言模型试图打破这条队伍:它先面对一整段被遮住或被噪声扰动的文本,再经过多轮去噪,同时填补多个位置。2026 年集中出现的教程与研究,已经把 masked、block 和 continuous diffusion 串成一条越来越清楚的技术路线。

一句话结论:扩散模型让文本生成顺序变得可设计,也可能在合适硬件上并行产生多个 token;但每一轮往往要重新计算大量位置,采样轮数、缓存效率和可变长度仍决定它是否真的比自回归模型更快。

Masked diffusion 最直观。训练时随机遮住一部分 token,让双向 Transformer 复原原文;生成时从全遮罩序列出发,反复“填空—重新遮罩”,每轮保留更多高置信结果。这让模型可以利用左右两侧上下文,也允许后续步骤改写早期猜测。与一个 token 一旦输出便难以回头的自回归模型相比,它天然带有迭代修正的形态。

问题也从这里开始。基础 masked diffusion 通常要预先知道输出长度,而且每轮去噪都可能调用完整网络。一次前向传播能填很多位置,不等于总计算量一定更少。如果需要几十轮才能稳定,或者每轮都重算已经确定的 token,并行优势就会被吞掉。

Block diffusion 选择折中:不一次生成整篇,也不逐 token 前进,而是一次处理一块。已经完成的块可以像自回归模型那样缓存键值,当前块内部则并行去噪。块可以是几十到数百个 token,尺寸越大,潜在并行度越高,但局部推理成本和结果稳定性也更难控制。

自回归、遮罩扩散与分块扩散的生成顺序对比

Continuous diffusion 又把问题推进一步。文本本来是离散 token,连续方法则在嵌入或潜在空间中加噪和去噪,最后再映射回词表。它避免了“噪声只能等于 MASK 吗”的限制,却增加了如何解码、如何保持语义和如何训练稳定的新难题。近期论文也开始从统一视角理解这些方法:自回归、任意顺序填充和分块扩散,并非互不相干的物种,而是对“下一步更新哪些位置”的不同约束。

硬件是另一半答案。自回归推理经常受制于内存带宽:每产生一个 token 都要搬运模型参数。扩散模型若能在一次参数访问中更新多个 token,理论上可以提高计算密度。但这项优势依赖模型架构、批量、序列长度和采样步数,不应直接被翻译成固定倍数的速度承诺。现有开源模型已经证明路线可用,却还没有证明所有工作负载都该迁移。

真正值得关注的是“生成顺序”成为新的优化轴。代码补全可能希望先确定括号和结构,再填局部变量;受约束生成可以先固定必须出现的字段;生物序列则可能按相互作用范围选择块大小。这些任务未必追求聊天窗口里的最高 tokens/s,却可能受益于双向条件、局部重写和可控采样。

关键事实

  • Masked diffusion 以随机遮罩训练,从全遮罩序列经多轮填充生成文本。
  • 基础方法常受固定长度、全网重复计算和采样轮数限制。
  • Block diffusion 用分块生成兼顾可变长度和 KV 缓存;continuous diffusion 则在连续表示空间去噪。

OC 判断

扩散语言模型目前更像对自回归默认设置的系统性挑战,而不是已经完成替代。它最重要的贡献,是把“文本必须左到右生成”从自然规律降格为工程选择。接下来要看的不是演示中能否同时吐出多个词,而是在相同质量、延迟、吞吐和成本口径下,它是否仍有优势。

为什么重要

  • 对模型开发者:生成顺序、块大小和采样策略成为新的架构与后训练空间。
  • 对应用开发者:约束生成、代码修正和结构化输出可能比普通聊天更早受益。
  • 对算力产业:若一次参数访问能更新多个 token,推理瓶颈可能从内存搬运转向有效计算。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 1

正在做OC产品频道,支持独立开发者提交自己的app,网站,在OC得到宣传和外链。基础功能已经实现,还有一堆在路上。我们独特的是有一个能力让你把产品的用户写的文章视频也可以列在你的产品页下方。方便更多用户了解,这不是想替代你自己的产品页面,而是帮你把做每个产品页各种复杂的互动都自动化,这个产品页还是可以导流到你自己的产品页的

tinyfool 1 2

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

一个体会,Codex 这种现代 Agent,每天一个变,几天不用就有新惊喜

<p>当然我说的也包括 Claude Code,新功能日新月异,还有就是 AI 能力提升以后,可以做的东西日新月异。还有各种工作流方法日新月异。</p> <p>更好玩的是,我最近经历过很多次,你跟人介绍现在 Codex 可以做到什么样子,他们都觉得很厉害。但是你现场一演示,他们的震撼就更加完全不同了。所以,这种东西,需要大量的 Workshop 去沟通交流,光看文字很难讲清楚,直播、视频也越来越重要了。</p>

tinyfool 1 89

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15