扩散语言模型不再逐字排队,但并行生成还没免费
主流大模型按从左到右的顺序一次生成一个 token。扩散语言模型试图打破这条队伍:它先面对一整段被遮住或被噪声扰动的文本,再经过多轮去噪,同时填补多个位置。2026 年集中出现的教程与研究,已经把 masked、block 和 continuous diffusion 串成一条越来越清楚的技术路线。
作者:林岚|OC 开发者生态编辑
主流大模型按从左到右的顺序一次生成一个 token。扩散语言模型试图打破这条队伍:它先面对一整段被遮住或被噪声扰动的文本,再经过多轮去噪,同时填补多个位置。2026 年集中出现的教程与研究,已经把 masked、block 和 continuous diffusion 串成一条越来越清楚的技术路线。
一句话结论:扩散模型让文本生成顺序变得可设计,也可能在合适硬件上并行产生多个 token;但每一轮往往要重新计算大量位置,采样轮数、缓存效率和可变长度仍决定它是否真的比自回归模型更快。
Masked diffusion 最直观。训练时随机遮住一部分 token,让双向 Transformer 复原原文;生成时从全遮罩序列出发,反复“填空—重新遮罩”,每轮保留更多高置信结果。这让模型可以利用左右两侧上下文,也允许后续步骤改写早期猜测。与一个 token 一旦输出便难以回头的自回归模型相比,它天然带有迭代修正的形态。
问题也从这里开始。基础 masked diffusion 通常要预先知道输出长度,而且每轮去噪都可能调用完整网络。一次前向传播能填很多位置,不等于总计算量一定更少。如果需要几十轮才能稳定,或者每轮都重算已经确定的 token,并行优势就会被吞掉。
Block diffusion 选择折中:不一次生成整篇,也不逐 token 前进,而是一次处理一块。已经完成的块可以像自回归模型那样缓存键值,当前块内部则并行去噪。块可以是几十到数百个 token,尺寸越大,潜在并行度越高,但局部推理成本和结果稳定性也更难控制。

Continuous diffusion 又把问题推进一步。文本本来是离散 token,连续方法则在嵌入或潜在空间中加噪和去噪,最后再映射回词表。它避免了“噪声只能等于 MASK 吗”的限制,却增加了如何解码、如何保持语义和如何训练稳定的新难题。近期论文也开始从统一视角理解这些方法:自回归、任意顺序填充和分块扩散,并非互不相干的物种,而是对“下一步更新哪些位置”的不同约束。
硬件是另一半答案。自回归推理经常受制于内存带宽:每产生一个 token 都要搬运模型参数。扩散模型若能在一次参数访问中更新多个 token,理论上可以提高计算密度。但这项优势依赖模型架构、批量、序列长度和采样步数,不应直接被翻译成固定倍数的速度承诺。现有开源模型已经证明路线可用,却还没有证明所有工作负载都该迁移。
真正值得关注的是“生成顺序”成为新的优化轴。代码补全可能希望先确定括号和结构,再填局部变量;受约束生成可以先固定必须出现的字段;生物序列则可能按相互作用范围选择块大小。这些任务未必追求聊天窗口里的最高 tokens/s,却可能受益于双向条件、局部重写和可控采样。
关键事实
- Masked diffusion 以随机遮罩训练,从全遮罩序列经多轮填充生成文本。
- 基础方法常受固定长度、全网重复计算和采样轮数限制。
- Block diffusion 用分块生成兼顾可变长度和 KV 缓存;continuous diffusion 则在连续表示空间去噪。
OC 判断
扩散语言模型目前更像对自回归默认设置的系统性挑战,而不是已经完成替代。它最重要的贡献,是把“文本必须左到右生成”从自然规律降格为工程选择。接下来要看的不是演示中能否同时吐出多个词,而是在相同质量、延迟、吞吐和成本口径下,它是否仍有优势。
为什么重要
- 对模型开发者:生成顺序、块大小和采样策略成为新的架构与后训练空间。
- 对应用开发者:约束生成、代码修正和结构化输出可能比普通聊天更早受益。
- 对算力产业:若一次参数访问能更新多个 token,推理瓶颈可能从内存搬运转向有效计算。
评论
围绕这篇文章补充信息、提出问题或分享观察。