当 OpenAI、Anthropic 还在比拼下一个 token 预测得有多准时,一场”反自回归”的技术革命正在悄然发生:从完全带噪的文本出发,让模型像还原一幅被马赛克覆盖的画一样,逐步”去噪”生成完整回答。这就是扩散大语言模型(dLLM)。
30 秒快速回答:扩散大语言模型(Diffusion LLM,简称 dLLM)是采用扩散机制生成文本的新一代语言模型架构。它不再逐字从左到右预测下一个 token,而是先把序列全部打上掩码(噪声),再通过多轮迭代并行去噪,逐步还原出完整文本。其核心价值在于:生成速度可达自回归模型的 5-10 倍,支持生成过程中的实时纠错与文本编辑,并天然克服自回归模型”逆转诅咒”(如只会背”2+3=5”却不会回答”5 是几加几”)等固有问题。代表模型有人大与蚂蚁集团开源的 LLaDA、Google 的 Gemini Diffusion,以及全球首个商用扩散 LLM——Inception Labs 的 Mercury。
一、dLLM 的工作原理:从”逐字念稿”到”逐步去马赛克”
自回归 LLM(如 GPT、LLaMA)把一段文本的概率拆解为从左到右的条件概率乘积,解码时必须一个一个 token 顺序输出,前面错了后面就跟着错,无法回头修改。
dLLM 则借鉴了图像扩散模型(如 Stable Diffusion)的思路,但把”高斯噪声”换成了更适合离散文本的”掩码(Mask)”。整个过程分为两个阶段:
- 前向加噪:训练时按随机比例给文本中的 token 打上
[MASK]标记,把干净的句子逐步”污染”成残缺文本。LLaDA 的预训练就是:对每个 token 独立地按概率 t 掩码,让模型学习还原。 - 反向去噪:推理时从一个完全掩码的序列出发,模型利用双向注意力(能看到整段上下文,而非只看到左侧),一次性并行预测所有被掩码的位置;随后按置信度对低把握的 token 再次掩码(remask),继续下一轮迭代,直到 t=0 时得到完整文本。LLaDA 采用”低置信度重掩码”策略,优先保留高置信度的预测,逐步还原出完整文本。
二、dLLM vs 自回归 LLM:一张表看懂差异
| 维度 | 自回归 LLM(GPT/LLaMA) | 扩散 LLM(LLaDA/Gemini Diffusion) |
|---|---|---|
| 生成方式 | 逐 token 顺序解码 | 整段并行迭代去噪 |
| 注意力机制 | 因果掩码(只看左侧) | 双向注意力(看全上下文) |
| 推理速度 | 受顺序解码瓶颈限制 | 快 5-10 倍(Mercury 超 1000 tokens/s) |
| 纠错能力 | 已生成的错误无法修改 | 迭代中可持续修正低置信度 token |
| 可控编辑 | 弱(只能前缀续写) | 强(支持中间填词、就地编辑、属性控制) |
| 逆转诅咒 | 存在(单向因果建模) | 天然缓解(双向建模) |
| 长文本成本 | 每 token 需完整 KV Cache | 与 KV Cache 不兼容,全注意力计算开销大 |
| 复杂多步推理 | 成熟(链式思考强) | 仍在追赶(需专门推理增强,如 d1 用 diffu-GRPO 强化学习) |
三、主流 dLLM 模型一览
| 模型 | 团队/公司 | 亮点 |
|---|---|---|
| LLaDA 8B | 中国人民大学 + 蚂蚁集团 | 首个开源可用的 8B 掩码扩散 LLM,比肩同规模 LLaMA 3,成为 dLLM 研究的基础模型 |
| Gemini Diffusion | Google DeepMind | 生成速度约为此前最快模型的 5 倍,编程性能出色,采样速度可达 1479 tokens/s |
| Mercury | Inception Labs | 全球首个商用扩散 LLM,H100 上超 1000 tokens/s,号称比 GPT-4o mini 快 10 倍 |
| Dream 7B | 香港大学 + 华为诺亚 | 开源扩散 LLM,验证扩散范式在大模型规模下的可行性 |
| Seed Diffusion | 字节跳动 | 高速扩散语言模型 |
| LLaDA-V / MMaDA | 蚂蚁+人大 / 字节跳动 | 扩散多模态 LLM(dMLLM),扩散范式走向多模态 |
四、优势与挑战:扩散范式能取代自回归吗?
四大核心优势:
- 速度革命:并行解码让 Mercury、Gemini Diffusion 实现 1000+ tokens/s 的吞吐,把实时 AI 应用的成本与延迟拉低一个量级。
- 可纠错:迭代去噪机制可中途修正错误 token,降低错误累积与”幻觉”传播。
- 可编辑可控:支持文本中间填词、就地修改、按奖励信号重采样生成,特别适合代码生成、结构化输出与长文编辑。
- 克服逆转诅咒:双向建模让模型在”反向推理”类任务上表现更好(如诗歌补全任务 LLaDA 准确率 89% vs GPT-4o 的 62%)。
三大现实挑战:
- 训练复杂:需要平衡多步去噪损失与掩码调度,LLaDA 8B 预训练计算量约为同规模自回归模型的 2 倍。
- 基础设施不兼容:KV Cache、Flash Attention 等现有推理优化均面向自回归设计,dLLM 的全注意力计算导致”理论上并行、实际上未必快”,需专门优化(如 Fast-dLLM、dLLM-Cache 可带来最高 9 倍加速)。
- 多步推理差距:在数学、逻辑等复杂链式推理上仍落后于成熟的自回归模型,需借助强化学习(如 d1 的 diffu-GRPO)补强。
五、一个直观示例:掩码扩散的”填空式”生成
# 概念示意:dLLM 的并行去噪迭代(非真实模型代码)
sequence = ["[MASK]"] * 8 # 初始:整句全掩码
for step in range(4): # 多轮去噪迭代
probs = model.predict(sequence) # 双向注意力并行预测所有掩码位
sequence = remask_low_confidence(sequence, probs) # 低置信度再掩码
# 最终输出:"扩散大语言模型是文本生成新范式"
这段伪代码展示了 dLLM 与传统逐字生成的核心区别:每一步都在同时刷新整段文本,而非一次只吐一个字。
总结要点
- dLLM 用”掩码 + 迭代去噪”替代”逐 token 预测”,实现并行解码、双向理解与可纠错生成。
- 以 LLaDA、Gemini Diffusion、Mercury 为代表,扩散范式已在 8B 级模型上比肩自回归性能,并在速度上拉开 5-10 倍差距。
- 当前短板在于训练成本、基础设施适配与复杂推理;”自回归 + 扩散”混合路线(如 Block Diffusion)与推理增强(d1、LLaDOU)正在补齐缺口。
- 开发者可优先用 dLLM 做高吞吐生成、代码与结构化输出、文本编辑等场景。
延伸阅读建议:
- LLaDA 论文:《LLaDA: Large Language Diffusion with mAsking》(arXiv:2502.09992)
- Google DeepMind Gemini Diffusion 官方页面
- 综述论文:《Discrete Diffusion in Large Language and Multimodal Models: A Survey》(arXiv:2506.13759)
- d1:基于 LLaDA 的扩散推理增强模型(arXiv:2504.12216)