当 OpenAI、Anthropic 还在比拼下一个 token 预测得有多准时,一场”反自回归”的技术革命正在悄然发生:从完全带噪的文本出发,让模型像还原一幅被马赛克覆盖的画一样,逐步”去噪”生成完整回答。这就是扩散大语言模型(dLLM)。

30 秒快速回答:扩散大语言模型(Diffusion LLM,简称 dLLM)是采用扩散机制生成文本的新一代语言模型架构。它不再逐字从左到右预测下一个 token,而是先把序列全部打上掩码(噪声),再通过多轮迭代并行去噪,逐步还原出完整文本。其核心价值在于:生成速度可达自回归模型的 5-10 倍,支持生成过程中的实时纠错与文本编辑,并天然克服自回归模型”逆转诅咒”(如只会背”2+3=5”却不会回答”5 是几加几”)等固有问题。代表模型有人大与蚂蚁集团开源的 LLaDA、Google 的 Gemini Diffusion,以及全球首个商用扩散 LLM——Inception Labs 的 Mercury。

一、dLLM 的工作原理:从”逐字念稿”到”逐步去马赛克”

自回归 LLM(如 GPT、LLaMA)把一段文本的概率拆解为从左到右的条件概率乘积,解码时必须一个一个 token 顺序输出,前面错了后面就跟着错,无法回头修改。

dLLM 则借鉴了图像扩散模型(如 Stable Diffusion)的思路,但把”高斯噪声”换成了更适合离散文本的”掩码(Mask)”。整个过程分为两个阶段:

  • 前向加噪:训练时按随机比例给文本中的 token 打上 [MASK] 标记,把干净的句子逐步”污染”成残缺文本。LLaDA 的预训练就是:对每个 token 独立地按概率 t 掩码,让模型学习还原。
  • 反向去噪:推理时从一个完全掩码的序列出发,模型利用双向注意力(能看到整段上下文,而非只看到左侧),一次性并行预测所有被掩码的位置;随后按置信度对低把握的 token 再次掩码(remask),继续下一轮迭代,直到 t=0 时得到完整文本。LLaDA 采用”低置信度重掩码”策略,优先保留高置信度的预测,逐步还原出完整文本。

二、dLLM vs 自回归 LLM:一张表看懂差异

维度 自回归 LLM(GPT/LLaMA) 扩散 LLM(LLaDA/Gemini Diffusion)
生成方式 逐 token 顺序解码 整段并行迭代去噪
注意力机制 因果掩码(只看左侧) 双向注意力(看全上下文)
推理速度 受顺序解码瓶颈限制 快 5-10 倍(Mercury 超 1000 tokens/s)
纠错能力 已生成的错误无法修改 迭代中可持续修正低置信度 token
可控编辑 弱(只能前缀续写) 强(支持中间填词、就地编辑、属性控制)
逆转诅咒 存在(单向因果建模) 天然缓解(双向建模)
长文本成本 每 token 需完整 KV Cache 与 KV Cache 不兼容,全注意力计算开销大
复杂多步推理 成熟(链式思考强) 仍在追赶(需专门推理增强,如 d1 用 diffu-GRPO 强化学习)

三、主流 dLLM 模型一览

模型 团队/公司 亮点
LLaDA 8B 中国人民大学 + 蚂蚁集团 首个开源可用的 8B 掩码扩散 LLM,比肩同规模 LLaMA 3,成为 dLLM 研究的基础模型
Gemini Diffusion Google DeepMind 生成速度约为此前最快模型的 5 倍,编程性能出色,采样速度可达 1479 tokens/s
Mercury Inception Labs 全球首个商用扩散 LLM,H100 上超 1000 tokens/s,号称比 GPT-4o mini 快 10 倍
Dream 7B 香港大学 + 华为诺亚 开源扩散 LLM,验证扩散范式在大模型规模下的可行性
Seed Diffusion 字节跳动 高速扩散语言模型
LLaDA-V / MMaDA 蚂蚁+人大 / 字节跳动 扩散多模态 LLM(dMLLM),扩散范式走向多模态

四、优势与挑战:扩散范式能取代自回归吗?

四大核心优势:

  1. 速度革命:并行解码让 Mercury、Gemini Diffusion 实现 1000+ tokens/s 的吞吐,把实时 AI 应用的成本与延迟拉低一个量级。
  2. 可纠错:迭代去噪机制可中途修正错误 token,降低错误累积与”幻觉”传播。
  3. 可编辑可控:支持文本中间填词、就地修改、按奖励信号重采样生成,特别适合代码生成、结构化输出与长文编辑。
  4. 克服逆转诅咒:双向建模让模型在”反向推理”类任务上表现更好(如诗歌补全任务 LLaDA 准确率 89% vs GPT-4o 的 62%)。

三大现实挑战:

  1. 训练复杂:需要平衡多步去噪损失与掩码调度,LLaDA 8B 预训练计算量约为同规模自回归模型的 2 倍。
  2. 基础设施不兼容:KV Cache、Flash Attention 等现有推理优化均面向自回归设计,dLLM 的全注意力计算导致”理论上并行、实际上未必快”,需专门优化(如 Fast-dLLM、dLLM-Cache 可带来最高 9 倍加速)。
  3. 多步推理差距:在数学、逻辑等复杂链式推理上仍落后于成熟的自回归模型,需借助强化学习(如 d1 的 diffu-GRPO)补强。

五、一个直观示例:掩码扩散的”填空式”生成

# 概念示意:dLLM 的并行去噪迭代(非真实模型代码)
sequence = ["[MASK]"] * 8   # 初始:整句全掩码
for step in range(4):       # 多轮去噪迭代
    probs = model.predict(sequence)   # 双向注意力并行预测所有掩码位
    sequence = remask_low_confidence(sequence, probs)  # 低置信度再掩码
# 最终输出:"扩散大语言模型是文本生成新范式"

这段伪代码展示了 dLLM 与传统逐字生成的核心区别:每一步都在同时刷新整段文本,而非一次只吐一个字。

总结要点

  • dLLM 用”掩码 + 迭代去噪”替代”逐 token 预测”,实现并行解码、双向理解与可纠错生成。
  • 以 LLaDA、Gemini Diffusion、Mercury 为代表,扩散范式已在 8B 级模型上比肩自回归性能,并在速度上拉开 5-10 倍差距。
  • 当前短板在于训练成本、基础设施适配与复杂推理;”自回归 + 扩散”混合路线(如 Block Diffusion)与推理增强(d1、LLaDOU)正在补齐缺口。
  • 开发者可优先用 dLLM 做高吞吐生成、代码与结构化输出、文本编辑等场景。

延伸阅读建议:

  • LLaDA 论文:《LLaDA: Large Language Diffusion with mAsking》(arXiv:2502.09992)
  • Google DeepMind Gemini Diffusion 官方页面
  • 综述论文:《Discrete Diffusion in Large Language and Multimodal Models: A Survey》(arXiv:2506.13759)
  • d1:基于 LLaDA 的扩散推理增强模型(arXiv:2504.12216)