第 13 章 AI 算法Transformer大模型

第 13 章 生成式模型

第13章 生成式模型

13.1 生成式模型基础

本节介绍生成式模型的基础,覆盖对抗生成、变分推断、扩散去噪与流匹配四大范式。这些模型构成图像与视频生成模块 的理论底座,也支撑生成式模型与大语言模型的融合讨论。离散 token 空间上的扩散建模采用与连续空间不同的数学框 架,其原理独立于本节展开。

13.1.1 GAN 与对抗训练

生成对抗网络(Generative Adversarial Network,GAN)由 Goodfellow 等人在 2014 年提出,通过两个网络的对抗博 弈逼近真实数据分布。生成器(Generator)以噪声向量 z 为输入,输出合成样本 G(z);判别器(Discriminator)接收 真实样本或合成样本,输出其来自真实分布的置信度。两者构成零和博弈,训练过程等价于求解如下 min-max 目标: min max V (D, G) = Ex∼pdata [log D(x)] + Ez∼pz [log(1 − D(G(z)))] G D 理论分析表明,当判别器达到最优时,上述目标等价于最小化生成分布与真实分布之间的 Jensen-Shannon 散度,此时 生成器的最优解满足 p = p 。实际训练中两个网络交替更新,判别器更强时以最大化 log D(G(z)) 代替最小化 log(1 − data D(G(z))),以缓解早期阶段的梯度消失。 G GAN 的训练不稳定源于两类失衡:判别器过强使生成器梯度消失,判别器过弱使生成器无法收敛,两者都需要细致调节 训练节奏。模式坍缩(Mode Collapse)是更棘手的失败模式,生成器只覆盖训练数据中少数高密度区域,输出多样性匮 乏。条件生成方面,可在生成器与判别器中注入类别或文本条件,得到条件 GAN(Conditional GAN)。后续的 WGAN 以 Wasserstein 距离替代 JS 散度,谱归一化(Spectral Normalization)约束判别器的 Lipschitz 常数,从优化角度缓解了 上述问题,但对抗训练的不稳定性仍是本质性挑战。GAN 在图像生成领域仍具代表性,近年多模态系统中更常以扩散或 流模型承担视觉生成职责。

13.1.2 变分自编码器

变分自编码器(Variational Auto-Encoder,VAE)由 Kingma 和 Welling 在 2013 年提出,把生成建模引入自编码器框 架。其核心假设是观测数据 x 由低维隐变量 z 生成,边缘分布写作 p(x) = ∫ p(x ∣ z)p(z) dz。真实后验 p(z ∣ x) 不可解析求 解,VAE 因此引入近似后验 q (z ∣ x)(编码器)与生成网络 p (x ∣ z)(解码器),通过最大化证据下界(Evidence Lower Bound,ELBO)训练: ϕ θ log p(x) ≥ Eqϕ (z∣x) [log pθ (x ∣ z)] − KL(qϕ (z ∣ x) ∥ p(z)) ≜ LELBO ELBO 由两项构成。重构项 E [log p (x ∣ z)] 度量解码器从隐变量恢复数据的能力;正则项为 KL 散度,约束近似后验靠近 先验 p(z)。对每个样本最小化负 ELBO,等价于在重构保真度与先验约束之间取得平衡。 qϕ θ 直接对 q 的期望求梯度会遇到随机变量不可微的问题。重参数化技巧(Reparameterization Trick)将采样过程改写为 z = μ (x) + σ (x) ⊙ ϵ,其中 ϵ ∼ N (0, I) 与参数无关,随机性被转移到噪声项,梯度得以经 μ 与 σ 反向传播。 ϕ ϕ ϕ ϕ ϕ VAE 与普通自编码器的区别在于目标与隐空间性质。自编码器只优化重构误差,隐空间缺乏先验约束,任意点未必对应合 法样本;VAE 通过 KL 正则把隐空间拉向先验分布,使从 p(z) 采样的隐变量也能解码出合理样本,代价是重构保真度略有 下降,这一权衡正是 VQ-VAE 等后续模型的改进方向。

13.1.3 扩散模型与去噪目标

扩散模型(Diffusion Model)源于非平衡热力学,将生成过程建模为前向加噪与反向去噪。前向过程按预定义的方差表 β , … , β 逐步向数据施加高斯噪声,t 时刻的边际分布可解析写出: T t q(xt ∣ x0 ) = N (xt ; α ˉ t x0 , (1 − α ˉ t )I ) , ˉ t = ∏(1 − βs ) α s=1 如图13-1 所示,前向过程把真实图像逐步扰动为纯噪声,反向过程由神经网络学习条件分布 p (x t−1 ∣ xt ) ,逐级去噪还原 数据。 θ Forward process adds noise Reverse process removes noise x0 x1 x2 xT xT x(T-1) x(T-2) x0 图13-1 扩散模型的前向加噪与反向去噪过程 DDPM(2020)的训练目标是最小化噪声预测误差,等价于简化的变分下界: Lsimple = Et, x0 , ϵ [∥ϵ − ϵθ (xt , t)∥2 ] 其中 ϵ ∼ N (0, I),网络 ϵ 以带噪样本 x 与时间步 t 为输入,预测所施加的噪声。该目标与分数匹配(Score Matching) 等价,学习的是对数密度的梯度 ∇ log p (x ),因此扩散模型也可视为隐式分数模型。 θ t xt t t 采样时 DDPM 沿反向链迭代 T 步,每步引入一次高斯噪声,生成成本较高。DDIM(2021)将反向过程改为确定性映 射,用更少的步数完成采样,为流模型奠定基础。在骨干网络上,扩散 Transformer(Diffusion Transformer,DiT)用 Transformer 替代 U-Net,将图像切分为 patch 后按视觉 token 处理,以自适应层归一化(adaLN)注入时间步与类别 条件,成为主流视觉生成骨干。adaLN 将条件信号经多层感知机映射为层归一化的缩放与平移参数,在保证条件可控的 同时保持结构简洁。

13.1.4 流匹配与 Flux

连续归一化流(Continuous Normalizing Flow,CNF)通过常微分方程定义从噪声分布到数据分布的连续映射,样本沿 速度场(Velocity Field)流动。流匹配(Flow Matching)为这一思路提供了可训练的回归目标:在噪声 x 与数据 x 之 1 0 间构造线性插值轨迹 x = (1 − t)x + tx ,期望速度场直接由端点差给出: t LFM = Et, x0 , x1 [∥vθ (xt , t) − (x1 − x0 )∥ ] 训练完成后,生成只需从先验采样并按学习到的速度场积分 ODE。流匹配与扩散模型同属传输类生成范式,差异在轨迹 形态:扩散的加噪轨迹是弯曲的,需要逐步去噪;流匹配(特别是 Rectified Flow)将轨迹拉直,单步或数步即可完成采 样。 Flux 是 2024 年发布的图像生成模型,采用 12B 参数规模的 Transformer 骨干,以流匹配与 Rectified Flow 作为生成框 架,并引入旋转位置编码(RoPE)、并行注意力层与时间步条件注入。相比同类扩散模型,直线轨迹使 Flux 在采样步数 显著减少的同时保持图像质量,代表了流匹配范式在工程规模上的成熟。

13.1.5 与自回归生成的对比

生成式模型按概率建模方式可分为三大谱系:对抗谱系(GAN)、似然谱系(VAE 与流)与扩散谱系(去噪扩散、流匹 配)。三者都与自回归(Autoregressive,AR)逐 token 生成范式形成对照,谱系关系与模态侧重如图13-2 所示。 Generative models Autoregressive Adversarial GAN Likelihood VAE Diffusion flow Text generation Image generation Text via discrete diffusion 图13-2 生成式模型谱系与模态侧重 维度 自回归 扩散与流 GAN VAE 与流似然 生成顺序 逐 token 顺序 全局并行迭代 一次性映射 一次性映射 概率建模 显式链式因子分解 隐式分数场 隐式对抗均衡 显式变分或可逆映射 训练目标 交叉熵 噪声预测或速度场 min-max 博弈 ELBO 或流回归 并行性 低 高 高 高 条件生成 弱,依赖前缀 强,支持引导 中,条件注入 中,条件注入 主要模态 文本 图像,文本可扩展 图像 图像 表13-1 生成式模型谱系与自回归的对比 如表13-1 所示,四类范式在生成顺序、概率建模、训练目标与条件生成能力上差异显著,对比要点如下。 •并行性:自回归受因果掩码约束,生成必须逐 token 串行,长序列的成本线性增长;扩散与流在推理时对全部位置同 时去噪,天然可并行。 •概率建模:自回归以显式条件概率链建模联合分布;扩散与 GAN 不直接写出行密度,前者学习分数场,后者收敛到隐 式对抗均衡。 •条件生成:自回归通过前缀控制续写方向,引导能力有限;扩散模型借助分类器或无分类器引导(Classifier-Free Guidance,CFG)在推理期放大条件信号,条件强度连续可调。 •模态应用:文本的离散 token 结构与因果顺序契合自回归;图像的全局结构与连续像素更适合扩散、流与对抗范式。 离散扩散把去噪框架迁移到 token 空间后,扩散范式也进入文本生成领域。

13.1.6 生成模型与大模型的融合

生成式模型与自回归大语言模型的融合沿三条主线推进。 •图文联合生成:在统一连续空间中同时建模文本与图像,例如以共享的扩散或流模型处理拼接的文本与图像潜在表示, 使两种模态共享同一生成分布,支持图文条件互生成与多模态编辑。这类框架把自回归的语言先验与扩散的视觉生成统 一到单个网络内。 •生成模型蒸馏到自回归:将扩散或流模型的生成能力迁移到自回归模型中,以换取推理效率与生态兼容。训练时以教师 扩散模型的多步采样输出作为监督信号,让学生自回归模型一步生成对应结果,采样成本大幅下降。由于自回归架构与 大语言模型生态直接兼容,KV 缓存、投机采样与量化工具链均可复用,蒸馏产物易于部署。 •离散扩散衔接:连续扩散与离散扩散共享去噪与分数匹配的数学内核,区别在于状态空间是连续向量还是离散 token。 这一同构使统一生成框架可行:图像用连续扩散,文本用离散扩散,同一骨干网络可同时承担两种过程。LLaDA 等模 型证明了离散扩散在文本生成上达到与自回归可比的性能,为融合架构提供了实证支撑。 三条主线并不互斥:图文联合生成可以建立在流匹配骨干上,离散扩散亦可与自回归通过混合架构共存。多模态系统的生 成侧正从单一范式收敛到自回归处理文本序列、扩散处理连续信号的混合形态。

13.2 视觉生成与视频

视觉生成的目标是根据文本、图像或视频提示合成新的视觉内容。早期工作继承 CNN 时代的扩散 U-Net 架构,生成质量 受制于卷积骨干的表达上限。DiT(Diffusion Transformer, Peebles & Xie, 2022)将扩散模型中的 U-Net 替换为纯 Transformer,不仅统一了生成与理解两端的架构语言,更为 Sora(2024)等视频生成模型奠定了架构基础。本节梳理 从扩散 U-Net 到 DiT、再到视频生成与自回归图像生成的两条主线,并追踪 2026 年的前沿进展。

13.2.1 扩散模型与 DiT

扩散模型通过前向加噪与反向去噪的两阶段过程学习数据分布,训练时以含噪样本和时间步为输入预测所添加的噪声,推 理时从纯噪声出发迭代去噪。Stable Diffusion 等主流文生图模型将扩散过程施加在 VAE 的潜在空间而非像素空间,大幅 降低计算量。 在 DiT 之前,去噪网络几乎一律采用 U-Net:一个带跨层连接的卷积编解码器。U-Net 的归纳偏置带来训练稳定、参数高 效等优点,但其卷积结构对长程依赖建模弱,且难以随算力增长而稳定扩展——增加深度往往带来训练不稳定。研究者开 始质疑:既然图像理解已经证明纯 Transformer 优于 CNN,为什么图像生成还要依赖卷积骨干? DiT 的回答是用标准 ViT 替换 U-Net。其处理流程为:将潜在空间中的含噪图像切分为 Patch,经线性投影得到 token 序 列;每个 DiT Block 采用自适应层归一化(Adaptive LayerNorm, adaLN),用时间步和类别条件的嵌入调制归一化层的 缩放与偏移,把条件信息注入每一层。所有 token 经过若干 Transformer 块后,再经逆 Patch 化(Unpatchify)还原为 逐像素的噪声预测。 DiT 的设计体现了以条件调制替代结构改造的思路。它不改变 Transformer 的任何核心组件,只是通过 adaLN 把扩散条 件(时间步、类别、文本嵌入)变成层内的仿射变换,因此能够直接复用大规模预训练与并行训练技术。论文以 FID 为指 标系统展示了 DiT 的尺度律:模型越大、训练计算越多,生成质量稳定提升且未现饱和,这与语言模型、ViT 的缩放行为 完全一致。其前向流程如图13-3 所示。 Latent Image Patchify Timestep t + Label c Linear Embed adaLN Modulation DiT Block ×N Unpatchify Predicted Noise 图13-3 DiT 的架构与前向流程

13.2.2 Sora 与视频生成

视频生成把难度提升一个数量级:除了空间结构,还要求时间一致性与物理合理性。Sora(2024)将 DiT 的思路推广到 视频——先把视频压缩到潜在空间(视频 VAE),再将其切分为时空 Patch(Spacetime Patches),由扩散 Transformer 在统一的序列上完成去噪。这种设计使模型可以用任意分辨率、任意时长和任意宽高比的视频训练,对训练数据的多样性 极为友好。 Sora 的突出之处不在单帧质量,而在从尺度中涌现的物理直觉:物体在遮挡后仍保持存在、阴影随光源正确移动、场景 转场保持物体一致性。这些能力并非显式建模,而是大规模视频数据训练下 Transformer 自回归式先验的自然结果。 Sora 系列工作因此确立了视频生成的两条工程铁律:潜在空间压缩负责降低序列长度,扩散 Transformer 负责在压缩空 间中建模复杂时空分布。 自 Sora 之后,视频生成沿着两条支线快速演进。一是可控性:以参考图、动作序列或文本边界条件控制生成内容,使视 频不仅像真的而且按意图生成;二是效率:对视频 VAE 与扩散 Transformer 做并行去噪与蒸馏,缩短几十步迭代所需的 推理时间。视频 token 的序列长度通常是图像的数十倍,KV 缓存与注意力计算成为瓶颈,相关优化手段与多模态推理方 法一致。

13.2.3 自回归图像生成

与扩散路线并行的另一条主线是自回归图像生成。VQ-VAE 与 VQGAN 将图像离散化为 token 序列,DALL-E 用自回归 Transformer 逐 token 生成图像,开创了图像即文本的范式。这类方法把视觉生成完全纳入语言模型的训练框架:只需对 离散图像 token 做交叉熵,即可复用既有语言模型栈与并行训练工具。 自回归图像生成的序列长度是其主要瓶颈——一张 256×256 的图像在 VQGAN 词表下也需数百个 token。近年工作从两 个方向缓解:一是改进离散化,如用 2D 位置感知的 tokenizer 提高 token 语义密度;二是改进解码顺序,如 VAR 按分辨 率从粗到细逐级生成,将图像生成视为下一尺度的预测而非下一 token 的预测。从 DiT 与 VQGAN 的竞争可以看出,扩散 与自回归两条路线共享同一个 Transformer 底座,差异主要在离散化与条件注入方式,这正体现了 Transformer 作为统 一生成架构的威力。 如表13-2 对比了扩散 Transformer 与自回归生成在序列形式、训练目标与解码方式上的差异。 对比维度 扩散 Transformer 自回归生成 序列形式 连续潜在 Patch 离散图像 token 训练目标 去噪损失(预测噪声) 交叉熵(预测 token) 解码方式 迭代去噪(多步) 自回归逐 token 条件注入 adaLN / 交叉注意力 文本前缀拼接 代表模型 DiT、Sora DALL-E、VAR、LlamaGen 表13-2 扩散与自回归生成对比 两者在表征粒度上互补。扩散路线在连续空间中逐步细化,擅长细腻纹理与高保真重建;自回归路线将生成简化为语言建 模,天然支持与其他模态 token 的统一序列训练。随着离散化质量提升与并行解码技术成熟,自回归图像生成正在弥合 与扩散在质量上的差距,两条路线的融合(如扩散 LLM)也是活跃的研究前沿。

13.2.4 代表架构

中国厂商在视频生成领域处于前沿水平,以下两个代表性架构分别来自快手与字节跳动。 •Kling(Kuaishou, 2024-2025)代表了中国公司在视频生成领域的前沿水平,其核心技术栈包括 3D VAE 重建(使用 3D 卷积实现一致的时空压缩)、DiT + 3D RoPE(对空间和时间维度同时编码位置信息)以及多阶段分辨率递进训练 (课程学习策略从 256×256 逐步提升至 1080p)。 •Seedream(ByteDance, 2024-2025)采用视频 DiT + LLM 联合路线:文本条件不仅作为 DiT 的 AdaLN 调制信号,还 通过 Cross-Attention 层将文本的中间层隐藏状态注入 DiT 的各层。同时在 DiT 的 FFN 层引入 MoE 机制,不同专家专 门化不同的视觉概念和场景类型。

13.2.5 推理效率优化

AAD-1(2026)解决了扩散模型视频生成的核心痛点——需要数十至数百步去噪迭代导致的极高推理延迟。其核心创新是 通过对抗蒸馏将多步 DiT 蒸馏为单步生成器 G ,结合非对称教师-学生设计,使视频生成速度提升 30-50 倍,同时通过对 θ 抗训练保持了 90%+ 的视觉质量。单步生成使自回归长视频生成成为可能:逐段生成视频的连续部分,前一段的最后帧作 为后一段的条件。 VideoMLA(2026)在 DiT 的注意力机制上直接优化。其核心洞察是:在视频扩散模型的自注意力计算中,连续帧之间的 键-值对高度相似,可以用低秩分解共享。将时空自注意力的 K, V 分解为共享低秩成分 + 帧特定残差: Kt = Kshared + ΔKt , Vt = Vshared + ΔVt 低秩分解将 KV Cache 的显存占用从 O(F ⋅ N ⋅ d) 降至 O(r ⋅ N + F ⋅ N ⋅ r )(r ≪ d 为残差秩)。在 2 分钟视频的生成实验 ′ ′ 中,VideoMLA 将 KV Cache 显存降低了 70%,生成速度提升 3.2 倍。

13.2.6 长视频一致性

长视频一致性是视频生成的另一核心难题,以下两项 2026 年的工作分别从记忆与身份两条技术路线入手。 •Echo-Infinity(2026)解决了视频生成中的根本挑战——如何生成无限长的、叙事连贯的视频。其核心机制是进化记 忆(Evolving Memory):维护一个动态更新的记忆池,存储关键帧的压缩表征,通过交叉注意力查询记忆池提取相关 上下文,并基于重要性得分淘汰旧记忆。在 10000+ 帧的长视频生成中展示了持续的角色一致性与叙事逻辑。 •StreamChar(2026)专注于长视频中的角色生成,通过角色码本(Character Codebook)将角色身份特征压缩为离 散码本,结合帧级条件与身份正则化损失,将角色身份一致性指标从基准的 0.62 提升至 0.89。

13.2.7 视频理解

视频理解(Video Understanding)是视频生成的对偶任务。2025-2026 年的一个重要趋势是使用视频生成模型学到的世 界表征来提升视频理解。 “VLMs as Good Teachers for Video Reasoning”(Kling 2026)揭示了一个关键发现:用于视频生成的 DiT 是极好的视 频理解教师模型。DiT 在生成训练中学到的时空表征包含丰富的物理世界知识(运动规律、物体恒常性、因果关系),可 以通过知识蒸馏迁移至视频理解 VLM。蒸馏方式为将预训练 DiT 的中间层特征通过 Adapter 映射为视频理解 VLM 的输入 特征: (l) Hstudent = Adapter(HDiT ) 在 Video-MME、ActivityNet-QA 和 NextQA 三大视频理解基准上,经过 DiT 教师蒸馏的视频 VLM 相比从零训练的同架构 模型,平均准确率提升 8-12 个百分点。这一发现具有深远意义:视频生成和视频理解不再是独立的两个方向,而是一个 生成-理解联合循环的两个阶段。如图13-4 所示,这一循环由两条不同的技术链路构成。 2026 New Approach Traditional Approach DiT Generation Training DiT Spatiotemporal Repres Video Understanding VLM Video data Unsupervised/Weakly sup entation Adapter Distillation +8-12% Accuracy Video data Supervised annotation Video Understanding VLM ervised 图13-4 视频生成与视频理解的联合范式 视频理解 VLM 的架构与图像 VLM 共享大部分设计,但有两个关键差异: •时序编码:视频 VLM 需要在空间视觉编码之外,额外编码时间维度。三种主要方案:帧级独立编码 + 时序 Pooling (简洁但丢失时序依赖);3D Conv / Video ViT 编码(显式建模时空依赖但计算开销大);帧级编码 + LLM 内时序推理 (每帧独立编码为视觉 token,由 LLM 注意力隐式学习时序关系,当前主流方案)。 •视频 Token 压缩:每秒 24-30 帧的视频,即使每 2 秒采样 1 帧,10 分钟视频也产生 300 帧,每帧 256 token,总计 76800 token,远超 LLM 上下文窗口。常用压缩策略包括均匀帧采样、关键帧检测和 Perceiver 时序压缩。

13.2.8 评测与产业

视频生成的质量评测是多维度的,涉及空间质量、时序质量、文本对齐和审美评估,主要指标如表13-3 所示。 指标 全称 评测维度 计算方式 FVD Frechet Video Distance 视频分布距离 I3D 特征空间 FID 的视频扩展 IS Inception Score (Video) 清晰度 + 多样性 C3D 特征的条件熵和边缘熵 CLIPSIM CLIP Similarity 文本-视频对齐 CLIP ViT 编码的视频帧与文本余弦相似度 Motion Score Motion Score 运动幅度 相邻帧光流幅值的统计量 TC Temporal Consistency 时序一致性 相邻帧 CLIP 特征的余弦相似度 PickScore Human Preference Score 人类偏好拟合 在人类偏好数据上训练的评分模型 VBench Video Generation Benchmark 综合质量 16 个子维度的综合评分 表13-3 视频生成评估指标 VBench(Huang et al. 2024)是目前最系统的视频生成评测框架,涵盖 16 个细粒度质量维度——包括主体一致性、背景 一致性、运动平滑度、动态程度、美学质量和成像质量等。 如表13-4 汇总了主流视频生成模型的技术路线与开源程度。 公司 生成模型 关键技术 理解能力 开源程度 OpenAI Sora DiT + 3D VAE + 重标注 弱(生成专精) 闭源 Google Veo 3 DiT + Gemini 文本编码 强(Gemini 视频理解) 闭源 Kuaishou Kling 2.0 DiT + 3D VAE + 3D RoPE 研究级(DiT→VLM 蒸馏) 闭源 ByteDance Seedream 2 MoE DiT + LLM 交叉注意力 强(Seed-X VLM) 部分开源 Meta Movie Gen DiT + Llama 文本编码 强(原生多模态) 部分开源 Runway Gen-3 Alpha DiT + 自研编码器 弱(生成专精) 闭源 表13-4 主流视频生成模型概览

13.2.9 前沿展望

视频生成与理解领域的前沿方向:

  1. 实时视频生成:AAD-1 的一步生成和 VideoMLA 的低秩 KV Cache 正将视频生成推向实时(<100ms 延迟),对直播、 交互式媒体和 AR/VR 场景具有变革性意义。
  2. 世界模型与视频生成的融合:视频生成模型学到的物理直觉正在被整合进世界模型,Sora 和 Cosmos 3 都在“视觉模 拟器”和“世界模型”两个角色之间建立了桥梁。
  3. 生成-理解-交互闭环:未来的视频系统将是感知→理解→生成→反馈的闭环:VLM 理解当前视频内容,DiT 生成可能的 未来帧,Agent 基于预测做出决策。这一闭环是具身智能和自主系统的核心技术基础。
  4. 长视频一致性:Echo-Infinity 的记忆池和 StreamChar 的角色码本代表着长视频一致性的两大技术路线:记忆压缩 vs 身份编码。两者的融合(即有身份感知的进化记忆)可能是下一突破点。

13.3 扩散语言模型概述

扩散语言模型(Diffusion Language Model, DLM)代表了自然语言生成领域的一种范式转换:将文本生成从自回归 (Autoregressive, AR)的逐 token 串行预测,转变为基于迭代去噪(Iterative Denoising)的并行生成。本节从底层生 成机制、发展动机和主要范式分类三个维度,建立对扩散语言模型的整体认知。

13.3.1 从自回归到扩散

自回归语言模型(如 GPT 系列、LLaMA 系列)遵循链式法则将文本的联合概率分解为条件概率的乘积: T P (x1 , x2 , … , xT ) = ∏ P (xt ∣ x<t ) t=1 这一分解方式决定了 AR 模型的三个固有属性:(1) 逐 token 串行解码,解码步数等于序列长度;(2) 每个 token 仅依赖上 文,生成方向严格从左到右;(3) 训练与推理在形式上一致——都是预测下一个 token。 扩散语言模型则采用完全不同的思路。它不直接建模文本的联合分布,而是定义一个从噪声到文本的迭代恢复过程: •前向过程(Forward Process):逐步向干净文本添加噪声,经过 T 步后将文本完全破坏为噪声/掩码状态。 •反向过程(Reverse Process):学习一个神经网络,从噪声状态出发,逐步去噪恢复出干净的文本。 形式化地,给定干净序列 x ,前向过程定义为: q(xt ∣ xt−1 ) = NoiseStep(xt−1 ) 反向过程由参数为 θ 的神经网络建模: pθ (xt−1 ∣ xt ) = DenoiseStepθ (xt , t) 其核心优势在于:每一轮去噪可以同时更新整个序列的所有位置,从而天然支持并行解码和双向上下文建模。图13-5 对 比了两种范式的生成机制。 Diffusion Generation x_T (Noise/Mask) x_{T-1} (Partial recovery) x_{T-2} (More recovery) ... x_0 (Clean text) Autoregressive Generation x₁ x₂ x₃ ... x_T 图13-5 自回归生成与扩散生成的机制对比 如表13-5 所示,两种范式在关键维度上存在显著差异。 维度 自回归模型 扩散语言模型 生成方式 逐 token 串行 全序列迭代并行 解码步数 等于序列长度 等于扩散步数(通常 256-1024) 维度 自回归模型 扩散语言模型 上下文依赖 仅上文(单向) 全局双向 训练-推理一致性 一致 略有差异 可控性 需要额外机制(CFG 等) 天然支持条件注入 长序列效率 线性增长 可亚线性扩展 表13-5 自回归与扩散语言模型对比

13.3.2 扩散语言模型的三大驱动力

扩散语言模型在 2023-2026 年间迅速发展,其核心驱动力来自三个方面: •并行解码:AR 模型的长序列生成延迟与序列长度成正比,而 DLM 的解码步数由扩散步数决定,与生成长度解耦。理论 上,如果扩散步数 S ≪ 序列长度,则 DLM 可获得显著的效率优势。例如,LLaDA(2025)在 8B 参数规模上使用 128 步扩散即可生成 1024 token 的文本,等效于每个 token 仅需 0.125 步,远优于 AR 的每 token 一步。 •双向上下文:AR 模型在生成第 t 个 token 时只能看到 [0, t − 1] 的内容,无法利用后文信息进行修正。DLM 的每一轮去 噪都可以同时审视全部位置,利用全局信息做出决策。这种能力在需要保持全局一致性的任务(如结构化输出、代码生 成、诗歌创作)中尤为重要。 •可控生成:扩散过程的迭代特性使得在任意中间步骤注入控制信号变得自然。用户可以在去噪过程中施加语法约束、关 键词引导、长度控制等条件,而无需像 AR 模型那样在 logits 层面进行事后的惩罚或修改。这种过程级可控为受控文本 生成开辟了新的技术路径。

13.3.3 扩散语言模型的分类型谱

根据噪声定义域和处理方式,扩散语言模型可分为两大流派,如图13-6 所示。 Diffusion Language Model (DLM) Continuous Diffusion Discrete Diffusion Diffusion-LM Plaid 1B SSD-LM D3PM MDLM / SEDD LLaDA Dream (Li et al., 2022) (Gulrajani & Hashimoto, 20 (Han et al., 2023) (Austin et al., 2021) (2023-2024) (Nie et al., 2025) (2025-2026) 24) 图13-6 扩散语言模型的分类型谱 连续扩散(Continuous Diffusion)通过在连续嵌入空间(embedding space)中施加高斯噪声来实现。Diffusion-LM (2022)是连续扩散的先驱,将文本生成分为三个阶段:(1) 将 token 序列嵌入为连续向量;(2) 在高斯扩散过程中去 噪;(3) 将去噪后的向量舍入(rounding)回 token。rounding 步骤通过最小化 ℓ 距离实现,但本质上是一个无法保证 全局最优的贪心过程,成为连续扩散的主要瓶颈。Plaid 1B(2024)将连续扩散的规模扩大到 13 亿参数,其关键发现 是:连续扩散在嵌入空间中的扩散行为与图像扩散高度相似,可直接受益于 DiT 等架构创新;但 rounding 阶段的性能损 失随模型规模增大而恶化,更大模型的更精确嵌入使得 rounding 的欧氏距离假设与实际 token 分布之间的差距更加尖 锐。 连续扩散的优点在于可直接复用成熟的图像扩散模型架构和训练方法。缺点在于嵌入与离散 token 之间的往返映射引入 了信息损失,且高斯噪声假设与语言的离散性本质存在不匹配。 离散扩散(Discrete Diffusion)直接在离散 token 空间上定义扩散过程,无需嵌入映射。扩散操作以一定概率将 token 替换为其他 token(均匀噪声)或特殊 [MASK] token(掩码噪声)。D3PM(2021)系统化地定义了离散扩散的数学框 架,MDLM(2023)进一步优化了掩码策略,而 LLaDA(2025)则首次将离散扩散扩展到了 8B 参数的工业级规模,在 各大基准上与同规模的 AR 模型取得了可比甚至更优的性能。 如表13-6 所示,离散扩散模型在工业级规模上已展现出与 AR 模型可比的性能。 模型 类型 参数量 扩散步数 MMLU GSM8K 特点 Diffusion-LM 连续 200M 2000 — — 首个扩散文本生成模型 Plaid 1B 连续 1.3B 128-256 — — 连续扩散规模化验证 LLaDA 8B 离散 8B 128 67.1 65.4 工业级离散扩散,性能接近 AR Dream 7B 离散 7B 512 63.8 58.2 多模态条件注入 表13-6 代表性扩散语言模型 如表13-7 所示,两种流派在噪声空间、转移过程和训练效率等方面存在本质差异。 维度 连续扩散 离散扩散 噪声空间 连续嵌入空间 R d 离散 token 空间 V L 噪声类型 高斯噪声 N (0, σ I) t 分类噪声(掩码/均匀替换) 转移过程 连续动态 dx = f (x, t)dt + g(t)dw 离散转移矩阵 Q t 嵌入映射 需要 embedding + rounding 无需,直接在 token 上操作 成熟度 从图像扩散直接继承 需重新设计扩散动力学 训练数据效率 较低(每步计算所有 token) 较高(仅计算掩码位置损失) 信息损失 rounding 步骤引入误差 无 embedding 往返误差 代表模型 Diffusion-LM, Plaid 1B D3PM, MDLM, LLaDA 表13-7 连续扩散与离散扩散对比

13.3.4 扩散语言模型的核心挑战

尽管潜力巨大,扩散语言模型仍面临以下关键挑战: •推理效率:虽然理论上扩散步数可远小于序列长度,但每步的计算量(通常是一次完整的前向传播)远大于 AR 模型的 单 token 预测。因此在实际部署中,DLM 的总 FLOP 开销往往高于同规模 AR 模型。降低扩散步数(如从 1000 步降至 64-128 步)同时保持生成质量是当前的研究热点。 •序列长度的适应性:与 AR 模型需预设最大生成长度不同,DLM 必须预先确定序列长度(或使用 pad/mask 来容纳变 长输出)。这对动态长度生成(如对话)不够友好。 •可控性-质量权衡:更强的控制约束(如强制性语法规则)可能导致生成质量下降,如何在不损害流畅性的前提下实现 精确控制仍是一个开放问题。 •训练稳定性:离散扩散的损失函数在不同时间步上的信号强度差异很大(早期步比后期步困难得多),这给训练带来了 优化挑战。

13.4 离散扩散原理与训练

离散扩散(Discrete Diffusion)是扩散语言模型的主流范式。与连续扩散在嵌入空间中施加高斯噪声不同,离散扩散直 接在 token 空间上定义随机过程,避免了嵌入映射带来的信息损失,并在理论上更契合语言的离散本质。本节从数学原 理、关键模型和训练方法三个层次展开。

13.4.1 离散扩散的数学框架

离散扩散的数学基础由 Austin 等人在 D3PM(2021)中系统化地建立。考虑一个有限词汇表 V = {1, 2, … , K},其中 K = ∣V∣ 为词表大小。令 x = (x , x , … , x ) ∈ V 表示一个长度为 L 的 token 序列。 1 2 L L 前向扩散过程(Forward Diffusion Process)定义为一个马尔可夫链,逐步破坏原始 token 的信息: L q(xt ∣ xt−1 ) = ∏ Cat(xlt ∣ xlt−1 ⋅ Qt ) l=1 其中 Cat 表示分类分布,Q ∈ R 为时间步 t 的转移矩阵(Transition Matrix),Q [i, j] = q(x = j ∣ x K×K t−1 = i) 表示 token 从状态 i 转移到状态 j 的概率。 t t t 转移矩阵 Q 需满足每行元素之和为 1: t K ∑ Qt [i, j] = 1, ∀i ∈ {1, … , K} j=1 利用马尔可夫性质,从 x 到 x 的累积转移可直接计算: 0 t ˉ t) q(xt ∣ x0 ) = Cat(xt ∣ x0 ⋅ Q 其中 Qˉ = Q Q ⋯ Q 为累积转移矩阵。 t t 反向去噪过程(Reverse Denoising Process)由一个神经网络 μ 参数化: θ L pθ (xt−1 ∣ xt ) = ∏ Cat(xlt−1 ∣ μlθ (xt , t)) l=1 其中 μ (x , t) ∈ R 是模型对第 l 个位置的 token 概率预测。 l θ t K

13.4.2 转移矩阵的设计空间

转移矩阵 Q 的设计是离散扩散模型的核心设计选择,它决定了噪声的类型和扩散行为。以下介绍四种经典设计。 t 均匀转移矩阵(Uniform Transition)。每个 token 以概率 β 均匀地转移到词表中的任意其他 token: t βt Qt = (1 − βt )I + (11⊤ − I) K −1 其中 I 为单位矩阵,1 为全 1 向量。当 t → T (αˉ → 0),x 趋向于均匀分布。但均匀噪声的破坏性太强,在离散空间中 难以定义清晰的噪声程度,实践中训练效果较差。 t t 掩码转移矩阵(Masking Transition)。引入一个特殊的 [MASK] token(索引记为 K + 1),token 以概率 β 被替换为 [MASK] ,一旦被掩码则不再变化。扩展词表为 V = V ∪ {[M ASK]}: t ′ 1 − βt 0 ⋯ 0 βt 0 1 − βt ⋯ 0 βt Qt = ⋮ ⋮ ⋱ ⋮ ⋮ 0 0 ⋯ 1 − βt βt 0 0 ⋯ 0 1 这种设计下,累积转移有简洁的闭式解: t ˉ t [i, MASK] = 1 − ∏(1 − βs ) = 1 − α Q ˉt s=1 其中 αˉ = ∏ (1 − β ) 表示在时间步 t 时 token 仍未被掩码保留的概率。当 t = T 时 αˉ ≈ 0,几乎所有 token 都被替换 t 为 [MASK] 。 t s=1 s T 掩码扩散是目前实验效果最好的离散扩散方式,被 MDLM、LLaDA、Dream 等主流模型采用。 吸收态转移(Absorbing State)。一种变体是让 token 以概率 β 被吸收到某个特殊 token,但该特殊 token 不一定是 [MASK] (例如可以是 [PAD] 或一个均匀混合态) 。形式上与掩码转移类似。 t 离散高斯转移(Discretized Gaussian Transition)。将高斯噪声的连续转移概率离散化到嵌入空间,再映射回 token 空 间。这种方式介于连续扩散和离散扩散之间,代表性工作包括 SEDD(2024)的 score-based 离散扩散。图13-7 以掩码 扩散为例展示了前向与反向过程的示意。 Reverse Process: p_θ(x_{t-1} | x_t) Forward Process: q(x_t | x_{t-1}) x₃ Denoise x₂ Denoise x₁ Denoise x₀ x₀ β₁ x₁ β₂ x₂ β₃ x₃ ([MASK] [MASK] [MASK]) (The [MASK] [MASK]) (The cat [MASK]) (The cat sat) (The cat sat) (The [MASK] sat) (The [MASK] [MASK]) ([MASK] [MASK] [MASK]) 图13-7 掩码扩散的前向与反向过程示意

13.4.3 训练目标的推导

离散扩散模型的训练目标是最大化变分下界(Variational Lower Bound, VLB): pθ (x0:T ) log pθ (x0 ) ≥ Eq(x0:T ) [log ] q(x1:T ∣ x0 ) 展开后得到以下分解(省略与 θ 无关的常数项): T LVLB = ∑ Eq(xt ∣x0 ) [DKL (q(xt−1 ∣ xt , x0 )∥pθ (xt−1 ∣ xt ))] t=1 对于掩码扩散,后验 q(x ∣ x , x ) 有简洁的解析形式。如果 x 已经是 [MASK] ,则 x 必为 [MASK] ;如果 x 不是 0 l l l [MASK] ,则 x 也等于同一个 token。而当 x 为 [MASK] 时,x 可能是 [MASK] 也可能恢复为原 token。这导出了 t−1 t t t−1 t l l l 一个简化的训练目标。 t−1 t t−1 混合目标函数。实际训练中,主流模型(MDLM、LLaDA)采用以下混合损失: L = LVLB + λ ⋅ Laux 其中 L 为变分下界损失,L 为辅助损失(如直接预测 x 的交叉熵损失),λ 为平衡系数。LLaDA 发现 λ ≈ 0.01 − 0.1 VLB aux 0 时效果最优。 简化后的训练流程如下:

  1. 从训练集中采样一个文本片段 x 。 0
  2. 随机采样时间步 t ∼ Uniform(1, T )。
  3. 根据累积转移矩阵 Qˉ 采样噪声文本 x 。 t t
  4. 模型输入 x 和时间步 t,预测原始 token x (或预测 p(x ∣ x ))。 t t−1 t
  5. 计算预测分布与真实 x 之间的交叉熵损失。 0 对于掩码扩散,步骤 3 相当于:对于 x 中的每个 token,以概率 1 − αˉ 将其替换为 [MASK] 。步骤 4 中,模型只需预测 被掩码位置上的原始 token,未掩码位置不贡献损失。 t

13.4.4 噪声调度策略

噪声调度(Noise Schedule)函数 β 或 αˉ 决定了不同时间步上施加的噪声量,对训练和推理质量有显著影响。 t t 线性调度(Linear Schedule)。最简单的策略——αˉ = 1 − t/T ,即掩码概率随时间线性增长。但实验表明,线性调度导 致早期噪声变化过快、后期几乎全掩码,浪费了大量后期训练步。 t 余弦调度(Cosine Schedule)。借鉴连续扩散的经验,采用: π t/T + s ˉ t = cos ( α ⋅ ) 2 1+s 其中 s ≈ 0.008 为偏移参数。余弦调度在中期提供了更多有信息量的训练样本(掩码率为 30%-70%),显著改善了训练效 率。 互信息调度(Mutual Information Schedule)。MDLM 提出基于互信息的优化调度,目标是最大化不同时间步上 x 与 x 0 之间互信息的均匀性: t max min I(x0 ; xt ) {βt } t 该调度使不同难度级别的训练样本更加均衡。图13-8 对比了三种调度策略的特征与效果。 Early changes too fast Late training wasted Noise Schedule Comparison Linear: Simple and crude Cosine: High intermediate Mutual information: Even Mid-stage information rich information ratio difficulty distribution Mainstream choice Theoretically optimal Complex implementation 图13-8 三种噪声调度策略对比

13.4.5 关键模型体系

D3PM(Denoising Diffusion Probabilistic Models for Discrete Data, 2021)。Austin 等人的奠基性工作。D3PM 首次将 扩散模型的形式化框架从连续空间推广到离散空间,系统化地定义了转移矩阵的数学形式。关键贡献: •统一了掩码建模(Masked Language Modeling, MLM)与扩散模型的联系:BERT 的 MLM 预训练本质上可理解为 T = 1 的掩码扩散。 •提出了吸收态扩散、离散化高斯扩散等多种转移矩阵变体。 •在文本生成和图像生成任务上验证了离散扩散的有效性。 •D3PM 在 CIFAR-10 图像生成上达到了与连续扩散可比的表现,证明了该框架的通用性。 MDLM(Masked Diffusion Language Model, 2023)。MDLM 专注于掩码扩散策略,将 D3PM 的理论框架进一步简化: •提出条件掩码语言建模(Conditional Masked LM, CMLM)作为训练目标的等效形式。 •将训练简化为一个标准的 BERT 式掩码预测任务,大幅降低了实现复杂度。 •引入互信息噪声调度,使训练在不同难度级别上更加均衡。 •在多个文本生成基准(文本填充、摘要、翻译)上取得了比 D3PM 更好的表现。 LLaDA(Large Language Diffusion with mAsking, 2025)。LLaDA 是离散扩散语言模型从学术验证走向工业级应用的关 键里程碑。其核心贡献: •首次在 8B 参数规模上验证了离散扩散的可行性,证明该范式具备与 AR 模型同等的扩展能力。 •提出了高效的半自回归推理策略(Semi-AR Inference),在部分位置使用 AR 解码、部分位置使用扩散解码,灵活平衡 质量与速度。 •训练效率优异:由于掩码扩散的监督信号稀疏,LLaDA 使用不到 AR 模型 1/3 的训练 tokens 即可达到类似的数据效 率。 •在 MMLU(67.1)、GSM8K(65.4)、HumanEval(42.7%)等基准上,全面超越同规模的开源 AR 基准,接近 LLaMA 2 7B 的水平。 LLaDA 的成功释放了一个重要信号:离散扩散不仅是理论上的可能性,更是实用的大语言模型训练范式。

13.4.6 采样与推理算法

离散扩散的推理需要从噪声状态迭代采样直到获得干净的文本。标准采样算法如下: Algorithm: Discrete Diffusion Sampling Input: timesteps T, Noise Schedule {β_t}, model θ Output: generated text x₀

  1. Initialize x_T <- [MASK]^L (fully masked)
  2. for t = T, T-1, ..., 1:
  3. p̂ <- μ_θ(x_t, t) (model predicts token distribution for each position)
  4. for l = 1 to L:
  5. if x_t^l == [MASK]:
  6. sample x_{t-1}^l from Cat(x_{t-1}^l | p̂_l)
  7. Otherwise:
  8. x_{t-1}^l <- x_t^l (keep already generated token)
  9. x_{t-1} <- [x_{t-1}^1, ..., x_{t-1}^L]
  10. return x₀ 半自回归推理(Semi-AR Inference)。LLaDA 提出的改进策略:将序列分为若干块,块内使用扩散解码(并行),块间按 自回归顺序生成。设块大小为 B,序列长度为 L,则解码步数约为: StepsSemi-AR = ⌈ ⌉×S

L B 其中 S 为每个块的扩散步数。LLaDA 实验表明 B = 32, S = 4 即可在质量与速度之间取得良好的折中,总体加速比可达 4- 8 倍。 温度采样。与 AR 模型类似,离散扩散也支持通过温度参数 τ 控制生成多样性: exp(log pθ (xlt−1 = k ∣ xt )/τ ) pτ (xlt−1 = k ∣ xt ) = ∑j exp(log pθ (xlt−1 = j ∣ xt )/τ ) 倾向于更确定的生成(低多样性),τ > 1 倾向于更多样化的生成。 τ <1 离散扩散作为扩散语言模型的主流范式,其优势在于数学简洁(直接处理离散结构)和训练高效(稀疏监督信号)。但要 将扩散步数压缩到实用水平(亚百步级别),仍需在噪声调度与推理策略上进一步优化。

13.5 复杂度均衡扩散分解

扩散语言模型在生成效率上优于自回归模型的理论承诺,在实践中面临一个根本性挑战:并非所有 token 或文本片段都 具有相同的生成难度。简单的功能词(如 “the”、“is”)可以在少量扩散步内就达到高置信度,而实体名称、数值、长距 离依赖的结构化内容则需要更多迭代。这种难度不均衡导致了一个困境:如果使用统一的扩散步数,简单 token 的计算 被浪费,复杂 token 的生成质量又不达标。本节介绍复杂度均衡扩散分解(Complexity-Balanced Diffusion Splitting, CBDS),该工作于 2026 年发表在 ICML 上,代表了扩散语言模型在推理效率优化上的最新突破。

13.5.1 问题的形式化定义

考虑一个长度为 L 的序列 x = (x , x , … , x )。在标准的均匀扩散中,每个位置 l 使用相同的噪声调度 {β } ,经历相同 1 2 L T 数量的扩散步数。但不同位置的生成难度存在显著差异。 t t=1 定义 token x 在第 t 个扩散步的信息量(或不确定性)为其条件熵: l Htl = H(xl0 ∣ xt ) = − ∑ p(xl0 = k ∣ xt ) log p(xl0 = k ∣ xt ) k∈V 当 H 趋近于 0 时,模型对该 token 的预测已经足够确定,额外的扩散步对该 token 几乎没有改进。CBDS 的核心思想 l 是:为每个 token 位置分配不同的有效扩散步数,使得末尾步的剩余不确定性在全序列上均衡。图13-9 直观对比了均匀 t 扩散与均衡扩散的资源分配差异。 Uniform diffusion: same steps for all positions Balanced diffusion: allocate by difficulty Position 1 (Simple word 't Position 1 (Simple word 't he') Wasted he') Just right ██████████ 10 st ████ 3 steps eps Position 2 (Intermediate w Position 2 (Intermediate w ord 'algorithm') Just right ord 'algorithm') Moderate ██████ 6 steps ██████████ 10 st eps Position 3 (Entity name 'D Position 3 (Entity name 'D eepMind') Just right eepMind') ████████ 8 steps ██████████ 10 st Insufficient eps 图13-9 均匀扩散与均衡扩散的对比示意

13.5.2 复杂度估计与分块策略

CBDS 采用两阶段框架:离线建立复杂度估计器,在线动态分配扩散步数。 阶段一,离线复杂度估计器训练。训练一个轻量级回归器(通常是一个小型 Transformer 或从主模型冻结的浅层)来预 测每个 token 所需的充分扩散步数。对于训练数据中的每个 token,定义其复杂度分数为: cl = arg min {t : Htl < ϵ} t 即在该步之后,条件熵首次降到阈值 ϵ 以下。复杂度估计器 ϕ 通过最小化以下损失训练: L ∑ ϕ(x, l) − cl 2 Lestimator = L l=1 在实践中,CBDS 发现 token 复杂度与其语言学属性高度相关:内容词(名词、动词)通常比功能词(冠词、介词)需要 多 2-4 倍的扩散步;低频词比高频词难 5-10 倍;需要长距离依赖一致的 token(如括号闭合、命名实体链)难度额外增 加。 阶段二,分块与多分辨率调度。在线推理时,CBDS 将序列分为 K 个块(chunk),每个块内使用相同的扩散步数。分块 过程如下:

  1. 估计每个 token 的复杂度 c 。 l
  2. 将复杂度离散化为 M 个层级(通常 M = 3 − 5)。
  3. 将相邻的同层级 token 合并为块,形成多分辨率分解。
  4. 为每个块分配对应的扩散步数预算。 如图13-10 所示,CBDS 的推理流程从复杂度估计开始,经分块后对各块分配不同的扩散步数。 Input text Complexity estimator Splitting engine Diffusion Decoder Initialize x_T = [MASK]^L Predict complexity for each position c^l Output complexity vector c = [c¹, c², ..., c^L] Discretize into M levels Merge into K unequal-length blocks block1: steps S1, block2: steps S2, ..., blockK: steps SK Denoise each block with corresponding diffusion steps Generate final text x₀ Input text Complexity estimator Splitting engine Diffusion Decoder 图13-10 CBDS 两阶段推理流程

13.5.3 多分辨率去噪调度

给定分块结果,CBDS 为不同复杂度的块设计不同的噪声调度。设第 k 个块分配的扩散步数为 S ,其噪声调度定义为: k = fschedule ( ), (k) t ˉt α t = 0, 1, … , Sk Sk 其中 f 为共享的基础调度函数(通常为余弦调度)。关键洞见在于:虽然各块使用不同的步数,但它们共享同一个经 schedule 过全步数训练的扩散模型,该模型在条件时间步 t 的输入下可以泛化到任意步数。 去噪过程采用交错策略(Interleaved Denoising Strategy):在每个推理轮次中,所有块同步进行一步去噪。但由于各块 的总步数不同,步数少的块会更早到达 t = 0(即完全去噪状态)。此时这些块冻结不再更新,而其余块继续去噪。 形式化地,第 r 个推理轮次(r = 1, 2, … , max S )对第 k 个块执行: k k tk (r) = max (0, ⌈Sk ⋅ (1 − )⌉) r Sk xtk (r)−1 ∼ pθ (xtk (r)−1 ∣ xtk (r) , tk (r)) (k) (k) (k) 当 r > S 时,t (r) = 0,对应块已冻结。 k k

13.5.4 全局一致性的保持

不平衡的扩散步数可能导致一个风险:先解冻的简单块生成内容与后解冻的复杂块之间出现不一致。CBDS 引入交叉注意 力修复(Cross-Attention Repair, CAR)机制来缓解这一问题: 当第 k 个块已冻结而第 j 个块仍在去噪时,模型在第 j 个块的反向步骤中额外注入了对第 k 个块已生成内容的交叉注意 力: Q(j) [K(j) ; K(k) ]⊤ Attention(j) = Softmax ( ) [V(j) ; V(k) ] d 其中 [⋅; ⋅] 表示拼接操作。CAR 确保后解冻的块能够看到先解冻的块已经确定的内容,从而保持全局一致性。

13.5.5 实现要点与性能基准

实现要点如下:

  1. 复杂度估计器的轻量化。CBDS 使用的复杂度估计器仅有 30M 参数(不到主模型 8B 的 0.4%),推理开销可忽略。估计 器与主模型共享 token embeddings 以减少参数量。
  2. KV Cache 的管理。由于各块的去噪步数不同,标准扩散模型的 KV cache 复用策略需要调整。CBDS 采用分段 KV cache:各块独立缓存,冻结块的 cache 不再更新。
  3. 可选的动态重分组。在推理过程中,可以根据中间去噪结果重新估计复杂度并调整分组。这引入了约 5% 的额外开销, 但在高度不可预测的生成任务(如开放式对话)中提供了额外收益。 如表13-8 所示,CBDS 在保持质量的前提下将推理步数从 128 降至约 48 步。 方法 推理步数 MMLU GSM8K HumanEval 相对加速比 标准扩散 (T=128) 128 67.1 65.4 42.7 1.0× 加速扩散 (T=64) 64 65.8 63.1 40.2 2.0× 加速扩散 (T=32) 32 63.2 58.7 36.5 4.0× CBDS (M=3) 约48 67.0 65.1 42.3 2.7× CBDS (M=5) 约56 67.2 65.5 42.9 2.3× 自回归 (LLaMA 7B) 1×len 65.3 57.8 38.6 — 表13-8 复杂度均衡扩散的实验结果 CBDS 的核心发现:通过自适应地分配计算资源,可以在仅损失不到 0.2 个 MMLU 百分点的前提下,将平均推理步数从 128 降至约 48 步(加速 2.7 倍),显著优于均匀减少步数的策略。尤其是 CBDS (M=5) 的生成质量甚至略微超过了标准 T=128 扩散——这表明统一的 128 步扩散可能存在过扩散现象,有些简单 token 经历太多步反而引入了额外的扰动。

13.5.6 局限性与扩展方向

CBDS 并非万能。其局限性包括: •预定义长度要求。与所有扩散语言模型一样,CBDS 需要预设生成长度。复杂度估计器也依赖这个预定义长度。 •块边界的不连续性。在块的边界处(第 k 块结束、第 k + 1 块开始),不同去噪进度可能造成生成内容的轻微不连贯。 CAR 机制缓解但未完全消除。 •域偏移。复杂度估计器在训练域外数据上的预测准确度下降,尤其在代码和数学文本上(其 token 分布与自然语言显 著不同)。 •批处理局限。由于不同样本的分块方案不同,批处理推理时难以完全对齐去噪步数,导致 GPU 利用率下降。 CBDS 的作者在论文中指出了几个有前景的扩展方向:(1) 将块级复杂度替换为更细粒度的 token 级动态分配;(2) 将复杂 度预算与 speculative decoding 结合,在冻结的简单块上释放算力来验证复杂块;(3) 学习端到端的分块策略,而非依赖 两阶段的先估后分。这些方向代表了均衡分解的进一步研究前景。

13.6 约束推理与可控生成

扩散语言模型的一个核心优势在于其迭代去噪过程天然为控制信号的注入提供了多级入口。与自回归模型只能在每个解码 步的 logits 上施加约束不同,扩散模型可以在任意中间时间步上引入引导信号,实现过程级可控。本节系统阐述扩散语言 模型的约束推理框架,重点介绍 DINGO 框架(2026),并对比两类模型在受控生成上的根本差异。

13.6.1 约束推理的问题定义

约束文本生成(Constrained Text Generation, CTG)的目标是生成满足一组形式化约束条件的文本。给定约束集合 C = {C , C , … , C },生成过程需满足: m x∗ = arg max Pθ (x) s.t. Ci (x) = True, ∀i ∈ {1, … , m} x 约束的类型包括: •词汇约束(Lexical Constraints):必须包含或不包含某些关键词。例如,生成的产品描述必须包含“防水”和“轻量 化”两个关键词。 •语法约束(Syntactic Constraints):生成的文本必须符合特定的语法模板。例如,生成的句子必须遵循“主语+谓语 +宾语+状语”的结构。 •格式约束(Format Constraints):输出必须符合特定的结构化格式。例如,JSON Schema、Markdown 表格、正则 表达式。 •长度约束(Length Constraints):生成文本的长度必须在指定范围内,如 50-100 个 token。 •语义约束(Semantic Constraints):生成的文本必须表达特定的语义内容,如正面情感或特定主题。 如图13-11 所示,五类约束各有其典型应用场景。 Constraint Type Spectrum Lexical Constraints Syntactic Constraints Format Constraints Length Constraints Semantic Constraints Keyword inclusion/exclusi Syntax template matching JSON/SQL/regex Token range control Sentiment/topic guidance on Product description gener Poetry creation Code Generation Summarization Ad copy ation Formatted output Data extraction Social content Educational content SEO content writing 图13-11 约束文本生成的约束类型与应用场景

13.6.2 自回归模型的约束解码

在扩散模型兴起之前,约束文本生成主要由自回归模型通过以下技术实现: •Logit 掩码。在每个解码步,根据约束条件将不允许的 token 的 logit 设为 −∞: pθ (xt ∣ x<t ) ⋅ 1C(x<t ,xt ) pconstrained (xt ∣ x<t ) = θ ∑x′ pθ (x′ ∣ x<t ) ⋅ 1C(x<t ,x′ ) 其中 1 为约束满足指示函数。局限性在于:(1) 贪婪局部,每步只看当前 token 是否满足约束,无法预见当前选择对后 续约束的影响;(2) 对跨越多 token 的全局约束无能为力。 C •FUDGE 与分类器引导。引入轻量级分类器预测当前部分序列最终满足约束的概率: p(constraint ∣ x≤t ) ∝ classifier(x≤t ) 每步解码时修正 logits: log pFUDGE (xt ∣ x<t ) = log pθ (xt ∣ x<t ) + γ ⋅ log pϕ (constraint ∣ x≤t ) 分类器仅提供未来约束满足的近似估计,偏差随序列变长而累积。 •NeuroLogic Decoding。将约束表示为逻辑公式,使用 beam search 结合有限状态自动机(Finite State Automata, FSA)确保生成满足约束。仍无法逃避 beam search 的指数级搜索开销,且对软约束(如风格偏好)支持有限。 上述方法的根本局限在于:所有 AR 约束技术本质上都在处理一个不完整的前缀——在生成 x 时,模型只能看到 [x , … , x ],对未来的 [x , … , x ] 一无所知。这种只能前进、不能后退的生成范式与全局约束需求之间存在根本性的 t 张力。 t−1 t+1 L

13.6.3 扩散空间的约束推理原理

扩散语言模型为约束推理提供了一个全新的角度:在迭代去噪的过程中施加约束引导。 核心直觉是:扩散生成不是一步到位,而是从噪声/掩码状态逐步收敛到清晰文本。在这个渐进过程中,可以在每一步都 注入约束信号,引导整体生成方向。 扩散引导(Diffusion Guidance)的形式化定义。在反向过程的时间步 t 中,模型采样 x 时,不仅考虑对 x 的预测, 0 还考虑约束条件 C: t−1 pθ (xt−1 ∣ xt , C) ∝ pθ (xt−1 ∣ xt ) ⋅ p(C ∣ xt−1 )γ 其中 γ 为引导强度(guidance strength),p(C ∣ x ) 为约束满足的估计概率。与 AR 模型的 FUDGE 不同,这里的 p(C ∣ x ) 评估的是中间状态(而非前缀),可以利用全局信息。 t−1 t−1 在实际计算中,如果约束可以求梯度(如连续空间中的目标函数),可以使用类似于分类器引导(Classifier Guidance) 的方法: ∇xt−1 log pθ (xt−1 ∣ xt , C) = ∇xt−1 log pθ (xt−1 ∣ xt ) + γ ⋅ ∇xt−1 log pϕ (C ∣ xt−1 ) 对于离散扩散,则需要使用基于采样的近似或离散化的 score 函数。

13.6.4 DINGO 框架与数学推导

DINGO(DIffusion with coNtroller Guidance for cOnstrained generation)是 2026 年提出的专为离散扩散语言模型设 计的约束推理框架。其核心架构包括三个组件: 组件一:约束控制器(Constraint Controller)。一个与主扩散模型并行运行的轻量级控制器网络 ψ,专门负责评估当前 去噪状态 x 满足约束的程度。控制器输出一个标量得分: t st = ψ(xt , C) ∈ [0, 1] 该得分表示:如果从当前中间状态继续去噪,最终生成结果满足所有约束的预期概率。 组件二:引导函数(Guidance Function)。控制器得分被嵌入到扩散采样过程中,通过修改 token 预测分布来引导生 成: pθ (xlt−1 = k ∣ xt ) ⋅ exp(γ ⋅ gkl (xt , C)) pDINGO (xlt−1 = k ∣ xt ) = θ ∑j pθ (xlt−1 = j ∣ xt ) ⋅ exp(γ ⋅ gjl (xt , C)) 其中 g 为将位置 l 的 token k 与约束 C 关联的引导分数。引导分数通过控制器在 token 空间的有限差分近似计算: l k ψ(xt [l ← k], C) − ψ(xt , C) gkl (xt , C) ≈ Δ 其中 x [l ← k] 表示将 x 的第 l 个 token 替换为 k。 t t 组件三:迭代细化调度(Iterative Refinement Schedule)。约束引导强度 γ 随扩散时间步动态调整: t t α γt = γbase ⋅ (1 − ) T 其中 α > 0。早期步骤(t 接近 T )使用高引导强度以塑造全局结构,后期步骤(t 接近 0)降低引导强度以精细化局部的 流畅性。DINGO 实验表明 α = 2 时效果最佳:在结构建立阶段给予强引导,在细节润色阶段放松约束以防止过度调校。 图13-12 展示了 DINGO 框架中扩散去噪器、约束控制器和引导模块的交互流程。 Diffusion denoiser θ Constraint controller ψ Guidance Module loop [For each timestep t = T to 1] Denoise prediction for current state x_t Output candidate distribution p_θ(x_{t-1} | x_t) Compute current constraint satisfaction score s_t Pass constraint score and constraints C Compute guidance score g^l_k for each position Corrected distribution p_θ^DINGO(x_{t-1} | x_t, C) Sample x_{t-1} Dynamically adjust guidance strength γ_t Output constraint-satisfying text x_0 Diffusion denoiser θ Constraint controller ψ Guidance Module 图13-12 DINGO 框架的推理流程 DINGO 的数学推导如下。 给定离散的扩散反向过程,我们希望采样满足约束 C 的序列 x 。目标是: 0 xt−1 ∼ pθ (xt−1 ∣ xt , C) 应用贝叶斯公式: p(C ∣ xt−1 , xt ) ⋅ pθ (xt−1 ∣ xt ) pθ (xt−1 ∣ xt , C) = p(C ∣ xt ) 由于 x 和 x 之间的条件独立性假设 p(C ∣ x , x ) ≈ p(C ∣ x )(在马尔可夫链假设下合理),且分母 p(C ∣ x ) 对 x 为常数: t−1 t t−1 t t−1 t t−1 pθ (xt−1 ∣ xt , C) ∝ p(C ∣ xt−1 ) ⋅ pθ (xt−1 ∣ xt ) 在离散空间中,p(C ∣ x ) 由控制器 ψ 提供。对每个 token 位置的独立近似: t−1 p(C ∣ xlt−1 = k, x−l t ) ≈ exp(γt ⋅ gk ) l 其中 x 表示除位置 l 外的其他位置。代入并归一化,得到 DINGO 的采样公式。 −l t

13.6.5 应用案例与对比

DINGO 在四类约束生成任务上取得了显著效果: •结构化输出生成。DINGO 在 JSON 生成任务上实现了 98.7% 的格式合规率(约束为 JSON Schema 语法),远高于 AR+logit mask 的 94.3%。关键差异在于:当生成嵌套 JSON 时,AR 模型在生成深层嵌套的闭合括号时已忘记了开头 的结构,而 DINGO 在每一步都受到全局结构约束的一致性检查。 •有向关键词插入。给定关键词列表 W = {w , … , w },要求生成的文本包含所有关键词且保持流畅。DINGO 将关键词 的存在性编码为软约束: k ψ(xt , W ) = ∑ max sim(hlt , emb(w)) ∣W ∣ l w∈W 其中 h 为位置 l 在当前状态下的表示,emb(w) 为关键词的嵌入。关键词覆盖率达 99.3%。 l t •长度精确控制。DINGO 通过引入特殊的长度计数 token 或直接约束有效 token 数量实现长度控制: ^0 ∣ xt ) − Ltarget )2 (len(x ψlen (xt ) = exp (− ) 2σ 2 其中 len(x^ ∣ x ) 为基于当前状态预测的最终生成长度,L 为目标长度。长度控制偏差仅为 ±2 token(95% 置信区 0 target 间),显著优于 AR 模型的 ±15 token 误差。 t •语法层面控制。将上下文无关文法(CFG)约束编码为 FSA 并行计算每个位置的合法 token 集,实现语法级别的精确 控制。这在代码生成(SQL 语法约束)和数据格式化(CSV 模板)等场景中有价值。 如表13-9 所示,扩散约束推理在全局感知和精确控制上显著优于 AR 约束解码。 维度 AR 约束解码 DINGO / 扩散约束推理 约束注入时机 仅解码时(每步) 任意去噪步 全局约束感知 弱(仅看前缀) 强(全局双向) 约束类型支持 局部为主 局部 + 全局 格式合规率 (JSON) 94.3% 98.7% 长度精确度 ±15 token ±2 token 关键词覆盖率 92.1% 99.3% 额外推理开销 低(logit mask) 中等(控制器前向) 实现复杂度 低 中等 表13-9 扩散约束推理与 AR 约束解码对比 DINGO 的额外推理开销主要来自控制器 ψ 的前向计算。控制器网络约 100M 参数(主模型的 1-2%),每步额外开销约 3- 5%。但扩散模型本身受益于约束引导下的更快收敛(DINGO 通常可在 50-70% 的步数内达到与无引导扩散相同的质 量),总体推理成本实际上是降低的。

13.6.6 局限性与未来方向

DINGO 虽然在多项约束生成任务上取得了突破,但仍面临若干挑战:

  1. 控制器训练需要带约束标注的数据集,获取成本较高。DINGO 论文证明了少量(1000-5000 条)标注即可训练有效的 控制器。
  2. 多约束之间的潜在冲突(如同时要求简洁和详细)的解决策略仍需进一步研究。
  3. 控制器泛化到未见过的约束类型(如新的语法范式)的能力有限。
  4. 极端强约束下(如强制性词汇包含率达 100%),生成质量仍会下降,这是所有约束生成方法的共性难题。 未来的研究方向包括:将约束推理与复杂度均衡策略结合,为约束密集的区域(如 JSON 的嵌套结构部分)自动分配更多 扩散步数;以及将约束控制器与推理时搜索(test-time search)结合,在自投机解码框架中实现约束验证。

13.7 自回归与扩散的融合

自回归(AR)与扩散并非互斥的替代方案,而是互补的生成范式。2025-2026 年间,两类范式的融合成为文本生成领域 最活跃的研究方向之一。本节从混合架构和自投机解码两个维度,探讨 AR 与扩散融合的理论与实践。

13.7.1 融合的动机与设计空间

自回归模型和扩散模型在能力上存在天然互补:AR 擅长局部流畅性和精确 token 选择,但全局结构规划弱、并行效率 低;扩散擅长全局迭代优化和高并行效率,但局部流畅性和精确 token 选择中等。这种互补性定义了融合的设计空间, 两类模型分别承担不同的生成职责。图13-13 展示了四种架构方案的设计思路。 AR-Diffusion Hybrid Architecture Design Space AR planning + diffusion refi Diffusion skeleton + AR filli Alternating AR/Diffusion bl Self-Speculative Decoding nement ng ocks (Speculative) (Top-Down) (Bottom-Up) (Interleaved) AR skeleton -> diffusion de Diffusion anchor -> AR fill-i Precision block AR, paralle Diffusion draft -> AR verify tail n l block diffusion 图13-13 AR-扩散融合的四种架构方案

13.7.2 AR 规划与扩散细化

这是最直观的融合方案:先用 AR 模型生成高层结构(如章节大纲、段落主题句),再用扩散模型根据该结构生成详细内 容。 AR 规划器生成结构标记 z(可以是一组关键词、主题向量或摘要嵌入),扩散解码器以 z 为条件生成最终文本: p(x ∣ z) = ∫ pθ (x0:T ∣ z) dx1:T 在实现层面,z 通过交叉注意力(Cross-Attention)条件化注入到扩散 Transformer 的每一层中: WQ ht ⋅ (WK z)⊤ CrossAttn(ht , z) = Softmax ( ) ⋅ WV z d 优势在于 AR 模型的强局部流畅性保证了高层结构的连贯,扩散模型则利用并行能力快速生成大段内容。缺点是 AR 规划 的错误会向下传播,且两阶段的信息瓶颈(z 的维度有限)可能丢失重要细节。 代表性工作包括 InstructDiffusion(2023-2024)系列,使用指令微调后的 AR 模型生成文本计划,扩散模型完成执行。

13.7.3 扩散骨架与 AR 填充

与 AR 规划与扩散细化方案相反,此方案先用扩散模型在低分辨率/高凝缩空间中生成内容骨架(如每 8 个 token 的位置 生成一个锚点词),然后用 AR 模型以自回归方式填充骨架间的 token。 双阶段流程如下:

  1. 扩散阶段:在压缩的 token 序列上执行扩散生成,输出锚点 tokens {a , a , … , a },其中 K = ⌈L/B⌉,B 为骨架间 1 2 隔。 K
  2. AR 填充阶段:以锚点为条件,自回归地生成每个 [a , a ] 区间内的 tokens: i i+1

x[iB,(i+1)B] = AR-Decode(x<iB , ai , ai+1 ) 优势在于扩散模型确定全局语义结构,确保内容不跑题,AR 模型保证局部流畅性。缺点是锚点间隔 B 的选择是关键超参 ——过小则扩散步骤的并行优势丧失,过大则 AR 填充容易偏离锚点的语义约束。

13.7.4 交替 AR/扩散混合

交替方案将序列划分为交替的 AR 段和扩散段: x = [AR-Blocks ∣ Diffusion-Blocks ∣ AR-Blocks ∣ …] 高精度段 高并行段 高精度段 一个自适应的调度器决定每个段的生成方式。调度器考虑的因素包括: •token 的复杂度(类似于 CBDS 的复杂度估计器) •段内的一致性强弱(强一致性需求用扩散) •段的边界性质(需要精确 token 选择的位置用 AR) BlockDiffusion(2025)是该方案的代表性实现。其核心创新在于共享参数:同一个 Transformer 骨干网络既能执行 AR 解码(通过因果注意力掩码),也能执行扩散解码(通过双向注意力),通过切换注意力掩码在不同段之间转换模式。图 13-14 展示了模式调度器在 AR 段与扩散段之间的切换流程。 Mode Scheduler AR Decoder Diffusion Decoder Input: Task description + generation length Analyze segment allocation plan Segment 1: AR mode Generate start token (high precision) Return generated tokens block 1 Segment 2: Diffusion mode Denoise generation (highly parallel) Return generated tokens block 2 Segment 3: AR mode Generate end token (high precision) Return generated tokens block 3 Concatenation: [block1 | block2 | block3] Mode Scheduler AR Decoder Diffusion Decoder 图13-14 交替 AR/扩散块生成流程

13.7.5 自投机解码

自投机解码(Self-Speculative Decoding)是最具创新性的融合方案。其核心思想是:用扩散模型快速生成一个草稿 (draft),然后用 AR 模型并行验证并修正该草稿。 标准的投机解码需要训练/使用一个独立的草稿模型(draft model),而自投机解码的创新在于,同一个模型的不同解码 模式互为草稿与验证器。 算法流程如下:

  1. 扩散生成草稿:扩散模型在 S 步内(S ≪ L)生成一个完整的候选序列 x^ 。 0
  2. AR 验证:AR 模型逐 token 验证 x^ 的每个位置。验证过程检查对于每个位置 l: •如果 p (x^ ∣ x ) = p (x^ ∣ x^ ) 在阈值 δ 内,接受该 token。 l l −l AR 0 <l Diff 0 0 •否则,用 AR 模型重新采样该 token,并继续后续的验证。
  3. 部分修正:未被接受的位置由 AR 模型修正。与传统投机解码的首次分歧则丢弃后续不同,自投机解码允许部分接受, 因为扩散模型生成的 token 可能在多数位置与 AR 模型的偏好一致。 自投机解码保持了 AR 模型的精确采样分布: pself-speculative (x) = pAR (x)

证明如下:对于每个位置 l,如果草稿 token 被接受,则该 token 按照 p 采样;如果被拒绝,则重新按照修正后的分布 AR 采样(同样服从 p )。因此,由于 AR 模型的链式分解,整体序列分布与纯 AR 解码完全一致。 AR 设接受率为 ρ(通常 ρ > 0.8),扩散步数为 S,序列长度为 L。自投机解码的总计算量约为: Ctotal ≈ Cdiff ⋅ S + CAR ⋅ (1 − ρ) ⋅ L 与纯 AR 解码的 C ⋅ L 相比,当 C ⋅ S < ρ ⋅ C ⋅ L 时获得加速。在实际系统中(以 LLaDA 8B 为例),扩散每步的计算 AR diff AR 量约为 AR 每 token 的 2-3 倍,S = 64,L = 512,ρ = 0.85: Ctotal ≈ 3 ⋅ CAR ⋅ 64 + CAR ⋅ 0.15 ⋅ 512 = (192 + 76.8) ⋅ CAR = 268.8 ⋅ CAR 对比纯 AR 的 512 ⋅ C ,自投机解码获得约 1.9 倍的理论加速。实际系统通常观察到 1.3-1.6 倍的端到端加速(因验证开 AR 销和通信延迟)。

13.7.6 统一框架与展望

AR 和扩散的融合正在推动统一生成框架(Unified Generation Framework, UGF)的愿景,即用一个模型处理所有生成 任务(文本、图像、视频、音频、代码),为每个 token/patch 自适应选择最优生成范式。 UGF 面临三个关键设计问题: •统一 Tokenization。文本使用离散 token(BPE/SentencePiece),图像使用连续 patch(VAE latent)。Transfusion 的方案是:语言 token 使用嵌入查找表,图像 patch 使用线性投影,二者映射到相同的嵌入维度后输入统一的 Transformer 层。输出端,语言 token 通过 softmax 转换为离散分布,图像 patch 通过线性解投影恢复到连续空间。 •统一损失函数。AR 使用交叉熵损失,扩散使用 ℓ /变分损失。联合优化方案如下: 2 image Lunified = Ltext AR + λ ⋅ Ldiff + μ ⋅ Lconsistency 其中 L 促进两类模态的表示空间对齐(如对比损失)。 consistency •自适应范式选择。如何决定某个位置应该用 AR 还是扩散?当前启发式策略包括:文本 token 默认 AR(精确性优先), 图像 patch 默认扩散(质量优先),结构化数据可选扩散(约束可控),混合区域交替模式。更智能的范式选择仍是开 放研究问题。 如表13-10 所示,融合方案在质量和效率上均超越了各自的纯范式版本。 模型 范式 参数量 MMLU GSM8K HumanEval MT-Bench 解码效率 LLaMA 3 8B AR 8B 68.4 79.6 62.2 8.1 1.0× LLaDA 8B 扩散 8B 67.1 65.4 42.7 7.3 0.6× (T=128) Dream 7B 扩散 7B 63.8 58.2 36.0 6.8 0.4× (T=512) CBDS+LLaDA 扩散(优化) 8B 67.0 65.1 42.3 7.2 1.8× (vs LLaDA) BlockDiffusion 融合(交替) 8B 67.8 70.2 48.5 7.6 2.3× (vs AR) Self-Speculative 融合(投机) 8B 67.1 65.4 42.7 7.3 1.5× (vs AR) 表13-10 自回归与扩散融合范式对比 注释:MT-Bench 为多轮对话质量评分(1-10),解码效率以 LLaMA 3 8B AR 解码为 1.0 倍基准。 从表中可观察到几个重要趋势:纯扩散模型在知识和推理基准上正快速追赶 AR 模型,LLaDA 8B 与 LLaMA 3 8B 的整体差 距已缩小到 5% 以内;融合方案通过结合两种范式的优势,在质量和效率上均超越了各自的纯范式版本;代码生成是扩散 模型的相对短板(HumanEval 差距约 20pp),这恰好是 AR 模型的强项,也是融合架构最能发挥互补优势的领域。 未来方向包括四个方面。 •全范式统一训练:当前融合方案大多是训练后拼接或交替训练,未来趋势是一个模型在预训练阶段就同时学习 AR 和扩 散两种生成范式,例如使用 Mixture-of-Experts(MoE)架构为不同范式分配专家子网络。 •动态难度自适应:将 CBDS 的自适应计算分配思想从扩散步数扩展到范式选择,简单的通顺句用扩散快速生成,复杂的 数学推理用 AR 精确构建,二者在同一个序列中无缝切换。 •扩散推理效率的阶跃提升:尽管 CBDS 和自投机解码已取得可观加速,但要将扩散模型带入实时交互应用还需数量级的 降步改进。Single-step diffusion 和 consistency models 在图像领域已验证 1-4 步扩散的可行性,将其适配到离散语 言空间是核心挑战。 •安全对齐中的扩散角色:扩散模型的全局可控性在安全对齐上具有天然优势,可在去噪过程中注入安全约束进行实时过 滤。DINGO 约束框架已初步展示了这一能力。 扩散语言模型从 2021 年的 D3PM 论文开始,到 2025 年的 LLaDA 工业化验证,再到 2026 年的 CBDS、DINGO 和融合架 构,仅用了五年时间就从一个学术概念发展为与自回归模型并驾齐驱的生成范式。虽然 AR 模型在当前的 LLM 生态中仍占 据主导地位,但扩散生成在并行效率、双向上下文和可控性上的结构性优势,正在使其成为下一代大语言模型架构的有力 候选。离散扩散、均衡分解、约束推理与范式融合等进展,共同构成了扩散语言模型的核心知识体系。扩散生成在多模态 领域的应用是一个活跃的前沿方向。