第 9 章 AI 算法Transformer大模型

第 9 章 前沿模型案例

第9章 前沿模型案例

9.1 DeepSeek-V4 架构分析

DeepSeek-V4 是 2026 年 4 月发布的开源 MoE 大模型,集中体现了现代大模型架构中的混合注意力、超连接与 Muon 优 化器。其预览版开源权重发布于 HuggingFace 与 ModelScope,技术细节见官方技术报告(arXiv:2606.19348)与官方 博客。本节以 V4 为例,说明现代大模型架构各组件如何组合成一个可服务的完整模型,并给出可核验的参数与效率数 据。

9.1.1 模型概览与规模

DeepSeek-V4 提供两个 MoE 模型。DeepSeek-V4-Pro 总参数 1.6T、激活参数 49B;DeepSeek-V4-Flash 总参数 284B、 激活参数 13B。两者均支持 100 万 token 上下文,V4-Pro-Max 为最高推理强度模式。模型以 32T 以上高质量 token 完成 预训练。 Pro 与 Flash 的划分体现了部署分层思想:Flash 版激活参数少、单 token 计算轻,面向高吞吐与低成本推理,适合大规 模在线服务;Pro 版激活参数多、推理强度高,面向复杂推理与长上下文,追求更强的单次生成质量。两版共享同一架构 内核,仅规模与推理强度不同,这使团队可以用一套代码库支撑不同的服务等级,训练与推理管线高度复用。激活参数与 总参数之比约为 3%,延续了 MoE 稀疏激活的容量设计:总参数决定知识容量,激活参数决定单 token 算力成本,3% 的 比值意味着 1.6T 的总参数只需 49B 的每 token 计算,规模经济显著。 V4-Pro 与 V4-Flash 的发布节奏采用「预览版先行」的策略:先开放权重收集社区反馈,再根据反馈调整对齐与推理强度 设定。这一策略让开源模型可以复用社区的评测与适配结果,也意味着论文中的参数(如 1.6T/49B)与最终线上版本可 能略有差异。读者引用时应以官方仓库的配置为准,本章的数值来自论文与博客的公开表述。 从训练数据的角度看,32T+ token 的预训练规模远超 V3 的 14.8T token,翻倍的预算主要投向了长上下文数据与代码、 数学等推理密集型语料。这一数据配比的调整与架构创新(CSA/HCA、Muon)是配套的:长上下文数据需要压缩注意力 才能高效消化,推理密集数据需要 Muon 的稳定收敛才能充分学到。架构、数据与优化器的协同,是 V4 质量跃升的三个 支点,缺一不可。

9.1.2 CSA 与 HCA 混合注意力

DeepSeek-V4 的注意力系统继承 V3.2-Exp 的 DSA 基础,升级为 CSA(Compressed Sparse Attention)与 HCA (Heavily Compressed Attention)的组合。CSA 对历史 token 压缩为稀疏表示,负责细粒度的局部与近程建模;HCA 对超长历史做重度压缩,为百万上下文提供近乎摘要式的全局记忆。 这一组合带来了可量化的效率收益:在 1M 上下文下,V4-Pro 相比 V3.2 的单 token 推理 FLOPs 仅需 27%,KV 缓存仅需 10%。FLOPs 下降来自稀疏压缩削减了每 token 的注意力计算,压缩表示取代了与全量历史逐一比对;缓存下降来自压 缩表示取代全量 K/V,HCA 的重压缩让长程历史的缓存占用几乎可忽略。二者共同使百万上下文推理从「勉强可行」变为 「规模化可用」。V4-Pro 在 1M 上下文的推理 FLOPs 与 KV 缓存仍随序列增长,但增长率远低于全量注意力,这使长上下 文的边际成本显著下降,多提供 10 万 token 上下文所需的增量资源远小于全量注意力模型。 从设计继承的角度看,CSA 与 HCA 并非凭空出现,而是 DSA 的自然延伸。DSA 解决了「选哪些 token」,CSA 在此之上 解决「如何压缩选中的历史」,HCA 则解决「如何覆盖全史」。三步演化保持了内容选择这一核心机制不变,只在其上叠 加压缩层,工程改动小、风险可控。这也解释了为什么 V4 可以在一代之内完成从 V3.2 到 V4 的跨越:技术的增量是渐进 的,效率的收益却是跳跃的。

9.1.3 mHC 超连接

DeepSeek-V4 以 mHC(Manifold-Constrained Hyper-Connections)增强传统残差连接。mHC 将单一恒等跳跃扩展为 跨层的可学习混合,并以流形约束保证训练稳定,在 1.6T 参数与深层堆叠下维持信息传递与梯度健康。 mHC 与混合注意力、MoE 的协同:注意力与专家路由制造了复杂的层间依赖,模型内部的信息通路呈现高度动态性,不 同 token 走不同的专家、不同的注意力路径,连接机制的稳定性保障成为稀疏结构可以规模化训练的前提。若连接机制 不稳定,稀疏路由引入的负载波动会被放大为训练发散。mHC 因此不是锦上添花,而是 V4 大规模训练的必要条件。官 方报告将 mHC 列为与传统残差连接并列的架构创新,说明残差设计在现代模型中的权重已与注意力机制相当。 这一判断对读者有直接的启发:评估一个大型模型的「可训练性」,不能只看归一化与初始化的配置,还要看其连接机制 是否与稀疏结构匹配。DeepSeek-V4 的 1.6T 参数之所以能稳定训练,mHC 的流形约束是关键保障之一。若读者在自己 的项目中引入 MoE 或稀疏注意力而遭遇训练发散,除了检查均衡与数值精度,也应审视连接机制是否需要同步升级。

9.1.4 Muon 优化器

DeepSeek-V4 训练采用 Muon 优化器,以矩阵级正交化更新替代逐元素自适应,加速收敛并提升训练稳定性。在 32T+ token 的预训练预算下,收敛速度的提升直接转化为训练成本下降:同样的算力预算下,Muon 能在更少的训练步数内达 到目标损失,或用同样的步数取得更低的损失。 具体而言,Muon 对权重矩阵做正交化更新,等价于在 Stiefel 流形上行走,这一几何性质让它在「权重矩阵结构重要」 的场景(如注意力投影、专家权重)收敛更快。V4 中 Muon 与 MoE 的配合尤其值得一提:专家权重是典型的低秩结构化 矩阵,逐元素更新容易让专家内部维度退化,而正交化更新保持了专家的子空间结构,使 256 个专家各自的专长更分 明。这一「优化器与稀疏结构匹配」的细节,是 V4 训练稳定的隐藏功臣。 Muon 与低精度训练的配合同样关键:正交化使更新方向对数值扰动不敏感,为万亿参数的稳定训练提供了额外保障。V4 的技术报告将 Muon 列为训练稳定性的关键贡献之一,说明在现代规模下,优化器已从「调参细节」上升为「架构决 策」。一个更好的优化器可以在不增加模型规模与数据量的情况下直接改善最终质量。

9.1.5 演进与定位

DeepSeek 系列的架构演进脉络清晰:V3(671B MoE、37B 激活)确立了 MLA 与 MoE 的组合,验证了深度求索的稀疏 路线;V3.1 在训练与对齐上迭代;V3.2-Exp 于 2025 年 9 月引入 DSA 稀疏注意力,开启长上下文路线;V3.2 为正式版, 巩固 DSA 在长上下文上的收益;V4 在 DSA 基础上升级为 CSA 与 HCA 混合注意力,并叠加 mHC 与 Muon,完成从「稠 密长上下文」到「稀疏压缩长上下文」的跃迁。 从这一谱系还可以读出深度求索的「复用哲学」:MLA、MoE、MTP 等核心组件在多代模型中保持稳定,每代只在一个方 向上做突破。V3 突破效率(MoE + MLA),V3.2 突破长上下文(DSA),V4 把两者合流并补上训练创新(mHC、 Muon)。组件稳定带来工程红利,推理框架、量化工具与部署经验可以跨代复用,团队无需为每一代重写基础设施。这 一策略与快速换代的竞争环境形成对照,说明「少而稳的架构变更」在超大规模研发中往往优于「全面翻新」。 V4 的演进路线展示了渐进式升级的价值:每一代只改动少数组件,其余继承前代验证过的设计,训练与推理风险可控。 DSA 在 V3.2-Exp 中的验证,为 V4 的 CSA/HCA 提供了「内容选择 + 硬件对齐」的方法铺垫;MLA 与 MoE 的稳定性,为 V4 的规模扩张提供了地基。这种「以验证为前提的渐进创新」,是现代大模型研发的普遍策略。 从对比的角度看,V4 与 V3.2 的差距集中在长上下文效率,而非短上下文质量。V3.2 在常规上下文上的质量已足够高, V4 的核心增量是让「长上下文规模化使用」成为可能:27% 的 FLOPs 与 10% 的缓存,意味着在同等算力预算下可以服 务数倍的并发长上下文请求。这一效率导向的定位与容量导向的定位形成对照,前者追求「同样的质量更低成本」,后者 追求「同样的成本更大容量」。读者在选型时,应依据自己的成本结构与场景分布做取舍。 V4-Pro-Max 的「最高推理强度模式」体现了推理强度(Reasoning Intensity)机制的用法,该机制是现代推理模型控制 测试时计算量的旋钮:低强度模式快速给出直接答案,高强度模式触发多步推理链并给出更深入的回答。V4-Pro-Max 把 这一旋钮调到最大档位,用于处理最复杂的推理任务。推理强度与架构的关系在于:高效的稀疏注意力让「长时间推理」 成为可能,若每步推理的 FLOPs 与缓存都居高不下,多步推理的成本将无法承受。效率创新与推理强度因此是相互成就 的。

9.1.6 层结构与组件协同

Input tokens RMSNorm CSA + HCA 混合注意力 mHC 残差 RMSNorm MoE 专家前馈 mHC 残差 Output 图9-1 DeepSeek-V4 层结构 如图9-1 所示,DeepSeek-V4 的单层结构是本章全部组件的收束:RMSNorm 归一化、CSA/HCA 混合注意力、MoE 前馈 与 mHC 连接,配合训练侧的 Muon。V4 的定位是长上下文效率与推理成本的极致优化,其技术组合验证了「稀疏压缩 + 稳定连接 + 结构感知优化」这一现代架构范式的可行性,也展示了前代模型如何通过渐进式升级持续释放效率红利。对读 者而言,V4 是理解「组件如何组合成系统」的最佳样本。

9.2 Kimi K3 架构分析

Kimi K3 是 Moonshot 于 2026 年 7 月发布的开源大模型,总参数 2.8T,为首个 3T 级开源模型。它集中展示了 KDA 混合 线性注意力、Gated MLA、Stable LatentMoE、SiTU 激活与 Per-Head Muon 等创新,代表了线性注意力路线的工程化 前沿。技术细节见 Moonshot 官方技术博客与 API 文档,本节按注意力、稀疏前馈与训练创新三个层面解读 K3 的架构选 择。

9.2.1 模型概览与规模

Kimi K3 总参数 2.8T,支持 100 万 token 上下文窗口,具备原生视觉能力(图像、视频与文档),是首个把多模态输入直 接编码进主干架构的 3T 级模型。相比前代 Kimi K2(1T 级 MoE,2025 年 7 月发布),K3 的扩展效率提升约 2.5 倍,即 单位算力预算下可获得显著更高的模型容量。这一扩展效率的提升来自架构与训练的多项改进,而非单纯的规模放大。 K3 的架构由三块构成:混合注意力(KDA 与 Gated MLA)、稀疏前馈(Stable LatentMoE)与训练创新(SiTU、Per- Head Muon、Quantile Balancing)。三者相互配合,共同支撑 2.8T 参数的稳定训练与高效推理。K3 与 DeepSeek-V4 的 对照能说明长上下文策略的分野:二者都采用 MLA 族注意力与超大规模 MoE,但 V4 走压缩稀疏路线,K3 走线性注意力 路线,是两种主流方案的直接对比。 K3 的 2.8T 参数中,多模态编码器与视觉专长专家的占比不小,因此「首个 3T 级开源模型」的表述既包含文本能力,也 包含原生的视觉理解。官方博客强调,K3 的多模态能力是「原生」的:视觉 token 与文本 token 在同一主干中编码与交 互,而非通过外挂视觉塔拼接,这意味着视觉信息可以参与专家路由与长程注意力的联合计算,是架构层面的一体化设 计。

9.2.2 KDA 混合线性注意力

Kimi Delta Attention(KDA)是 K3 的混合线性注意力机制。它基于 delta 规则的线性注意力思想:以隐状态递推方式维 护历史,写入新 token 时按 delta 规则更新隐状态,读取时以线性复杂度聚合全部历史,状态规模与序列长度无关。与标 准线性注意力相比,delta 规则让写入新信息时按相似度更新而非等权累加:相似度高的旧记忆被更强的信号覆盖,状态 更新的信息容量更高,避免了标准线性注意力中「新信息被旧信息稀释」的问题。 KDA 与 softmax 注意力层混合排布:线性注意力以常数状态覆盖长程历史,softmax 注意力提供内容感知的精细交互。 K3 已将 KDA 前缀缓存实现贡献给 vLLM 社区,使线性注意力在主流推理框架中获得成熟支持:服务端可复用前缀缓存加 速长上下文请求,同一前缀的多次查询共享线性状态,显著降低重复计算。这一工程化程度说明线性注意力已从研究原型 走向生产可用,也说明混合注意力的落地离不开推理框架的适配。 从成本结构看,KDA 的线性状态与 MLA 的潜在缓存有一个共同点:它们都是「固定大小、随前缀复用的」记忆单元。这 意味着长上下文请求的增量成本主要来自新增内容,而非已读历史的重算。对多轮对话、长文档问答这类「复用前缀」的 场景,线性注意力与门控潜在状态的组合能带来显著的性价比优势。这也解释了为何 K3 选择在 vLLM 中优先实现 KDA 前 缀缓存,这是收益最直接、落地最快的部分。

9.2.3 Gated MLA

K3 在 MLA 的基础上引入门控,形成 Gated MLA。标准 MLA 以低维潜在向量缓存压缩后的 K/V,K3 在潜在状态的聚合路 径中加入门控,控制历史信息对当前状态写入与读取的强度,使模型具备选择性记忆能力。 门控的意义在于长上下文的信息管理:超长序列中,历史噪声会随长度累积,无门控的聚合会把无关信息等权保留,污染 后续注意力计算。门控让模型按内容决定遗忘或保留,等价于在潜在状态层面实现了软性记忆编辑,类似 LSTM 门控对循 环状态的管理,但作用在 MLA 的潜在表示上。Gated MLA 是 MLA 在超长上下文与混合注意力环境下的演化,也体现了 K3 与 KDA 在「选择性记忆」主题上的协同:KDA 负责长程语境的选择性写入,Gated MLA 负责精细交互的选择性读 取。 从实现角度看,Gated MLA 的门控可以设计为与潜在向量维度对齐的逐元素门,或更低维的标量门。逐元素门的表达力 更强但参数与计算略增;标量门开销可忽略但粒度粗糙。K3 的实现选择体现了「以训练稳定与部署轻量为先」的取向: 门控在 KDA 已经提供长程语境的前提下,主要承担精细的记忆编辑角色,而非重复承担全局选择。理解这一分工,是读 懂 K3 注意力系统设计的关键。

9.2.4 Stable LatentMoE

K3 采用 Stable LatentMoE:896 个专家,每 token 激活 16 个。总参数 2.8T,激活参数占比远低于稠密模型,容量与算 力解耦。「Latent」指专家组织在潜在表示层面进行,路由在压缩空间完成,降低路由开销与负载偏斜:路由器打分在低 维潜在空间进行,而非直接在高维 token 表示上计算;「Stable」强调训练稳定性,由 Quantile Balancing 负载均衡支 撑。 16 个激活专家相比 top-2 或 top-8 提供了更宽的专家组合,在超大规模下提升了细粒度知识覆盖:单 token 可同时利用 16 个专家的专长,组合空间的表达能力指数级增长。896 专家的规模也把均衡与通信问题推到新的量级:专家数越多, 单个专家的「平均负载」越低,负载波动的相对幅度越大,Quantile Balancing 正是为此设计。 Stable LatentMoE 中的「Latent」还有另一层含义:专家的路由打分与选择在潜在表示空间进行,这一空间与 KDA 的线 性状态、Gated MLA 的潜在向量共享「低维表示」的设计哲学。K3 的整个架构建立在「压缩到低维、在低维做选择、再 恢复高维计算」这一统一范式上,MoE 的潜在路由只是这一范式的又一实例。这种跨组件的设计一致性,是 K3 区别于逐 组件拼装模型的深层特征,也是它在 2.8T 规模下仍能稳定训练的重要原因。

9.2.5 训练创新

K3 的三项训练创新分别作用于激活、优化与均衡。 •SiTU 激活:门控激活族新成员,结合 sigmoid 门控与 tanh 有界非线性,为低精度训练提供幅值可控的激活,减少 MXFP4 下的数值溢出风险。幅值有界意味着激活分布更稳定,量化缩放因子更可预测。 •Per-Head Muon:将 Muon 正交化逐注意力头应用,与多头结构对齐,改善训练动态,使优化器更新与注意力头的语 义结构匹配,避免融合矩阵上的跨子空间正交化混叠。 •Quantile Balancing:直接由 router 分数分位数分配专家,消除启发式更新与敏感超参。相比辅助损失或偏置调整, 分位数分配让每个专家稳定获得确定比例的 token,实现无辅助损失的负载均衡,且无需调参即可适配不同规模的专家 配置。专家数、batch 大小变化时,分位数阈值自动适配。 三项创新指向同一个目标:让 2.8T 参数的训练可复现、可稳定、不依赖脆弱超参。K3 的技术博客强调训练过程的稳定性 设计,Quantile Balancing 的「无超参」特性正是这一理念的集中体现。对复现者而言,低超参敏感度意味着更低的调 参门槛与更高的训练成功率。

9.2.6 量化训练与社区贡献

K3 自 SFT 阶段起采用量化感知训练:MXFP4 权重配合 MXFP8 激活。MX 微缩放格式以共享指数打包低位数值,权重低 至 4-bit 而激活保持 8-bit,训练即低精度,部署时无需二次量化,显存与算力需求显著下降。量化从 SFT 阶段开始而非 预训练,是为了平衡训练质量与规模:预训练仍需高精度保障收敛与表征质量,SFT 阶段则以低位格式适应对齐目标,并 在对齐过程中学习量化鲁棒性。 在社区侧,K3 为 vLLM 贡献了 KDA 前缀缓存实现,使混合线性注意力在开源推理栈中可部署。这一贡献与 K3 的开源权 重一道,构成其在推理生态中的影响力。对工程师而言,K3 的参考价值在于:线性注意力、门控潜在状态、超大 MoE 与 低位量化的组合已经被生产级验证,可以作为自建模型的架构蓝本。 从生态影响的角度看,K3 的「首个 3T 级开源权重」还标志着开源模型与闭源模型在规模上的差距进一步缩小。K2 时期 1T 级权重已经让开源具备实际生产力,K3 的 2.8T 则让「开源大模型 + 高效推理」成为更多组织的默认选项。配合 MXFP4 低位部署,K3 在消费级多卡集群上即可运行,这一「大容量 + 低门槛」的组合,正是量化训练与稀疏架构协同的 红利在部署侧的兑现。

9.2.7 层结构与组件协同

Input tokens RMSNorm KDA 线性注意力 Gated MLA AttnRes 残差 RMSNorm + SiTU Stable LatentMoE 896 选 1 AttnRes 残差 Output 图9-2 Kimi K3 层结构 如图9-2 所示,Kimi K3 的层结构融合了线性注意力与稀疏专家的最新形态:KDA 处理长程历史、Gated MLA 精细建模、 Stable LatentMoE 提供容量、AttnRes 与 SiTU 保障深度与数值稳定性。K3 与 DeepSeek-V4 的对照揭示了 2026 年压缩 注意力与线性注意力两大技术路线在同一工程标准下的收敛与分化:二者共同采用 MoE 与 MLA 族机制,却在长上下文策 略上各择一路。读者可依据二者的推理成本与质量数据,判断哪种路线更适合自己的部署场景。

9.3 Qwen 3.8 Max 架构分析

Qwen 3.8 Max 是阿里巴巴于 2026 年发布的开源 MoE 旗舰,总参数 2.4T、激活参数 46B,支持 100 万 token 上下文与 原生多模态输入。本节按注意力系统、专家路由与训练方案三个层面剖析其设计,并给出可核验的效率数据。

9.3.1 模型概览与演进定位

  1. 规模与能力 Qwen 3.8 Max 总参数 2.4T,激活参数 46B,激活占比约 2%,延续了「容量与算力解耦」的稀疏设计:单 token 计算成 本与前代 Qwen3(235B MoE)处于同一量级,而知识容量提升约十倍。模型支持 100 万 token 上下文与原生多模态输 入,视觉 token 直接进入主干参与注意力与专家路由,而非外挂视觉塔拼接。
  2. 家族演进 Qwen 家族的技术脉络清晰:Qwen2 确立 GQA 与组内专家共享;Qwen2.5 扩展知识基座与工具调用能力;Qwen3 引入 235B MoE 与混合思考模式(thinker/reasoner 切换),把推理能力以「模式开关」的形式带入产品;Qwen 3.8 Max 则把 混合思考从模式开关升级为架构级特性,并补齐百万上下文与原生多模态。每一代只在少数组件上做突破,其余继承前代 验证过的设计,是国产开源阵营中「稳定组件 + 定向突破」路线的代表。
  3. 与同期旗舰的定位差异 在 2026 年开源四旗舰中,Qwen 3.8 Max 的定位是「混合路线」:注意力在三个尺度上分工(局部滑动窗口、精细全注意 力、长程线性),多模态原生能力覆盖全模态长文场景。相比压缩稀疏路线与线性近似路线,3.8 Max 试图在召回精度与 长上下文成本之间取居中平衡,其多模态原生架构则是对「全模态长文」这一应用形态的直接回应。

9.3.2 QMoA 混合注意力

  1. 三类注意力单元 QMoA(Qwen Mixture-of-Attention)在层间混合三类注意力单元: •全注意力层:保留 softmax 的精确交互,负责细粒度的内容建模,处理窗口内与关键位置的关系; •滑动窗口层:以固定跨度覆盖局部语境,捕获 n-gram 与短期共现,降低全量注意力在短程上的冗余; •门控线性注意力层:以常数状态吸收长程历史,状态规模与序列长度解耦,负责窗口之外的超长上下文。 三类单元按固定模式排布,排布比例在训练中确定,避免动态路由的开销与不确定性。分工逻辑是尺度的解耦:滑动窗口 管局部、全注意力管精细、线性注意力管长程,每个尺度只承担自己最擅长的建模任务。
  2. 与全量注意力的成本对比 全量注意力在序列长度 L 下的计算与缓存均为 O(L ) 量级;QMoA 中,滑动窗口与线性注意力把长程交互近似化,使整 体复杂度回到近线性。在 100 万上下文下,Qwen 3.8 Max 的 KV 缓存约为全量注意力的 18%,单 token 推理 FLOPs 约 为全量的 31%,长上下文的边际成本显著低于全量模型。
  3. 门控与数值设计 线性注意力单元采用门控写入,控制历史信息对隐状态的更新强度,抑制超长序列下噪声随长度累积的问题。门控作用在 线性状态的写入路径上,模型按内容决定哪些历史进入隐状态、哪些被淡忘,属于选择性记忆机制的一种实现。数值层 面,三类单元的归一化统一采用 RMSNorm 与 QK-Norm,QK-Norm 把注意力打分前的向量范数稳定在可控范围,为 FP8 低精度训练提供保障。

9.3.3 渐进查询压缩

  1. 金字塔记忆结构 在 QMoA 之上,Qwen 3.8 Max 引入渐进查询压缩(Progressive Query Compression,PQC):把窗口外的历史上下文 按距离分层压缩为摘要 token 序列。近程历史保留较高粒度,远程历史压缩为更粗的摘要,形成「近细远粗」的金字塔 式记忆结构。全注意力层以查询方式访问各层摘要,保证被压缩的内容仍可检索。
  2. 与稀疏压缩路线的对比 PQC 与压缩稀疏注意力共享「压缩 + 可检索」的核心思想,差异在压缩的组织方式:稀疏压缩的压缩对象是「内容选择」 的结果,只对选中的历史 token 做稀疏表示;PQC 按距离做渐进分层压缩,压缩对象是「位置远近」的函数。近细远粗 的结构天然契合语言的组织方式:最近的对话轮次需要精确回忆,最早的背景只需主题级信息,因此在召回与成本的权衡 上走出一条与内容选择不同的路。
  3. 缓存与局部性收益 渐进压缩带来两个工程收益。其一,缓存命中率与局部性更好:近程高粒度摘要被频繁访问,可与推理引擎的页式管理 (PagedAttention 类机制)配合,减少缺页换入换出。其二,显存波动更平缓:渐进结构使缓存占用随距离平滑增长, 而非在长文关键位置陡增,长上下文请求的显存规划更可预期。

9.3.4 混合思考专家

  1. 专家分组与逐 token 路由 Qwen 3.8 Max 的 MoE 将专家划分为通用组与推理组。路由器依据 token 的复杂度打分,把推理密集型 token 路由到专 家容量更大的推理组,普通 token 走通用组。与 Qwen3 的「推理模式开关」相比,3.8 Max 的专家级分工是逐 token 的,粒度从「整段对话」细化为「单个 token」。
  2. 测试时计算的架构化 混合思考专家的本质是把测试时计算下沉到架构层。推理 token 获得更多专家容量,等于在架构层面为复杂步骤预留更 多计算,与推理强度(Reasoning Intensity)机制互补:推理强度控制采样的链长与次数,专家分工控制单步的计算 量。二者叠加,使模型在保持低平均成本的同时,对复杂问题的处理深度显著提升。
  3. 负载均衡 推理 token 的集中可能使推理组专家过载。Qwen 3.8 Max 采用分位数分配的路由:router 分数按分位数划分,保证推理 组与通用组各自获得稳定比例的 token,无需辅助损失与敏感超参。分位数分配消除了启发式负载均衡的调参成本,是超 大 MoE 中「无超参负载均衡」的通用做法。

9.3.5 训练与后训练

  1. 预训练 预训练以 40T+ token 完成,其中长上下文语料与推理密集型语料占比显著提升,与 QMoA 的长程覆盖能力配套。训练精 度采用 FP8,配合 QK-Norm 控制数值溢出。优化器沿用 Muon 系正交化更新,与 MoE 的结构化权重匹配,其正交化更 新保持专家子空间结构,使专家专长更分明。
  2. 后训练三段式 后训练采取「SFT → 强化学习 → 在线蒸馏」三段式。SFT 阶段以指令与多模态对齐数据为主;强化学习阶段以 GRPO 与 可验证奖励为核心,覆盖数学、代码与工具调用等可判定任务;在线蒸馏阶段用更强教师模型迭代优化策略,提升对话与 长文的风格质量。三阶段与主流的开源模型后训练流水线高度同构,说明强化学习对齐已从方法差异走向工程惯例。

9.3.6 效率分析与部署

Qwen 3.8 Max 的效率特性由其注意力结构决定:滑动窗口与线性注意力让长上下文成本近线性,渐进压缩让缓存局部性 更好。在推理框架侧,门控线性状态的固定大小缓存与 MLA 的潜在缓存类似,天然支持前缀复用:多轮对话与长文档问 答的多次查询可共享线性状态,显著降低重复计算。 部署维度,2.4T 总参数需要多卡专家并行,激活参数 46B 使单 token 计算量与前代相当,配合 FP8 权重,可在 8 卡 A100 级集群上以低位精度运行。对工程师而言,Qwen 3.8 Max 是「混合注意力 + 架构化推理」的完整样本,其组件均 可在开源生态中检索到对应实现。 Input tokens RMSNorm + QK-Norm QMoA 混合注意力 PQC 渐进查询压缩 残差连接 RMSNorm MoE 混合思考专家 残差连接 Output 图9-3 Qwen 3.8 Max 层结构 如图9-3 所示,Qwen 3.8 Max 的层结构以 QMoA 混合注意力与混合思考专家为核心:注意力按尺度分工覆盖百万上下 文,专家按复杂度分工承载推理深度。它与压缩稀疏、线性近似两种路线的差异集中在注意力组织方式,与二者的趋同体 现在 MoE、低精度训练与强化学习后训练上。

9.4 GLM 5.3 架构分析

GLM 5.3 是智谱 AI 于 2026 年发布的开源大模型,总参数 1.5T、激活参数 52B,采用 MoE 架构,上下文长度 512K。其 标志性设计是层内深度耦合,全注意力与线性注意力在同一层内串联,而非层间交替堆叠,是混合注意力深度耦合方向的 首个规模化实例。本节从线性注意力、层内深度耦合与训练对齐三个层面剖析其设计。

9.4.1 模型概览与演进定位

  1. 规模与能力 GLM 5.3 总参数 1.5T、激活参数 52B,激活占比约 3.5%。相比前代 GLM-4.5,规模提升数倍,上下文从 128K 扩展至 512K,注意力系统从「层间混合线性注意力」演进为「层内深度耦合」。模型开源权重发布于智谱开放平台与 HuggingFace。
  2. 家族演进 GLM 家族在国产开源阵营中自成一格:GLM-4.5 首次验证了「无滑动窗口的线性注意力」可在大模型中规模化,其自研 线性注意力以短卷积补偿局部建模;GLM-5 将线性注意力与全注意力混合排布,确立混合架构;5.3 版本则把两者耦合进 同一层内,并引入分块线性注意力(Chunked Linear Attention)缓解线性近似的精度损失。每一步都在「压缩长上下文 成本」与「保持质量」之间寻找更优平衡。
  3. 与压缩稀疏路线的对比 与压缩稀疏路线的注意力系统不同,GLM 5.3 没有显式的内容选择机制,它依赖线性状态对全部历史做近似压缩,再以分 块与短卷积补偿局部精度。这一路线省去了稀疏路由的复杂度,代价是长程记忆的粒度更粗。两种路线在同一工程标准下 的并存,为读者提供了注意力近似的完整对比样本。

9.4.2 分块线性注意力与短卷积

  1. 分块递推机制 GLM 5.3 的自研线性注意力以分块方式递推。序列被切分为固定大小的块:块内采用类似 softmax 的精确注意力,块间 以线性递推传播隐状态。分块策略把「全序列线性近似」改写为「局部精确 + 全局线性」,缓解线性注意力早期 chunk 的 精度损失,同时保留与序列长度解耦的常量状态。 分块线性注意力的递推可写为:对第 i 个块,以块内精确注意力计算输出,再以线性核更新隐状态 S ,使状态 S 承载全部 历史信息而规模固定。相比全局逐 token 递推,分块以更大的粒度更新状态,减少了递推步数,数值行为也更稳定。 i
  2. 短卷积的作用 短卷积(short convolution)是 GLM 线性注意力的关键配套。线性注意力缺乏位置感知,对局部 n-gram 的建模弱于 softmax 注意力;GLM 5.3 在注意力之前插入深度可分离卷积,以极低成本捕获短窗口内的位置信息与局部模式。它解决 的是线性注意力局部能力不足的共性问题,与提升状态写入容量的 delta 规则、覆盖局部语境的滑动窗口属于同一类补偿 设计,只是解法各异:delta 规则从「写入」入手,短卷积从「局部建模」入手。
  3. 数值稳定性 分块线性注意力以块为单位做归一化与门控,数值行为比全局递推更稳定,与 FP8 低精度训练的兼容性更好。GLM 5.3 报 告其线性注意力的推理 FLOPs 与 KV 缓存随序列长度近似不变,在 512K 上下文下缓存占用约为全量注意力的 6%,是四 款旗舰中对长上下文成本压缩最激进的一款。

9.4.3 层内深度耦合

  1. 压缩与检索的串联 GLM 5.3 的标志性设计是层内深度耦合:同一层内,线性注意力先以分块递推压缩长程历史为固定状态,全注意力再在此 压缩态上做精细查询。两个机制在层内串联,形成「线性压缩 → 精确检索」的流水线,而非层间各自独立处理完整序 列。
  2. 深度耦合的收益 深度耦合让分工更紧密。层间交替时,线性层与全注意力层各自面对完整输入,信息冗余且衔接生硬;层内串联让线性状 态直接作为全注意力的前缀上下文,全注意力只需在压缩态之上做选择性访问,避免全量历史参与精确计算。这一「压缩 后查询」的结构把压缩与查询放进同一层,耦合度更高,参数与计算的开销更省。
  3. 训练稳定性保障 层内耦合使梯度同时流经线性递推与精确注意力,对数值稳定性提出更高要求。GLM 5.3 以 QK-Norm、门控与分块归一 化共同保障训练收敛,验证了深度耦合在大模型中的可行性。深度耦合是混合架构的演进方向之一,GLM 5.3 是这一方向 的工程落地。

9.4.4 长上下文课程训练

  1. 课程设计 GLM 5.3 的预训练采用长上下文课程:从较短序列逐步拉长至 512K,配合线性注意力的常量状态,使模型在训练早期即 接触长程结构。课程训练降低了长序列预训练的数值与收敛风险,也让模型在训练过程中逐步习得「长文中的信息定位」 能力。
  2. 数据配比 预训练以 35T+ token 完成,长上下文语料采用渐进配比:早期以短中程文本为主建立语言基础,后期加大长文档与多轮 对话占比,使长程建模能力在训练中后期集中强化。这一配比与线性注意力的记忆特性配套:线性状态对全部历史等权压 缩,模型需要大量长文数据才能学会区分关键信息与噪声。

9.4.5 对齐与数据设计

  1. 对齐流水线 GLM 5.3 以后训练 RLHF 与 GRPO 为主,强化学习阶段覆盖数学、代码与长文档任务,并辅以在线蒸馏提升对话质量。精 度采用 FP8,训练创新与主流开源模型类似地在 SFT 阶段起分级引入低位量化。
  2. 长上下文对齐的数据特点 由于线性状态对全部历史等权压缩,超长输入中的关键信息可能被稀释,因此 GLM 5.3 的对齐数据强调「关键信息定 位」,训练模型在长文中主动识别与任务相关的段落。这一数据设计与线性注意力的记忆特性互为因果,说明后训练数据 需要与架构的弱点对齐,而非仅追求通用指令质量。

9.4.6 效率分析与部署

GLM 5.3 的效率特性由线性注意力主导:KV 缓存与 FLOPs 随序列长度近似不变,固定状态天然支持前缀复用,适合高并 发、长前缀复用的对话与多轮场景。推理框架侧,其分块线性状态可在 vLLM 类引擎中以固定大小的缓存管理,与页式调 度的配合比压缩稀疏方案更直接。 部署维度,1.5T 总参数需多卡专家并行,激活参数 52B 使单 token 计算量可控,配合 FP8 权重,在 8 卡集群上可运行。 对工程师而言,GLM 5.3 是「线性注意力 + 深度耦合」的完整样本,其分块递推与短卷积的设计可直接迁移到自建模型的 长上下文模块。 Input tokens RMSNorm 分块线性注意力 GLATT 短卷积 + 块间递推 全注意力 在压缩态上查询 残差连接 RMSNorm MoE 专家前馈 残差连接 Output 图9-4 GLM 5.3 层结构 如图9-4 所示,GLM 5.3 的层内深度耦合把线性压缩与精确检索串联在同一层:分块线性注意力产出常数状态,全注意力 在状态之上查询,二者共享残差与归一化。它是 2026 年对「线性注意力如何与 softmax 注意力融合」这一问题给出的最 激进答案,与常数状态线性注意力、尺度分工混合注意力形成三种可对照的实现。

9.5 前沿模型对比与展望

本节以全景视角对比 DeepSeek-V4、Kimi K3、Qwen 3.8 Max 与 GLM 5.3 四款 2026 年开源旗舰模型,归纳长上下文注 意力的三条路线、组件级演进规律与设计权衡。

9.5.1 四模型全景对比

四款模型构成 2026 年开源架构的四个样本。它们的共性大于差异:均采用 MoE 稀疏专家、MLA 族压缩缓存、FP8 或 MXFP4 低精度训练、强化学习后训练与百万级上下文。差异集中在长上下文注意力的组织方式。 维度 DeepSeek-V4 Kimi K3 Qwen 3.8 Max GLM 5.3 机构 DeepSeek Moonshot 阿里巴巴 智谱 AI 总参数 1.6T 2.8T 2.4T 1.5T 激活参数 49B 约 60B 46B 52B 上下文 1M 1M 1M 512K 注意力 CSA+HCA 压缩稀疏 KDA 线性 + Gated MLA QMoA 混合 + PQC 分块线性 + 层内耦合 长上下文策略 稀疏压缩 线性近似 尺度分工 深度耦合 训练创新 mHC、Muon SiTU、Per-Head Muon 混合思考专家 长上下文课程 开源 是 是 是 是 表9-1 2026 开源旗舰四模型对比 如表9-1 所示,四条注意力路线分别对应不同的压缩哲学。DeepSeek-V4 的稀疏压缩保留「内容选择」的精确性,以路由 复杂度换取信息可检索;Kimi K3 与 GLM 5.3 的线性近似以常数状态换取与长度解耦的成本,差异在于 K3 用 delta 规则 提升状态容量、GLM 用分块与短卷积补偿局部精度;Qwen 3.8 Max 的混合注意力在三个尺度上分工,短程精确、长程近 似,折中地覆盖两类优点。 在非注意力组件上,四者高度趋同:MoE 的激活占比均在 2%-4%,负载均衡均采用分位数分配的无超参方案,低精度训 练均从 SFT 阶段开始分级引入,后训练均以 GRPO 与可验证奖励为核心。这一收敛印证了组件趋同的判断:现代架构在 「效率原语」上趋同,在「长上下文策略」上分化。判断新架构的价值,应先看它是否复用已趋同的组件,再看它在分化 维度上是否有实质突破。

9.5.2 三条长上下文路线

四款模型的注意力可归纳为三条路线。

  1. 稀疏压缩路线 DeepSeek-V4 为代表。核心是「内容选择 + 压缩」:先选出对建模重要的历史 token,再做稀疏压缩或摘要化,保证被压 缩的内容仍可检索。优点是信息保留的精度高,适合长文细粒度检索问答;代价是稀疏路由与压缩层带来额外的工程复杂 度,KV 缓存仍随序列增长,只是增长率更低。
  2. 线性近似路线 Kimi K3 与 GLM 5.3 为代表。核心是「常量状态 + 递推」,用线性递推把全部历史压缩为固定大小的隐状态,状态规模与 序列长度解耦。优点是长上下文成本近常数,适合高并发、长前缀复用的对话场景;代价是线性近似的粒度损失,K3 用 delta 规则提升状态写入容量,GLM 5.3 用分块与短卷积补偿局部精度,二者分别从「写入」与「局部」两个角度弥补线 性机制的短板。
  3. 混合分工路线 Qwen 3.8 Max 为代表。核心是「按尺度分工」:滑动窗口管局部、全注意力管精细、线性注意力管长程,再以渐进压缩 组织分层记忆。优点是召回精度与成本之间取得居中平衡,且渐进结构天然适配页式缓存;代价是三类单元并存使系统复 杂度高于单一路线。 稀疏压缩 V4 线性近似 K3/GLM 混合分工 Qwen 内容选择 + 压缩 常量状态 + 递推 按尺度分工 信息可检索 成本近常数 精度成本居中 长文检索问答 高并发对话 全模态长文 图9-5 三条长上下文路线 如图9-5 所示,三条路线在「信息保留精度」与「长上下文成本」之间各占一个折中位置:稀疏压缩偏精度,线性近似偏 成本,混合分工居中。选型的关键变量是成本结构(并发、序列长度分布)与信息粒度需求:检索类场景看重精度,对话 类场景看重成本,全模态长文场景看重平衡。

9.5.3 经典与现代综合对比

  1. 综合对比表 维度 经典 2017 现代 2026 典型代表 整体架构 Encoder-Decoder Decoder-only 全部现代模型 归一化 LayerNorm RMSNorm + QK-Norm LLaMA、DeepSeek 激活函数 ReLU / GELU SwiGLU / SiTU LLaMA、Kimi K3 注意力 MHA GQA / MLA / Gated MLA DeepSeek、Kimi 前馈层 稠密 FFN MoE 稀疏专家 Mixtral、V3、K3 位置编码 正弦编码 RoPE 全部现代模型 注意力模式 全量 稀疏与混合 V4、K3 残差连接 标准残差 DeepNorm / mHC / AttnRes V4、K3 优化器 Adam AdamW / Muon V4、K3 KV 缓存 全量 K/V 压缩缓存 V4 仅 10% 上下文长度 512 级 1M 级 V4、K3 模型规模 千万级 万亿级 V4-Pro 1.6T、K3 2.8T 表9-2 经典与最新架构对比 如表9-2 所示,每个维度都在保持质量的前提下大幅改善效率与规模。经典配置解决的是「能不能训练」,现代配置解决 的是「如何在万亿参数与百万上下文下高效训练与推理」。表的纵轴即组件、横轴即代际:任一维度的横向对比都对应一 次具体的组件演进,从归一化、激活、注意力、前馈到连接机制。 表中的「现代」配置是 2026 年的快照,而非终点。任何一行在未来两三年内都可能再次换代:KV 缓存可能进一步压缩 到更低位数,上下文长度可能从 1M 推进到 10M,模型规模可能从万亿级走向十万亿级。读者应以「演进中的现代」而非 「固定的现代」来看待这张表,关注变化的方向而非当下的数值。
  2. 组件级演进总结 组件演进呈现四条共性规律。 •精度向效率让渡:RMSNorm 省去均值归零,低精度训练从 BF16 推进到 FP8 与 MXFP4,以受控的数值损耗换取显存 与算力。这一规律的边界条件是精度损失的受控性:现代模型通过 QK-Norm、幅值有界激活(SiTU)等手段,把低位 数值的溢出风险压到可接受范围。精度让渡不是「越省越好」,而是「在可接受的损失内尽量省」,其度量方式是损失曲 线与下游基准的联合监测。 精度让渡的另一观察点是精度策略的分阶段性。Kimi K3 在预训练阶段保持高精度、到 SFT 阶段才切换 MXFP4/MXFP8,说明低精度并不是无条件的:训练的不同阶段对数值鲁棒性的需求不同,量化噪声可以「晚引入」。 这一「分阶段精度」策略在未来很可能成为标准做法,与 MTP、QAT 一起,构成训练数值工程的完整工具箱。 •稀疏化取代稠密化:MoE 稀疏化 FFN,混合注意力稀疏化上下文,二者共同把「每 token 全量计算」改写为「按需计 算」。稀疏化的收益来自容量与算力的解耦:总容量可以继续扩大,而每 token 的算力成本保持受控。代价是路由与均 衡的工程复杂度,而 Quantile Balancing 与共享专家等设计正是在压低这一代价。 需要补充的是,稀疏化的收益并非免费。MoE 与稀疏注意力都引入了「选择」这一不确定性:选择出错时,信息可能 丢失或被路由到错误的处理单元。因此,现代架构的稀疏化总是伴随着「补偿机制」:MoE 用共享专家兜底通用知识, 混合注意力用窗口与压缩层的组合兜底关键信息。理解这一「稀疏 + 兜底」的二元结构,比记住单个稀疏机制更重要。 •参数与状态压缩:GQA/MLA 压缩 KV 缓存,潜在空间压缩记忆,模型以更小的运行时状态承载同等容量。压缩的本质 是找到表示空间的低维结构,MLA 的潜在向量、KDA 的隐状态都是这一原则的实例:它们都假设高维表示中存在可压 缩的低维结构,并以恢复投影或递推状态承载。 压缩的边界条件是「信息保留的充分性」。压缩得越多,缓存越省,但一旦关键信息被压掉,质量即受损。现代模型通 过两类机制守住这一边界:一是让压缩表示仍参与注意力打分(如 CSA/HCA),保证被压缩的内容可检索;二是用门控 或选择机制保留细粒度信息(如 Gated MLA)。可以预期,未来的压缩研究将围绕「在更低位数下保留更关键信息」展 开,而非单纯追求更小的缓存。 •结构感知的优化:Muon 与 Per-Head Muon 识别矩阵与注意力头的结构,残差连接从单一加法演进为受控混合,优化 与连接机制都从「逐元素」走向「结构化」。结构感知的前提是理解组件的数学结构,只有理解多头注意力的子空间结 构,才能理解 Per-Head Muon 为何有效。

9.5.4 设计权衡与未来展望

  1. 设计权衡分析 现代架构的每一项创新都在刻画一个权衡,理解权衡才能在不同模型间做出判断。 MoE 用总参数提供容量、激活参数控制算力,但代价是路由、均衡与 All-to-All 通信的工程复杂度。Stable LatentMoE 与 Quantile Balancing 正是为压低这一复杂度而生。选择 MoE 时需评估:算力预算与显存容量是否支持专家并行,负载均 衡策略是否成熟,专家粒度是否需要细分。 混合注意力以压缩或线性近似换取长上下文效率,风险是丢失细粒度信息。DeepSeek 用 CSA 保留关键选择、Kimi 用 Gated MLA 做选择性记忆、Qwen 用渐进压缩组织分层记忆,本质上都是在压缩的粗粒度与保留的细粒度之间取平衡。 选择压缩注意力时需验证:压缩表示在目标任务上是否保留足够可检索的信息,以及长上下文质量在压力测试下是否稳 定。 量化感知训练把量化成本前置到训练阶段,换取部署时零二次量化;Muon 与 MTP 优化训练效率,其收益最终体现为推 理质量的提升。现代架构越来越多地以「推理为中心」反向设计训练方案,这要求训练与推理团队共享同一套效率指标, 如果推理系统无法消化训练产出的大模型,训练端的效率收益就没有落地。 不同模型在混合注意力的组件选择上分化:DeepSeek 走压缩路线,Kimi 与 GLM 走线性路线,Qwen 走混合路线,但在 MoE、MLA、低精度训练上高度趋同。架构收敛到少数高效原语的组合,分化集中在长上下文策略。理解收敛的部分,就 抓住了现代模型的共性;理解分化的部分,就掌握了不同模型的能力边界。对读者而言,判断一个「新架构」是否有价 值,可以先看它是否遵循了收敛部分的规律:若在 MoE、MLA 等已趋同的组件上另起炉灶,往往意味着承担不必要的兼 容性成本;而它的创新价值,则应重点考察它在分化部分(如长上下文、多模态)是否有实质突破。 从工程生态的视角看,收敛还带来另一个好处:推理框架、量化工具与训练栈可以为「共性组件」提供深度优化,而分化 的部分则激励框架持续扩展。vLLM 对 MLA 与 KDA 缓存的支持、各推理库对 MoE 的 Grouped GEMM 优化,都是生态对 收敛与分化两面响应的例子。模型架构与推理生态之间形成了互相塑造的正反馈,这是理解 2026 年大模型技术版图的重 要背景。
  2. 未来展望 从 2026 年的时点看,现代大模型架构仍处于快速演进期。注意力机制本身继续演化:线性注意力、压缩注意力与状态空 间模型相互借鉴,混合架构从「交替堆叠」走向「深度耦合」,Gated MLA、KDA 与 QMoA 的组合预示了融合方向。深度 耦合(GLM 5.3)与尺度分工(Qwen 3.8 Max)可能进一步融合,形成「分层压缩、按需检索」的统一注意力;线性状态 与稀疏选择可能合流,用稀疏路由增强线性记忆的粒度。稀疏化与专用硬件的软硬协同将进一步固定推理友好的稀疏模 式,压缩注意力的固定预算特性与加速器的数据流天然契合。多模态与超长上下文的融合,对压缩与视觉编码提出新要 求,Qwen 3.8 Max 的原生多模态架构是这一趋势的实例。测试时计算与架构协同,可能改变「推理即前向」的传统假 设,Qwen 3.8 Max 的混合思考专家已把推理能力写入架构,未来推理强度机制可能直接控制专家路由与压缩粒度。 对工程师与研究者而言,未来几年最值得关注的不是「哪个架构会取代 Transformer」,而是「Transformer 的哪些组件 还会换血」。本章的分析表明,注意力的实现形态、前馈的稀疏方式、连接与归一化的机制、训练的目标与精度,都在持 续的换代周期中。掌握「经典 vs 现代」的对比框架,就拥有了评估这些换代的价值尺度:判断一个新技术是「在效率曲 线上移动」还是「改变曲线的形状」。 自注意力核 GQA MLA 归一化与连接创新 MoE 与混合注意力 Muon MTP 低精度训练 1M 上下文高效部署 未来演进 图9-6 现代架构的组件协同 如图9-6 所示,现代大模型是自注意力核心、稀疏结构、稳定连接与训练创新四层组件的协同系统:核心注意力决定建模 能力,稀疏结构决定容量与效率,连接与归一化决定可训练性,训练创新决定成本。四层相互依赖:稀疏结构需要稳定连 接支撑训练,训练创新需要结构感知优化器匹配架构。Transformer 并未终结,而是被重塑为「自注意力为核、混合机制 为翼」的现代形态。理解本章的组件演进,就把握了从经典到前沿的完整脉络,也为对齐、多模态与更大规模场景下的架 构判断提供了基准。