返回我的书列表
📚 TheAIEra Book 18 章

AI 算法权威指南

从 Transformer 到大模型智能系统的算法全链路指南:架构基础、训练与规模化、高效推理与生成、智能系统与工程,共 4 部分 18 章 + 4 附录。

AI 算法Transformer大模型MoERLHF推理书籍

📖 本书大纲

AI 算法权威指南

本书内容整理自开源项目 openwikis(作者 hezhiyong,CC BY-NC 4.0 许可)。

原创来源声明:本书内容提取自 aizyhe/openwikis 仓库 algo/ 目录下的《AI 算法权威指南》(PDF 版,v1.0.1,2026-06-25),由 PDF 提取整理为 Markdown 章节。原书在线阅读:inferloop.dev · 原仓库:openwikis

关于本书

Transformer 架构自 2017 年提出以来,已成为当代 AI 系统的核心计算单元。从自注意力到混合专家,从预训练到推理增强,本书以 Transformer 为起点,系统讲解 AI 算法的设计原理与工程实践,兼顾理论推导与工程落地。

本书旨在成为 AI 算法领域的系统性权威参考。全书共 18 章,划分为四大部分,覆盖从模型架构基础到智能系统与工程的全链路内容。本书紧跟前沿,收录 2026 年最新开源架构案例。

  • 第一部分「架构基础」(第 1-4 章):建立 Transformer 的架构基础。从 NLP 到 Transformer 的演进、循环网络的困境与注意力机制的起源出发,剖析自注意力与多头注意力的原理、整体架构与数据流及其与 RNN/CNN 的对比;讲解文本、图像、语音的 token 化与位置编码(经典位置编码、相对与旋转位置编码 RoPE、ALiBi);深入前馈网络、残差连接、层归一化、正则化体系、掩码自注意力与交叉注意力等核心组件;并厘清自回归生成机制、从隐藏状态到词表分布的映射、权重绑定与各类解码策略。
  • 第二部分「训练与规模化」(第 5-9 章):覆盖训练与优化(权重初始化、优化器与学习率调度、标签平滑、梯度累积与混合精度、分布式训练)、预训练与数据(经典预训练范式、数据管道与质量控制、合成数据、高级预训练目标、缩放法则与中段训练)、后训练对齐(SFT、RLHF、DPO、在线蒸馏对齐与 PEFT、灾难性遗忘与机器遗忘)、现代大模型架构(注意力参数共享、稀疏与线性注意力、混合注意力、MoE 混合专家),并以 DeepSeek-V4、Kimi K3、Qwen 3.8 Max、GLM 5.3 等前沿模型案例做整体校验与对比。
  • 第三部分「高效推理与生成」(第 10-14 章):聚焦长上下文与高效推理(长上下文扩展、高效注意力架构、KV Cache 量化与淘汰、投机解码与推理系统)、强化学习原理(数学基础、策略梯度与 Actor-Critic、离策略与离线强化学习、多智能体与序列决策)、推理增强(思维链、推理结构与链压缩、长链推理权衡、强化学习推理基础、推理预算与测试时控制)、生成式模型(视觉生成、扩散语言模型、离散扩散原理与训练、约束推理与可控生成、自回归与扩散的融合)与多模态(视觉编码与 VLM 架构演进、多模态训练与推理、语音理解生成、VLA 与多模态幻觉)。
  • 第四部分「智能系统与工程」(第 15-18 章):讨论 Agent 系统(认知架构、自进化 Agent、搜索与深度研究 Agent、多 Agent 系统、自主 Agent、Agent 运行时设计与模型训练、工具使用)、世界模型(生成式世界模型的数学、Cosmos 3、OmniDreams、策略与世界协同训练、世界-语言-动作统一)、安全与评估(能力基准、Agent 动态评估、欺骗表示的检测与几何、多 Agent 信任与风险、对齐税与 AGI 路线图),并以 FlashAttention 的 GPU 级高效实现(FA v1/v2/v3、集成与实战、扩展与前瞻)收束全书,贯通算法设计与系统优化的完整链路。

本书结合作者在阿里以及京东的实际工作经验,在写作中紧跟前沿,收录 2026 年最新开源架构案例,力求理论推导与工程实践相互印证。附录提供术语表、参考文献、公式速查与模型能力对比。

目录

第一部分 架构基础

第二部分 训练与规模化

第三部分 高效推理与生成

第四部分 智能系统与工程

附录

  • 附录 A 术语表(见下方内嵌内容)
  • 附录 B 参考文献(见下方内嵌内容)
  • 附录 C 公式速查(见下方内嵌内容)
  • 附录 D 模型能力对比(见下方内嵌内容)

附录正文位于本页底部,向下滚动即可阅读。

作者信息

提取说明

  • 本书正文由 algo/AI算法权威指南.pdf(705 页,约 29.8 MB)经 PDF 文本提取整理为 Markdown,按 18 章 + 4 附录切分。
  • 代码块已加围栏;PDF 中的数学公式与表格排版在提取后可能略有错位,以原 PDF 为准。
  • 原书还提供完整目录 TOC.md 与在线 PDF 下载。

附录 A 术语表

A.1 基础概念 英文术语 中文译名 释义 Attention 注意力机 输入序列中 Query 与 Key-Value 集合的映射操作,通过计算相关度权重对 Value 加权求和,使 制 模型动态聚焦重要信息。 Attention Map 注意力图 谱 由注意力权重构成的矩阵,反映序列中任意两个位置之间的关联强度;常用于可视化分析模型 学到的语义依赖关系。 Autoregressive 自回归 一种生成策略,将当前时刻的输出作为下一时刻的输入,依序逐 列模型即采用自回归语言建模目标。 token 生成完整序列。GPT 系 Beam Search 束搜索 一种启发式解码算法,在生成过程中维护固定宽度(beam 概率最高的若干路径,在搜索质量与计算开销之间折中。 size)的候选序列,每步扩展并保留 BPE (Byte Pair 字节对编 一种从字符级别构建词表的 Tokenization 算法。 Encoding) 码 Causal Mask 因果掩码 一种三角掩码矩阵,确保解码器在生成第 置泄漏,是实现自回归生成的关键机制。 t 个 token 时仅能关注位置 1 到 t,避免信息从未来位 Cross-Attention 交叉注意 力 编码器-解码器 Transformer 中,解码器以自身隐状态为 Query,以编码器输出为 Key 和 Value 的注意力操作,将源序列信息融入目标序列生成。 Cross-Entropy 交叉熵损 用于分类和序列生成的损失函数,度量预测分布与真实分布之间的差异;Transformer 训练时 Loss 失 将其作为序列中每个位置的分类损失并求平均。 Embedding 嵌入 将离散 token(词、子词等)映射为稠密连续向量的表示方法,是 Transformer 模型的输入 层,将离散索引转换为可微分的向量空间。 Padding Mask 填充掩码 用于屏蔽变长序列中对齐填充位置的掩码,使注意力计算忽略填充 模型。 token,避免无关信息干扰 Perplexity (PPL) 困惑度 语言模型的标准评估指标,定义为序列的交叉熵损失取指数,衡量模型对测试数据的预测能 力;PPL 越低表示模型越确定正确的 token 序列。 Q/K/V 查询/键/ 注意力机制的三个核心向量集合。Query 表示正在寻找什么,Key 表示我能提供什么,Value 值 表示我实际包含什么内容;三者通过线性投影从输入获得。 Scaled Dot- 缩放点积 标准注意力算子的具体实现:计算 Q 和 K 的点积,除以 sqrt(d_k) 缩放,经 softmax 获取权重 Product 注意力 后对 V 加权求和。 Attention Self-Attention 自注意力 序列内部元素之间的注意力机制,即 能直接聚合整个序列的上下文信息。 Query、Key、Value 均来自同一输入序列,使每个位置都 Seq2Seq 序列到序 一种通用架构范式,将不定长输入序列映射为不定长输出序列;原始 Transformer 即为经典的 列 编码器-解码器 Seq2Seq 架构。 Teacher Forcing 教师强制 训练 Seq2Seq 模型时以真实目标序列(而非模型自身预测)作为解码器每一步的输入,加速收 敛、避免错误的级联放大。 Token 词元 文本被分词器切分后的最小单元,可以是字、子词或词。Transformer 以 token 序列为基本处 理单位,输入长度即为 token 数量。 Tokenization 分词 将原始文本切分为 token 序列的过程,常见方法包括 BPE(字节对编码)、WordPiece、 SentencePiece 等;分词策略直接影响模型的词汇表大小和字符级泛化能力。 A.2 架构组件 英文术语 中文译名 释义 d_ff 前馈维度 前馈神经网络隐藏层的维度,通常为 强的逐位置非线性变换能力。 d_model 的 2 至 4 倍,典型值为 2048;更大的 d_ff 提供更 d_k Key 维度 每个注意力头的 Key 向量维度,d_k = d_model / h。其平方根作为缩放点积注意力的缩放因子, 防止内积过大导致 softmax 梯度过小。 d_model 模型维度 Transformer 512 或 768。 中隐藏层和 Embedding 的维度,所有子层的输入输出均保持此维度,典型取值为 d_v Value 维度 每个注意力头的 Value 向量维度,通常与 d_k 相同,典型取值为 64。 Decoder 解码器 Transformer 的一个核心组件,由多层解码器层堆叠而成,将编码器输出与已生成的目标序列转 换为逐 token 的输出概率分布。 Dropout 丢弃 一种正则化技术,训练时以概率 p 随机置零神经元输出,迫使网络学习冗余表征,防止过拟合。 Transformer 在 Attention、FFN、Embedding 等多处应用。 Encoder 编码器 Transformer 的一个核心组件,由多层编码器层堆叠而成,通过自注意力逐层提取输入序列的上 下文表示,输出与输入等长的特征序列。 FFN 前馈神经网 全称 Feed-Forward Network,是每个编码器和解码器层的组成部分,由两层线性变换加激活函 络 数组成,以位置独立的方式对每个 token 表示进行非线性变换。 FLOPS 浮点运算次 衡量模型计算量的指标,指一次前向或反向传播所需的浮点运算总数。自注意力的计算复杂度与 数 序列长度的平方成正比。 GELU 高斯误差线 Transformer 中 FFN 子层常用的激活函数,将输入乘以其标准正态累积分布函数值,相较 ReLU 性单元 更加平滑,在 BERT 和 GPT 等预训练模型中广泛使用。 h 注意力头数 Multi-Head 为 8 或 12。 Attention 中并行的注意力计算数量,每个头独立学习不同的注意力模式,典型取值 Layer 在单个样本的特征维度上计算均值和方差进行归一化的技术,不受批次大小影响,是 Normalizatio 层归一化 Transformer 中维持训练稳定性的核心组件。 n N 层数 Transformer 的编码器或解码器堆叠层数。原始 Transformer 基准模型 N=6,大模型 N=12,现 代 LLM 可达数十或上百层。 Post-LN 后层归一化 原始 Transformer 采用的归一化顺序:子层输出先经过残差相加再层归一化。训练易出现梯度发 散,需配合细致的 warmup。 Pre-LN 前层归一化 改进的归一化顺序:输入先经过层归一化再进入子层,然后残差相加。训练更加稳定,对 warmup 要求较低,是现代 Transformer 实现的主流选择。 ReLU 整流线性单 激活函数 f(x)=max(0,x),计算简单、缓解梯度消失,曾是 FFN 子层的主流选择,但在 元 Transformer 中逐渐被 GELU 替代。 Residual 将子层输入直接与子层输出相加的跳连接(skip connection),使梯度能够直接流过深层网络, Connection 残差连接 是训练深层 Transformer 不可或缺的技术。 Softmax Softmax 函 将任意实数向量转换为概率分布的函数,输出和为 1 且每个分量非负。在注意力机制中用于将分 数 数转换为注意力权重。 A.3 注意力变体 英文术语 中文译名 释义 Bahdanau Bahdanau 由 Bahdanau 等人在 2014 年提出的早期注意力变体,使用前馈网络计算编码器状态与解码器状态 Attention 注意力 之间的对齐分数,是注意力机制应用于 NMT 的开创性工作。 FlashAttenti Flash 注意 一种 IO 感知的精确注意力算法,通过分块(tiling)和重计算(recomputation)减少 GPU 高带宽 on 力 内存的读写,在不牺牲数学精度的前提下大幅加速注意力计算并降低显存占用。 英文术语 中文译名 释义 GQA 分组查询 将多个 Query 头共享同一组 Key/Value 头的注意力变体,介于 MHA 与 MQA 之间的折中,在保持 注意力 质量的同时降低 KV 缓存,LLaMA-2 等现代模型的标配。 KV Cache 键值缓存 自回归生成时的优化技术,将已生成 token 的 Key 和 Value 向量缓存复用,避免每步重新计算整个 序列的注意力,将解码复杂度从 O(n²) 降至 O(n)。 Linear 线性注意 一类对标准注意力进行核函数近似的方法,将 QK^T 的矩阵乘法分解为 Kernel(Q) Kernel(K)^T, Attention 力 使计算复杂度从 O(n²) 降为 O(n),适合超长序列场景。 Luong Luong 注 Luong 等人在 2015 年提出的注意力变体,使用点积或双线性变换计算对齐分数,简化了 Attention 意力 Bahdanau 注意力的计算流程,有 global 和 local 两种注意力模式。 Masked Self- 掩码自注 解码器中的自注意力变体,通过因果掩码限制每个位置只能关注自身及之前的位置,保证模型在生 Attention 意力 成过程中不获取未来信息。 MLA 多头潜在 DeepSeek-V2 提出的注意力变体,将 Key 与 Value 压缩为低秩潜在向量后再计算注意力,显著降 注意力 低 KV 缓存占用,是 DeepSeek 系列的核心创新。 MQA 多查询注 全部 Query 头共享同一组 Key 与 Value 的注意力变体,极大压缩 KV 缓存并提升推理吞吐,是 意力 GQA 的前身。 Multi-Head 多头注意 将 Q、K、V 投影到 h 个独立的低维子空间分别计算注意力,再将结果拼接投影回原始维度的机 Attention 力 制,使模型从多个表征子空间捕获关系,是 Transformer 的核心创新。 PagedAttenti 分页注意 vLLM 提出的 KV 缓存管理算法,将 KV 按固定大小页组织并以页表映射,消除显存碎片并支持前缀 on 力 共享,显著提升推理吞吐。 Prefix 前缀缓存 对多轮对话或批处理请求共享的 prompt 前缀缓存其 KV 状态,复用计算以降低首 token 延迟与算 Caching 力开销。 Sparse 稀疏注意 一类仅计算局部窗口或特定模式下的注意力权重而忽略远距离交互的策略,可将复杂度降至 Attention 力 O(n^(3/2)) 或 O(n log n),兼顾效率与长距离建模。 Speculative 投机解码 以小模型快速起草若干候选 token、大模型并行验证的加速解码技术,在保证输出分布一致的前提 Decoding 下将解码吞吐提升数倍。 A.4 位置编码 英文术语 中文译名 释义 ALiBi 线性偏置注意 一种无需显式位置编码的方法,通过在注意力分数上施加与距离成正比的线性偏置,使模型具 力 备出色的长度外推能力,直接支持训练时未见过的更长序列。 Positional 位置编码 注入序列位置信息的机制,由于 Self-Attention 本身不感知位置,需通过位置编码告诉模型 Encoding token 的相对或绝对位置。 RoPE 旋转位置编码 通过对 Q 和 K 向量施加与位置索引相关的旋转变换来注入相对位置信息的方法,数学上可解释 为相对位置在复数域的角度差,广泛用于 LLaMA 等现代 LLM。 Sinusoidal 正弦位置编码 原始 Transformer 采用的位置编码方法,使用不同频率的正弦和余弦函数生成固定的位置向 Encoding 量,具有可外推的数学性质。 YaRN RoPE 的另一种 通过 NTK 感知缩放扩展 RoPE 到更长上下文。 扩展方法 A.5 训练与优化 英文术语 中文译名 释义 Adam 自适应矩 一种结合动量与自适应学习率的优化算法,通过一阶和二阶矩估计动态调整每个参数的步 估计 长,是 Transformer 训练中最常用的优化器。 英文术语 中文译名 释义 BF16 脑浮点 16 一种 16 位浮点格式,拥有与 FP32 相同的 8 位指数但尾数缩短,动态范围与 FP32 一致,溢 位 出风险低,广泛用于大模型训练和推理。 EWC (Elastic Weight 弹性权重 基于 Fisher 信息的持续学习方法,减缓灾难性遗忘。 Consolidation) 巩固 FP16 半精度 16 IEEE 754 标准定义的 16 位浮点格式,相比 FP32 节省一半显存与带宽,但动态范围较小, 位浮点 需配合损失缩放(loss scaling)等技术保持训练稳定。 FWT (Forward 前向迁移 旧任务训练对新任务性能的正面影响。 Transfer) Gradient 梯度累积 一种等效增大批次大小的技术,在若干次小批次前向和后向传播后累积梯度再执行一次参数 Accumulation 更新,可在显存受限时模拟更大的有效 batch size。 Knowledge 知识蒸馏 一种模型压缩技术,以大型教师模型的输出分布作为软标签训练小型学生模型,将教师模型 Distillation 的隐式知识迁移到轻量模型中,在保持精度的前提下降低推理成本。 Label Smoothing 标签平滑 一种正则化方法,将 one-hot 标签替换为平滑分布(正确类别概率略低于 1,其余类别均分 少量概率),降低模型对训练标签的过度置信,提升泛化能力。 Learning Rate 学习率调 训练过程中动态调整学习率的策略。原始 Transformer 采用先线性升温(warmup)后逐步 Schedule 度 衰减的策略,使得训练初期平稳过渡、中后期精细收敛。 LwF (Learning 无遗忘学 通过知识蒸馏保留旧任务知识的持续学习方法。 without Forgetting) 习 Mixed Precision 混合精度 训练时同时使用 FP32(权重主副本)和 FP16(梯度与计算)的策略,通过损失缩放避免低 训练 精度下的梯度下溢,在保持训练精度的同时显著提升吞吐量并降低显存。 Muon Muon 优 基于动量与正交化的优化算法,对动量梯度做 Newton-Schulz 正交归一近似后更新权重, 化器 DeepSeek-V4 与 Kimi K3 均采用该优化器以降低训练开销。 MXFP4 微缩放 4 一种面向 4-bit 推理的浮点格式,以块内共享的缩放因子扩展 FP4 的动态范围,无需逐值缩 位浮点 放即可覆盖大范围权重,Blackwell 硬件原生支持。 Quantization 量化 将模型参数和激活值从高精度(如 FP32)转换为低精度(如 INT8/INT4)的技术,可大幅 降低模型体积和推理延迟,是大模型部署的关键技术。 Warmup 学习率预 训练初期将学习率从极小值线性或余弦提升到预设峰值的策略,防止初始阶段因参数随机导 热 致大梯度更新破坏模型,原始 Transformer 中预热步数为 4000。 A.6 预训练范式 英文术语 中文译名 释义 BERT 双向编码器表 Google 提出的预训练模型,仅保留 Transformer 编码器,通过 MLM 和 NSP 两个 征模型 自监督任务在大规模语料上预训练,在众多 NLP 下游任务中取得突破性成绩。 CBDS (Complexity- 复杂度均衡扩 Balanced Diffusion 散分解 扩散 LLM 中按生成难度自适应分配计算的策略。 Splitting) FIM (Fill-in-the-Middle) 中间填充 给定额外上下文时预测被遮盖中间文本的训练目标。 生成式预训练 OpenAI 提出的自回归预训练模型,仅保留 Transformer 解码器,通过大规模语料 GPT 上的语言建模训练获得通用语言能力,经 RLHF 等对齐后可完成对话、推理等任 Transformer 务。 MLM 掩码语言模型 BERT 引入的自监督预训练目标,随机遮盖输入序列中部分 token 并由模型根据上 下文预测被遮盖 token,迫使模型学习双向上下文表示。 MTP (Multi-Token 多 Token 预测 同时预测后续多个 Token 而非仅下一个 Token 的训练目标。 Prediction) 英文术语 中文译名 释义 NITP (Next Implicit 下一隐式 2026 年提出的对比式预训练目标。 Token Prediction) Token 预测 NSP 下一句预测 BERT 的辅助预训练任务,判断两个句子是否为原文中的相邻句对,训练模型理解 句间关系,在后来的 RoBERTa 等工作中被证明非必需。 NTP (Next-Token 下一 Token 预 LLM 预训练的标准自回归目标。 Prediction) 测 文本到文本迁 Google 提出的统一框架,将所有 NLP 任务转换为文本到文本的格式,使用完整的 T5 移 编码器-解码器 Transformer 架构进行预训练和微调。 Transformer A.7 后训练与对齐 英文术语 中文译名 释义 DPO 直接偏好优 将 RLHF 的奖励建模与强化学习合并为对最优策略的闭式解,直接以偏好数据 化 做最大似然训练,简化了对齐流程。 ESPO (Early-Stopping PPO) 早停 PPO TongyiLab 提出的对 PPO 进行早停以防止过优化的方法。 GRAIL (Gradient-Reweighted 梯度重加权 基于奖励置信度重加权优势值的 RL 方法。 Advantages) 优势 GRPO 组相对策略 DeepSeekMath 提出的强化学习策略优化算法,以同一 prompt 的多条采样结 优化 果组内相对优势替代 Critic 价值网络,大幅降低 RL 训练显存与复杂度。 LoRA (Low-Rank Adaptation) 低秩适配 在冻结预训练权重上添加低秩可训练矩阵的高效微调方法。 OPD (On-Policy Distillation) 在线策略蒸 馏 在 RL 训练中同步进行知识蒸馏的方法。 ORM (Outcome Reward 结果奖励模 仅根据最终结果给予奖励的奖励函数。 Model) 型 PEFT (Parameter-Efficient 参数高效微 仅更新少量参数进行模型适配的方法家族。 Fine-Tuning) 调 PPO (Proximal Policy 近端策略优 一种广泛使用的策略梯度 RL 算法。 Optimization) 化 PRM (Process Reward Model) 过程奖励模 型 对推理过程每一步给予奖励的奖励函数。 RLAIF (RL from AI Feedback) 从强化学习 AI 反馈中 用 AI 而非人类提供反馈的对齐方法变体。 RLHF (Reinforcement 从人类反馈 Learning from Human 中强化学习 使用人类偏好数据训练奖励模型并优化策略的对齐方法。 Feedback) RLVR (RL with Verifiable 可验证奖励 使用程序化验证而非学习奖励模型的 RL 方法。 Rewards) 的强化学习 SFT (Supervised Fine-Tuning) 监督微调 在人工标注的指令-回答数据上微调模型。 SPO (Segment Policy 分段策略优 在 Token 段落级别分配信用而非 Token 级别的 RL 方法。 Optimization) 化 A.8 高效架构与推理 英文术语 中文译名 释义 AttnRes 注意力残差 Kimi K3 中为稳定深层混合注意力训练而设计的残差连接技巧,将注意力输出以一定比例加回,缓 解信息丢失与注意力坍缩。 CSA 压缩稀疏注意 全称 Compressed Sparse Attention,DeepSeek-V4 提出的稀疏注意力分支,在 DSA 内容选择基础 上增加压缩环节,将历史信息压缩为稀疏表示,与 HCA 构成混合注意力,兼顾细粒度局部与粗粒度 力 历史。 DOT-MoE 可微最优传输 MoE 使用最优传输理论优化专家路由的 MoE 方法。 DSA DeepSeek 稀 DeepSeek-V3.2-Exp 提出的稀疏注意力方案,借助 Lightning Indexer 识别重要 token,实现高效的 疏注意力 超长上下文推理。 HCA 重度压缩注意 全称 Heavily Compressed Attention,DeepSeek-V4 提出的上下文压缩注意力分支,对超长历史做 力 重度压缩,为百万级上下文提供近乎摘要式的全局记忆,与 CSA 协同处理长序列。 KDA Kimi Delta 注 全称 Kimi Delta Attention,Kimi K3 提出的混合线性注意力机制,基于 delta 规则以隐状态递推方 式维护历史,写入新信息时按相似度更新而非等权累加,与 softmax 注意力层混合,以常数状态覆 意力 盖长程历史。 方差归一化 KVarN KV-Cache 量 Huawei 提出的通过方差归一化减少 KV Cache 量化误差的方法。 化 Mamba Mamba 一种基于结构化状态空间模型(SSM)的序列模型,通过输入依赖的选择机制动态调整 SSM 参数, 在线性时间复杂度下实现对长序列的选择性记忆,被视为 Transformer 的强有力竞争者。 mHC 超连接 DeepSeek-V4 提出的跨层超连接机制,改进深层网络的梯度与信息流动,是模型规模化堆叠时保持 训练稳定的关键设计。 MoE 混合专家模型 Mixture of Experts,将网络分解为多个专家子网络并由门控按 token 稀疏路由激活部分专家,在不 显著增加计算量的前提下扩大参数规模。 SiTU Sigmoid 全称 Sigmoid Tanh Unit,Kimi K3 引入的门控激活,将 sigmoid 软门控与有界 tanh 主通路以乘法 Tanh 单元 形式组合,输出幅值可控,配合低精度训练与 Per-Head Muon 稳定大规模训练。 SSM 状态空间模型 源自控制理论的一类序列模型,通过隐状态传递信号演化信息;结构化 线性时间复杂度处理长序列,在长距离依赖任务中表现优异。 SSM(如 S4、Mamba)以 Stable 稳定潜在专家 Kimi K3 采用的潜在 MoE 结构(896 个专家、每 token 激活 16 个),在潜在空间路由专家,兼顾激 LatentM 混合 活稀疏性与训练稳定性。 oE A.9 多模态 英文术语 中文译名 释义 CLIP 对比语言—图 OpenAI 提出的双塔多模态模型,分别用文本编码器和图像编码器提取特征,通过对比学习 像预训练 在成对的图文数据上训练,实现零样本图像分类与跨模态检索。 DiT 扩散 Diffusion Transformer,以 Transformer 主干替换 U-Net 的扩散生成模型,随数据与参数 Transformer 量平稳扩展,是 Sora 等视频生成模型的架构基础。 ViT 视觉 将图像切分为固定大小的 Patch 并作为 token 序列输入 Transformer 编码器的模型,无需 Transformer 卷积操作,在大规模预训练下超越传统 CNN 达到 SOTA 视觉性能。 VLA 视觉语言动作 Vision-Language-Action model,将视觉、语言与动作统一建模的多模态模型,直接输出 模型 机器人动作 token,RT-2 为代表工作。 VLM (Vision- Language Model) 视觉语言模型 同时处理图像和文本输入的多模态模型。 英文术语 中文译名 释义 WLA (World- 世界-语言-动 统一世界建模、语言理解和动作生成的模型。 Language-Action) 作模型 A.10 推理与 Agent 英文术语 中文译名 释义 CoT (Chain-of-Thought) 思维链 让模型生成中间推理步骤以提升复杂问题正确率的技术。 Long-CoT 长思维链 包含中间反思、验证等长推理过程的思维链。 MCP (Model Context 模型上下 标准化 Agent 与外部工具/服务交互的协议框架。 Protocol) 文协议 MCTS (Monte Carlo Tree 蒙特卡洛 一种通过树结构搜索和模拟进行决策的算法。 Search) 树搜索 RAG (Retrieval- 检索增强 检索外部知识并注入生成过程以提升准确性的技术。 Augmented Generation) 生成 Reasoning Effort 推理强度 控制模型在回答前投入多少推理计算量的预算参数,预算越高模型进行越长的思维链 搜索,OpenAI o1 系列率先提供该调节选项。 Short-CoT 短思维链 简洁直接的中间推理步骤,不包含大量反思或验证。 SWE-bench 软件工程 评估 LLM 解决真实 GitHub Issue 能力的基准。 基准 Test-Time Compute 测试时计 在推理阶段而非训练阶段扩展计算的范式,通过逐步推理、搜索与验证提升输出质 算 量,OpenAI o1 与 DeepSeek-R1 确立了其主流地位。 A.11 安全与评估 英文术语 中文译名 释义 AGI (Artificial General 人工通用智能 在广泛认知任务上匹配或超越人类水平的 AI 系统。 Intelligence) AIME 美国数学邀请 评估 LLM 数学推理能力的高难度基准。 赛 ASL (AI Safety Levels) AI安全等级 Anthropic 定义的安全分级框架。 BLEU 双语评估替补 机器翻译领域最常用的自动评估指标,通过计算候选译文与参考译文的 gram 重叠率度量翻译质量,取值范围 0 到 1(或 0 到 100)。 n- GCG (Greedy Coordinate 贪婪坐标梯度 一种自动发现 LLM 越狱提示的攻击方法。 Gradient) IRT (Item Response Theory) 项目反应理论 用于校准测试任务难度和 Agent 能力的统计模型。 KRR (Knowledge Retention 知识保留率 衡量模型经过新训练后旧知识保留程度的指标。 Rate) MMLU (Massive Multitask 大规模多任务 覆盖 57 个学科的知识评测基准。 Language Understanding) 语言理解 RAMP (Runtime Assessing of Agent 模型运 在生产环境中持续监控 Agent 性能的框架。 Agentic Models) 行时评估 RSP (Responsible Scaling 负责任扩展策 Anthropic 的安全分级部署框架。 Policy) 略 英文术语 中文译名 释义 TRiSM (Trust, Risk, and 信任、风险与 面向多 Agent 系统的三维安全框架。 Security Management) 安全管理


附录 B 参考文献

本节汇总全书引用的核心论文与融合论文,按主题分组排列。每条文献标注作者、标题、发表渠道与年份,并附简要说 明。 B.1 注意力机制 注意力机制从 Seq2Seq 的信息瓶颈问题中诞生,逐步演化为 Transformer 架构的核心计算范式。下列条目梳理了注意力 思想从概念提出到自注意力完整体系的关键节点。 [1]. Sutskever et al. “Sequence to Sequence Learning with Neural Networks”. NeurIPS, 2014. 提出编码器-解码器架构,用 RNN 将源序列编码为定长向量后再解码,暴露了长序列的信息瓶颈问题。 [2]. Cho et al. “Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation”. EMNLP, 2014. 提出 GRU 门控循环单元,简化了 LSTM 的门控结构,为 Seq2Seq 中编码器-解码器提供更轻量的循环单元。 [3]. Bahdanau et al. “Neural Machine Translation by Jointly Learning to Align and Translate”. ICLR, 2015. 首次将注意力机制引入神经机器翻译,让解码器在每一步动态查询编码器的所有隐状态,实现了软对齐。 [4]. Luong et al. “Effective Approaches to Attention-based Neural Machine Translation”. EMNLP, 2015. 提出了多种注意力评分函数(dot、general、concat),并引入全局与局部注意力两种策略,丰富了注意力的实现方式。 [5]. Vaswani et al. “Attention Is All You Need”. NeurIPS, 2017. (arXiv: 1706.03762) 提出完全基于自注意力的 Transformer 架构,引入多头注意力与位置编码,在 WMT 2014 翻译任务上达到 SOTA 且训练 时间大幅缩短。本书的基石论文。 B.2 预训练模型 预训练-微调范式的确立标志着 NLP 从任务专用模型走向通用基础模型。BERT 的自编码与 GPT 的自回归分别代表了两种 主流预训练路径,缩放法则则为模型规模与数据配比的决策提供了理论依据。 [6]. Radford et al. “Improving Language Understanding by Generative Pre-Training”. OpenAI, 2018. GPT-1: 首次验证了大规模无监督语言模型预训练后在多个有监督任务上微调的有效性,参数量 117M。 [7]. Devlin et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding”. NAACL- HLT, 2019. 提出掩码语言模型(MLM)预训练目标,使 Transformer 编码器学习双向上下文表示。发布后在 11 项 NLP 基准任务上 刷新记录,GLUE 分数从 72.8 跃升至 80.5。 [8]. Radford et al. “Language Models are Unsupervised Multitask Learners”. OpenAI, 2019. GPT-2: 将参数量扩展至 1.5B,提出语言模型可以在无监督条件下执行多种下游任务(zero-shot transfer),引发了对大 规模生成模型能力的广泛讨论。 [9]. Liu et al. “RoBERTa: A Robustly Optimized BERT Pretraining Approach”. arXiv, 2019. 通过更大批次、更多数据、更长训练、移除 NSP 目标等系统性优化,显著提升了 BERT 的预训练效果。 [10]. Brown et al. “Language Models are Few-Shot Learners”. NeurIPS, 2020. GPT-3: 将参数量扩展至 175B,系统验证了上下文学习(In-Context Learning)能力,拉开了大语言模型时代的序幕。 [11]. Raffel et al. “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer”. JMLR, 2020. T5: 将所有 NLP 任务统一为文本到文本格式,通过大规模消融实验为预训练范式的设计选择提供了实证指导。 [12]. Lan et al. “ALBERT: A Lite BERT for Self-supervised Learning of Language Representations”. ICLR, 2020. 通过参数共享和分解嵌入矩阵大幅减少 BERT 参数量,引入句子顺序预测(SOP)替代 NSP 任务。 [13]. Kaplan et al. “Scaling Laws for Neural Language Models”. arXiv, 2020. (arXiv: 2001.08361) 首次系统刻画了语言模型性能随模型规模、数据量与计算量增长的幂律关系,为后续大模型训练提供了缩放法则的理论基 础。 [14]. Hoffmann et al. “Training Compute-Optimal Large Language Models”. NeurIPS, 2022. (arXiv: 2203.15556) Chinchilla 缩放法则:证明对于给定计算预算,模型规模与训练 token 数应等比例增长。 [15]. Touvron et al. “LLaMA: Open and Efficient Foundation Language Models”. arXiv, 2023. 开源高效大语言模型系列,采用 RoPE 位置编码与 Pre-Norm 架构,推动了开源 LLM 的发展。 [16]. Achiam et al. “GPT-4 Technical Report”. arXiv, 2023. GPT-4 技术报告:展示了多模态输入能力与接近人类水平的专业领域表现,代表了大语言模型在规模与能力上的新边界。 [17]. DeepMind. “Unified Neural Scaling Laws”. arXiv, 2026. (arXiv: 2606.X) 提出跨模态统一缩放定律,将缩放关系的分析从语言模型扩展到多模态模型。 [18]. SJTU. “NITP: Next Implicit Token Prediction for LLM Pre-training”. arXiv, 2026. (arXiv: 2606.X) 提出隐式 Token 预测作为新的预训练目标,通过隐空间预测提升语言模型的训练效率。 [19]. “MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection”. arXiv, 2026. (arXiv: 2606.X) 提出中段训练阶段的评分锚定方法,基于数据来源感知进行数据选择与质量过滤。 [20]. “On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters”. arXiv, 2026. (arXiv: 2606.X) 探索了参数高效微调在百万个性化模型场景下的扩展性与工程实践。 B.3 位置编码 Transformer 的自注意力本身不包含序列顺序信息,位置编码是解决这一缺陷的关键技术。从正弦编码到 RoPE 和 ALiBi,位置编码经历了从绝对到相对、从固定到可学习的演进。 [21]. Shaw et al. “Self-Attention with Relative Position Representations”. NAACL-HLT, 2018. 首次在自注意力中引入相对位置表示,将键向量扩展为内容项与位置项之和,使注意力对相对距离敏感。 [22]. Dai et al. “Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context”. ACL, 2019. 提出段级循环机制与基于相对位置编码的四项分解注意力,解决了 Transformer 固定长度上下文的限制。 [23]. Press et al. “Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation”. ICLR, 2022. ALiBi: 以零参数成本在 softmax 前加入线性偏置,实现了优异的长度外推能力。 [24]. Su et al. “RoFormer: Enhanced Transformer with Rotary Position Embedding”. Neurocomputing, 2024. (arXiv: 2021) RoPE: 通过旋转矩阵将位置信息注入 query 和 key 向量,使注意力内积天然编码相对位置。LLaMA、Qwen、ChatGLM 等主流大模型均采用此方案。 B.4 架构改进 Transformer 的基础架构在原始论文后经历了诸多优化,层归一化位置调整与激活函数选择是最具影响力的两项改进。 [25]. He et al. “Deep Residual Learning for Image Recognition”. CVPR, 2016. ResNet: 提出残差连接解决深层网络退化问题,这一设计被 Transformer 完整继承并在每子层中应用。 [26]. Ba et al. “Layer Normalization”. arXiv, 2016. 提出层归一化,沿特征维而非批次维进行归一化,适合可变长度序列处理,成为 Transformer 的标准归一化方案。 [27]. Hendrycks & Gimpel. “Gaussian Error Linear Units (GELUs)”. arXiv, 2016. 提出 GELU 激活函数,以概率解释实现平滑门控,在 Transformer 中逐步替代 ReLU 成为默认选择。 [28]. Xiong et al. “On Layer Normalization in the Transformer Architecture”. ICML, 2020. 系统分析了 Post-LN 与 Pre-LN 的梯度特性,证明 Pre-LN 可改善深层 Transformer 的训练稳定性,成为 GPT-2 之后模型 的标准配置。 [29]. Shazeer. “GLU Variants Improve Transformer”. arXiv, 2020. 系统评估了 Gated Linear Unit 变体在 Transformer 中的表现,其中 SwiGLU 在部分任务上优于标准 GELU。 [30]. Geva et al. “Transformer Feed-Forward Layers Are Key-Value Memories”. EMNLP, 2021. 将 FFN 层解释为键值记忆结构,揭示了前馈网络在存储词汇级模式中的功能角色。 [31]. “Confidence-Adaptive SwiGLU for Mixture-of-Experts”. arXiv, 2026. (arXiv: 2606.X) 在 MoE 架构中引入自适应激活函数机制,根据专家置信度动态调整 SwiGLU 的门控行为。 B.5 高效 Transformer O(n2 ) 的注意力复杂度是 Transformer 处理长序列的核心瓶颈,稀疏注意力、线性注意力与 IO 感知实现从不同角度应对 这一挑战。 [32]. Child et al. “Generating Long Sequences with Sparse Transformers”. arXiv, 2019. Sparse Transformer: 提出跨步与固定块两种稀疏注意力模式,将每个查询可见的键数从 n 降至 O( n)。 [33]. Beltagy et al. “Longformer: The Long-Document Transformer”. arXiv, 2020. Longformer: 提出滑动窗口注意力辅以全局位置的实用方案,在长文档分类任务上超越 BERT。 [34]. Zaheer et al. “Big Bird: Transformers for Longer Sequences”. NeurIPS, 2020. Big Bird: 从图论角度证明窗口+随机+全局的稀疏注意力组合可近似密集注意力,引入扩展器图保证信息混合。 [35]. Katharopoulos et al. “Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention”. ICML, 2020. Linear Transformer: 利用核函数技巧将注意力复杂度降至 O(n),同时支持高效的因果自回归生成。 [36]. Choromanski et al. “Rethinking Attention with Performers”. ICLR, 2021. Performer: 通过正交随机特征近似 softmax 注意力核,实现无需先验稀疏模式的线性复杂度注意力。 [37]. Dao et al. “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness”. NeurIPS, 2022. (arXiv: 2205.14135) FlashAttention: 通过 IO 感知的分块策略与 SRAM 优化,将标准注意力的 HBM 访问降至理论下界,在不牺牲精度的前提 下加速 2-4 倍。 [38]. Dao. “FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning”. arXiv, 2023. (arXiv: 2307.08691) FlashAttention-2: 优化了序列长度维度的并行策略与工作量划分,进一步提升吞吐。 [39]. Shah et al. “FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision”. arXiv, 2024. (arXiv: 2407.08608) FlashAttention-3: 针对 Hopper 架构引入异步执行与低精度计算,在 H100 上达到 740 TFLOPS。 [40]. Shazeer. “Fast Transformer Decoding: One Write-Head Is All You Need”. arXiv, 2019. (arXiv: 1911.02150) Multi-Query Attention: 将多头注意力中每个头独立 kv 投影改为所有头共享单一 kv 投影,大幅减少推理时 KV 缓存占 用。 [41]. Ainslie et al. “GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints”. arXiv, 2023. (arXiv: 2305.13245) Grouped Query Attention: 在 Multi-Query 与 Multi-Head 之间取折中,将 query 头分组共享 kv 投影,兼顾质量与效 率。 [42]. “Rectified Sparse Attention”. arXiv, 2026. (arXiv: 2606.X) 提出动态学习稀疏注意力模式的方法,通过校正机制自适应调整注意力稀疏结构。 B.6 多模态与视觉 Transformer 架构向计算机视觉领域的迁移催生了 ViT 和 CLIP 等里程碑工作,证明了注意力机制的跨模态通用性。 [43]. Dosovitskiy et al. “An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale”. ICLR, 2021. ViT: 将图像切分为 Patch 序列后输入纯 Transformer 编码器,在大规模预训练数据上超越 CNN。 [44]. Radford et al. “Learning Transferable Visual Models From Natural Language Supervision”. ICML, 2021. CLIP: 通过双塔架构与对比学习将图像与文本对齐到共享嵌入空间,展示了强大的零样本迁移能力。 [45]. Touvron et al. “Training data-efficient image transformers & distillation through attention”. ICML, 2021. DeiT: 通过注意力蒸馏策略在 ImageNet-1K 上训练高性能 ViT,证明了 Transformer 在小数据集上也可与 CNN 竞争。 B.7 量化与蒸馏 模型压缩技术使大型 Transformer 能够在资源受限的环境中部署,知识蒸馏传递教师模型的知识结构,后训练量化降低 权重的数值精度。 [46]. Hinton et al. “Distilling the Knowledge in a Neural Network”. NeurIPS Deep Learning Workshop, 2014. 提出知识蒸馏的概念:用教师模型的软标签训练学生模型,传递类别间关系的结构信息。 [47]. Sanh et al. “DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter”. NeurIPS EMC2 Workshop, 2019. DistilBERT: 以 BERT-base 为教师蒸馏出 6 层学生模型,保留 97% 性能的同时参数量减半。 [48]. Jiao et al. “TinyBERT: Distilling BERT for Natural Language Understanding”. EMNLP Findings, 2020. TinyBERT: 通过两阶段蒸馏(通用蒸馏+任务蒸馏)将 BERT 压缩至 4 层,仅保留 13.3% 参数即达到 96.8% GLUE 性能。 [49]. Frantar et al. “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”. ICLR, 2023. GPTQ: 基于最优脑压缩(OBC)框架的逐列贪心补偿量化方法,在 3-bit 到 4-bit 精度下保持低 perplexity 退化。 [50]. Lin et al. “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”. MLSys, 2024. AWQ: 发现权重通道重要性与其激活幅值强相关,通过对重要通道缩放优化量化动态范围。 B.8 状态空间模型 状态空间模型(SSM)作为 Transformer 的潜在替代方案,以线性复杂度处理长序列。从 S4 到 Mamba 的演进代表了序 列建模的另一条技术路线。 [51]. Gu et al. “Efficiently Modeling Long Sequences with Structured State Spaces”. ICLR, 2022. S4: 提出结构化状态空间模型,利用 HiPPO 矩阵初始化实现长序列的线性复杂度高效建模。 [52]. Gu & Dao. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces”. arXiv, 2023. (arXiv: 2312.00752) Mamba: 引入输入依赖的选择性扫描机制,使 SSM 的参数随输入变化,在保持线性复杂度的同时显著提升了内容感知能 力。 [53]. Dao & Gu. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality”. ICML, 2024. (arXiv: 2405.21060) Mamba-2: 揭示了注意力与 SSM 在结构化矩阵框架下的深层对偶关系,提出状态空间对偶性(SSD)统一两种范式。 [54]. “Gated Delta Networks at Scale”. arXiv, 2026. (arXiv: 2606.X) 将门控 Delta 网络扩展至大规模场景,提升了线性复杂度序列建模的表达能力。 B.9 训练与优化 以下论文构建了 Transformer 训练的技术基础,涵盖优化器、正则化与分布式训练策略。 [55]. Kingma & Ba. “Adam: A Method for Stochastic Optimization”. ICLR, 2015. Adam 优化器:结合动量与自适应学习率,被 Transformer 原论文采用为默认优化器。 [56]. Srivastava et al. “Dropout: A Simple Way to Prevent Neural Networks from Overfitting”. JMLR, 2014. Dropout 正则化:通过随机丢弃神经元防止过拟合,Transformer 在多个位置应用 Dropout 作为核心正则化手段。 [57]. Szegedy et al. “Rethinking the Inception Architecture for Computer Vision”. CVPR, 2016. 提出标签平滑(Label Smoothing)技术,将 one-hot 标签替换为软标签以缓解过拟合和过度自信。 [58]. Loshchilov & Hutter. “SGDR: Stochastic Gradient Descent with Warm Restarts”. ICLR, 2017. 提出余弦退火学习率调度策略,带热重启的余弦退火成为大型 Transformer 训练的常用方案。 [59]. Huang et al. “GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism”. NeurIPS, 2019. GPipe: 将 mini-batch 切分为 micro-batch 以流水线方式注入模型各段,推广了流水线并行策略。 [60]. Shoeybi et al. “Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism”. arXiv, 2019. Megatron-LM: 引入张量并行,将单层 Transformer 内的矩阵乘法沿特定维度切分到多 GPU。 [61]. Liu et al. “On the Variance of the Adaptive Learning Rate and Beyond”. ICLR, 2020. RAdam: 从理论上论证 Adam 训练初期自适应学习率方差过大,提出修正方案,等效于隐式 Warmup。 [62]. Müller et al. “When Does Label Smoothing Help?”. NeurIPS, 2019. 系统研究了标签平滑对概率校准、蒸馏效果的影响,发现标签平滑会降低教师模型在蒸馏场景中的有效性。 [63]. Clark et al. “What Does BERT Look At? An Analysis of BERT’s Attention”. ACL Workshop BlackboxNLP, 2019. 对 BERT 的注意力头进行系统分类,识别出关注相邻词、分隔符、特定句法位置等多种注意力模式。 [64]. Michel et al. “Are Sixteen Heads Really Better than One?”. NeurIPS, 2019. 发现在推理阶段可剪枝掉大量注意力头而几乎不影响性能,揭示了多头注意力的表达能力存在显著冗余。 [65]. Jawahar et al. “What Does BERT Learn about the Structure of Language?”. ACL, 2019. 通过探针分类器实验证实 BERT 的中间层注意力分布包含足够的句法信息来重构依赖树。 B.10 现代大模型架构 2023 年以来,大模型架构沿稀疏化、潜在注意力与超大规模 MoE 三个方向快速演进。DeepSeek 与 Moonshot 的系列工 作将混合注意力、无辅助损失负载均衡与线性注意力推向工程化。 [66]. DeepSeek-AI. “DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model”. arXiv, 2024. (arXiv: 2405.04434) DeepSeek-V2: 首次提出多头潜在注意力(MLA),将 KV 缓存压缩为低秩潜在向量,同时提出 DeepSeekMoE 细粒度专家 划分,为后续 DeepSeek 系列奠定架构基础。 [67]. Jiang et al. “Mixtral of Experts”. arXiv, 2024. Mixtral 8x7B: 将稀疏门控 MoE 引入开源 LLM,每个 token 经 top-2 路由激活 2 个专家,以约 47B 总参数取得与稠密模型 相当的生成质量,并原生支持 32K 上下文。 [68]. Touvron et al. “Llama 2: Open Foundation and Fine-Tuned Chat Models”. arXiv, 2023. LLaMA-2: 以 RMSNorm、SwiGLU、RoPE 与 GQA 构成现代 LLM 的标配组件组合,开源 7B 至 70B 系列模型,并公布 RLHF 对齐与数据配比的系统实践。 [69]. DeepSeek-AI. “DeepSeek-V3 Technical Report”. arXiv, 2024. (arXiv: 2412.19437) DeepSeek-V3: 671B 总参数、37B 激活的 MoE 模型,提出无辅助损失(aux-loss-free)负载均衡策略,并以 FP8 精度完 成大规模训练,显著降低训练成本。 [70]. DeepSeek-AI. “DeepSeek Sparse Attention (DSA)”. DeepSeek-V3.2-Exp, 2025. DSA: 面向超长上下文设计的稀疏注意力方案,在 DeepSeek-V3.2-Exp 中借助 Lightning Indexer 实现高效的长序列推 理。 [71]. DeepSeek-AI. “DeepSeek-V4 Technical Report”. arXiv, 2026. (arXiv: 2606.19348) DeepSeek-V4: 1.6T 参数(49B 激活)的 MoE 模型,融合 CSA 与 HCA 的混合注意力、mHC 超连接与 Muon 优化器,支 持 1M 上下文,相较前代单 token 推理 FLOPs 降至 27%、KV 缓存占用降至 10%。 [72]. Moonshot AI. “Kimi K3 Technical Blog”. Moonshot AI, 2026. Kimi K3: 2.8T 参数的开源模型,采用 KDA 混合线性注意力、AttnRes、Gated MLA 与 Stable LatentMoE(896 专家激活 16),配合 SiTU 激活与 Per-Head Muon 优化器。 [73]. MiniMax. “MiniMax-01: Scaling Foundation Models with Lightning Attention”. arXiv, 2025. (arXiv: 2501.08313) MiniMax-01: 将 Lightning Attention 与 MoE 结合,支持 4M 超长上下文的基座模型。 [74]. “DOT-MoE: Differentiable Optimal Transport for MoEfication”. arXiv, 2026. (arXiv: 2606.X) 提出基于可微最优传输的 MoE 路由机制,为专家分配提供理论最优的匹配方案。 [75]. Meta AI. “Llama 4 Model Card”. Meta AI, 2025. Llama 4 Scout/Maverick 采用 MoE 架构,标志着 Meta 开源模型进入混合专家时代。 [76]. Alibaba. “Qwen3 Technical Report”. Alibaba, 2025. Qwen3 采用 MoE 架构与推理增强,提升了多语言理解与复杂推理能力。 B.11 对齐与后训练 大模型时代,后训练从简单的指令微调演进为以强化学习为核心的推理增强与偏好对齐体系。GRPO 与 DPO 以更低的训 练开销替代经典 PPO,OpenAI o1 与 DeepSeek-R1 则将「测试时计算」确立为提升推理能力的核心范式。 [77]. DeepSeek-AI. “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning”. arXiv, 2025. (arXiv: 2501.12948) DeepSeek-R1: 以 GRPO 在大规模强化学习上训练推理模型,R1-Zero 证明纯 RL 即可激发涌现式思维链,并开源 R1 系列 与蒸馏版本。 [78]. Rafailov et al. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”. NeurIPS, 2023. (arXiv: 2305.18290) DPO: 将偏好优化与奖励建模合并为对最优策略的闭式解,省去显式奖励模型与 RL 采样,使 RLHF 式对齐简化为直接的 最大似然训练。 [79]. Shao et al. “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models”. arXiv, 2024. GRPO: 提出组相对策略优化,以同一 prompt 的多条采样结果组内相对打分替代价值网络,将 RL 训练显存占用降低约 3 倍。 [80]. OpenAI. “Learning to Reason with LLMs”. OpenAI, 2024. OpenAI o1: 首次系统展示测试时缩放(test-time scaling)的力量,通过逐步推理与搜索将大模型在数学与科学基准上的 表现推至新高度。 [81]. Hu et al. “LoRA: Low-Rank Adaptation of Large Language Models”. ICLR, 2021. LoRA: 冻结预训练权重、仅训练低秩增量矩阵,以约 1% 的可训练参数实现与全量微调相当的适配效果,成为大模型参数 高效微调的标准方法。 [82]. Ouyang et al. “Training Language Models to Follow Instructions with Human Feedback”. NeurIPS, 2022. (arXiv: 2203.02155) InstructGPT: 建立「监督微调 + 奖励模型 + PPO」的 RLHF 三阶段管线,将语言模型与人类意图对齐,这一范式成为 ChatGPT 及后续对话模型训练的基础。 [83]. Bai et al. “Constitutional AI: Harmlessness from AI Feedback”. arXiv, 2022. (arXiv: 2212.08073) Constitutional AI: 通过一组原则(constitution)指导模型自我批评与修正,减少对人工标注的依赖来实现无害性对齐。 [84]. TongyiLab. “ESPO: Early-Stopping Proximal Policy Optimization”. arXiv, 2026. (arXiv: 2606.X) 提出早停近端策略优化方法,通过提前终止 RL 训练避免过拟合奖励模型。 [85]. Meta Research. “OmniOPD: Logit-Free On-Policy Distillation”. arXiv, 2026. (arXiv: 2606.X) 提出无需教师 logit 的在线策略蒸馏方法,降低了在线蒸馏的计算与显存开销。 [86]. “Draft-OPD: On-Policy Distillation for Speculative Draft Models”. arXiv, 2026. (arXiv: 2606.X) 将在线策略蒸馏应用于投机解码的草稿模型训练,提升草稿模型的生成质量。 [87]. Samsung Research. “Trust Region On-Policy Distillation”. arXiv, 2026. (arXiv: 2606.X) 引入信赖域约束的在线策略蒸馏,在蒸馏过程中限制策略偏移以提升稳定性。 [88]. Tsinghua. “Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation”. arXiv, 2026. (arXiv: 2606.X) 重新审视在线蒸馏的优化粒度,提出先过滤低质量样本再加权训练的策略。 [89]. UCLA. “Self-Distilled Policy Gradient”. arXiv, 2026. (arXiv: 2606.X) 提出自蒸馏策略梯度方法,利用模型自身的历史策略作为蒸馏目标以稳定训练。 [90]. Wei et al. “Chain-of-Thought Prompting Elicits Reasoning in Large Language Models”. arXiv, 2022. (arXiv: 2201.11903) CoT: 通过在提示中加入中间推理步骤,激发大模型的逐步推理能力,显著提升数学与常识推理任务的表现。 [91]. Wang et al. “Self-Consistency Improves Chain of Thought Reasoning”. arXiv, 2023. (arXiv: 2203.11171) 自一致性采样:从 CoT 的多次采样中选取最一致的答案,以多数投票机制提升推理准确性。 [92]. Yao et al. “Tree of Thoughts: Deliberate Problem Solving with Large Language Models”. arXiv, 2023. (arXiv: 2305.10601) 将推理过程组织为树状搜索空间,允许模型在多个推理分支间探索与回溯。 [93]. Besta et al. “Graph of Thoughts: Solving Elaborate Problems with Large Language Models”. arXiv, 2023. (arXiv: 2308.09687) 将推理过程建模为有向图结构,支持合并、精炼等复杂推理操作,超越线性与树状推理。 [94]. InternLM. “ThoughtFold: Folding Reasoning Chains”. arXiv, 2026. (arXiv: 2606.X) 提出内省偏好驱动的推理链折叠方法,压缩冗长推理链以提升效率。 [95]. Kimi Team. “Kimi k1.5: Scaling Reinforcement Learning with LLMs”. arXiv, 2025. (arXiv: 2501.12599) Kimi k1.5: 通过 Long2Short 蒸馏与强化学习扩展推理能力,在数学与科学基准上取得优异表现。 [96]. “ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries”. arXiv, 2025. (arXiv: 2506.X) 提出延长强化学习训练周期的策略,突破推理模型的性能边界。 [97]. ICIP. “Combinatorial Synthesis: Scaling Code RLVR”. arXiv, 2026. (arXiv: 2606.X) 提出代码可验证奖励 RL 的分解重组方法,通过组合综合提升代码生成的 RL 训练效果。 [98]. DeCLaRe Lab. “GRAIL: Gradient-Reweighted Advantages for RL with Verifiable Rewards”. arXiv, 2026. (arXiv: 2606.X) 提出梯度重加权优势估计方法,改善可验证奖励场景下 RL 训练的稳定性与效率。 [99]. “Temporal Scheduling for RLVR”. arXiv, 2026. (arXiv: 2606.X) 从时间维度设计信用分配策略,优化可验证奖励 RL 的训练调度。 [100]. UGA. “TRON: Targeted Rule-Verifiable Online Environments”. arXiv, 2026. (arXiv: 2606.X) 构建面向可验证规则的在线推理环境,为 RL 训练提供高质量的在线反馈信号。 [101]. “Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation”. arXiv, 2026. (arXiv: 2606.X) 发现强化学习可以激发模型对未见语言的翻译能力,揭示 RL 的跨语言迁移效应。 [102]. Snell et al. “Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters”. arXiv, 2024. (arXiv: 2408.03314) 从理论上证明最优分配测试时计算资源可以比单纯扩大模型参数更有效,确立了测试时缩放的理论基础。 [103]. PKU. “The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation”. arXiv, 2026. (arXiv: 2606.X) 从经济学视角分析推理预算的最优分配,引入影子价格概念量化推理 token 的边际价值。 [104]. “Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling”. arXiv, 2026. (arXiv: 2606.X) 用小型 RL 控制器引导大语言模型的自适应采样,以低成本控制推理资源分配。 [105]. “Scalable Inference-Time Annealing with Surrogate Likelihood Estimators”. arXiv, 2026. (arXiv: 2606.X) 提出基于代理似然估计的可扩展推理退火方法,优化测试时计算的效率。 [106]. JHU. “MindZero: Learning Online Mental Reasoning with Zero Annotations”. arXiv, 2026. (arXiv: 2606.X) 在零标注条件下学习在线心智推理能力,降低推理模型对标注数据的依赖。 B.12 多模态扩展 2022 年以来,Transformer 从单模态扩展到视觉、语音与动作的统一建模。LLaVA、BLIP-2 与 DiT 分别确立了多模态指 令微调、视觉前缀融合与扩散生成的主流范式,世界模型则将多模态理解延伸至物理环境。 [107]. Liu et al. “Visual Instruction Tuning”. NeurIPS, 2023. LLaVA: 以线性投影将视觉编码器与 LLM 直连,在指令跟随数据上微调,以极低成本实现强大的视觉对话能力,成为开源 多模态模型的标准模板。 [108]. Li et al. “BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models”. ICML, 2023. BLIP-2: 提出 Q-Former 轻量查询 Transformer,通过可学习查询向量在冻结的视觉编码器与 LLM 之间架桥,以最少训练 参数实现高效图文对齐。 [109]. Brohan et al. “RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control”. arXiv, 2023. RT-2: 将视觉语言模型微调为视觉语言动作(VLA)模型,把机器人动作编码为输出 token,实现网络知识到机器人控制 的迁移。 [110]. Peebles & Xie. “Scalable Diffusion Models with Transformers”. ICCV, 2023. (arXiv: 2022) DiT: 以 Transformer 替换 U-Net 作为扩散模型主干,验证了扩散模型随数据与参数规模平稳扩展的规律,成为 Sora 等视 频生成模型的架构基础。 [111]. Radford et al. “Robust Speech Recognition via Large-Scale Weak Supervision”. ICML, 2023. (arXiv: 2022) Whisper: 以编码器-解码器 Transformer 在 68 万小时弱监督数据上训练,实现多语言、多任务鲁棒语音识别,成为开源 语音识别的标准基座。 [112]. NVIDIA. “Cosmos 3: Omnimodal World Models for Physical AI”. arXiv, 2026. (arXiv: 2606.X) NVIDIA 全模态世界模型,为物理 AI 提供统一的环境理解与预测能力。 [113]. NVIDIA. “NVIDIA OmniDreams: Real-Time Generative World Model for AV Simulation”. arXiv, 2026. (arXiv: 2606.X) 面向自动驾驶仿真的实时生成式世界模型,支持高保真场景生成。 [114]. Tencent. “World Models Meet Language Models: On the Complementarity”. arXiv, 2026. (arXiv: 2606.X) 探讨世界模型与语言模型的互补性,提出两者协同增强的框架。 [115]. HKUST. “Policy and World Modeling Co-Training for Language Agents”. arXiv, 2026. (arXiv: 2606.X) 提出策略与世界模型联合训练方法,提升语言 Agent 的环境建模与决策能力。 [116]. “World-Language-Action Model for Unified World Modeling”. arXiv, 2026. (arXiv: 2606.X) 构建统一的世界-语言-动作模型,将多模态理解与动作生成整合到单一框架中。 [117]. “Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?”. arXiv, 2026. (arXiv: 2606.X) 探索视频生成模型能否梦见可执行的机器人操作,将世界模型的想象转化为可执行动作。 [118]. “StressDream: Steering Video World Models for Robust Policy Evaluation”. arXiv, 2026. (arXiv: 2606.X) 通过引导视频世界模型生成压力测试场景,评估机器人策略的鲁棒性。 [119]. SEELE AI. “EVA01: Unified Native 3D Understanding and Generation”. arXiv, 2026. (arXiv: 2606.X) 统一的原生 3D 理解与生成模型,同时支持 3D 场景感知与生成任务。 [120]. OpenAI. “GPT-4o System Card”. OpenAI, 2024. GPT-4o 系统卡:展示原生多模态架构,实现文本、视觉与音频的统一处理。 [121]. Google DeepMind. “Gemini 1.0 Technical Report”. arXiv, 2023. (arXiv: 2312.11805) Gemini 1.0: Google 原生多模态模型,从预训练阶段即融合多模态输入。 [122]. Google DeepMind. “Gemini 1.5 Technical Report”. arXiv, 2024. (arXiv: 2403.05530) Gemini 1.5: 将上下文窗口扩展至百万 token 级别,支持超长多模态文档理解。 [123]. Alibaba. “Qwen2.5-VL Technical Report”. arXiv, 2025. (arXiv: 2502.13923) Qwen2.5-VL: 采用动态分辨率处理与窗口注意力,提升视觉语言模型的细粒度理解能力。 [124]. “MiMo-VL Technical Report”. arXiv, 2026. (arXiv: 2606.X) 混合动量视觉学习模型,融合多种视觉表征策略提升多模态理解。 [125]. AutoLab. “AAD-1: Asymmetric Adversarial Distillation for One-Step Video Generation”. arXiv, 2026. (arXiv: 2606.X) 提出非对称对抗蒸馏方法,实现一步视频生成,大幅降低扩散模型的推理开销。 [126]. Virginia Tech. “VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Video Diffusion”. arXiv, 2026. (arXiv: 2606.X) 将低秩潜在 KV 缓存引入分钟级视频扩散模型,解决长视频生成的显存瓶颈。 [127]. “Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video”. arXiv, 2026. (arXiv: 2606.X) 通过学习演化记忆机制实现实时无限视频生成,突破固定长度视频生成的限制。 [128]. Kling Team. “VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization”. arXiv, 2026. (arXiv: 2606.X) 利用视觉语言模型作为教师,通过自适应测试时优化提升视频推理能力。 [129]. “X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding”. arXiv, 2026. (arXiv: 2606.X) 探索多模态大模型作为多路复用器处理多流输入的能力。 [130]. Google. “PARCEL: Pool-Anchored Resampling for Efficient Vision-Language”. arXiv, 2026. (arXiv: 2606.X) 提出池锚定重采样方法,提升视觉语言模型的训练与推理效率。 [131]. Voio Inc. “Stateful Visual Encoders for Vision-Language Models”. arXiv, 2026. (arXiv: 2606.X) 引入有状态视觉编码器,为视觉语言模型提供跨帧时序建模能力。 B.13 推理系统 大模型规模化部署催生了推理系统层面的关键创新。PagedAttention 以操作系统式的显存管理解决 KV 缓存碎片化, FlashAttention 系列则将注意力内核的硬件效率推向极致。 [132]. Kwon et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention”. SOSP, 2023. (arXiv: 2309.06180) PagedAttention: 将 KV 缓存按固定大小的页管理,借鉴虚拟内存思想消除显存碎片并支持近乎零开销的内存共享,vLLM 在此基础上实现业界标杆级推理吞吐。 [133]. Shah et al. “FlashAttention-4: Efficient Attention for Blackwell”. arXiv, 2025. FlashAttention-4: 针对 NVIDIA Blackwell 架构重写注意力内核,原生支持 FP4 与 MXFP4 格式,以统一张量内核与块调 度优化进一步提升长上下文推理效率。 [134]. Huawei. “KVarN: Variance-Normalized KV-Cache Quantization”. arXiv, 2026. (arXiv: 2606.X) 提出方差归一化的 KV 缓存量化方法,在压缩显存占用的同时保持推理质量。 [135]. USC. “Value-Aware Stochastic KV Cache Eviction for Reasoning Models”. arXiv, 2026. (arXiv: 2606.X) 提出值感知的随机 KV 缓存淘汰策略,针对推理模型的长链推理场景优化显存使用。 [136]. SJTU. “Domino: Decoupling Causal Modeling from Autoregressive Drafting”. arXiv, 2026. (arXiv: 2606.X) 将因果建模与自回归草稿生成解耦,提升投机解码的草稿质量与接受率。 [137]. Oregon State. “Speculative Pipeline Decoding: Zero-Bubble Speculation”. arXiv, 2026. (arXiv: 2606.X) 提出零气泡流水线投机解码方法,将投机解码与流水线并行高效结合。 B.14 扩散语言模型 扩散模型从图像生成扩展到语言建模,提供了自回归之外的另一种文本生成范式。 [138]. Li et al. “Diffusion-LM Improves Controllable Text Generation”. arXiv, 2022. (arXiv: 2205.14217) 将扩散过程引入语言模型,在连续空间中进行文本生成,提升了可控文本生成的灵活性。 [139]. “LLaDA: Large Language Diffusion with mAsking”. arXiv, 2025. (arXiv: 2502.09992) 大规模离散扩散语言模型,通过掩码机制实现高效的文本扩散生成。 [140]. “DINGO: Constrained Inference for Diffusion LLMs”. arXiv, 2025. (arXiv: 2506.X) 为扩散语言模型提出约束推理框架,确保生成文本满足结构化约束。 [141]. “Complexity-Balanced Diffusion Splitting”. arXiv, 2026. (arXiv: 2606.X) 提出复杂度均衡的扩散分解方法,优化扩散语言模型的推理效率。 [142]. “Accelerating Diffusion LLMs via Adaptive Parallel Decoding”. arXiv, 2025. (arXiv: 2506.X) 通过自适应并行解码加速扩散语言模型的生成过程。 B.15 Agent 系统 语言模型从被动应答走向主动规划与工具使用,Agent 系统将 LLM 与外部环境交互能力结合,实现了从推理到行动的闭 环。 [143]. Yao et al. “ReAct: Synergizing Reasoning and Acting in Language Models”. arXiv, 2022. (arXiv: 2210.03629) ReAct: 将推理与行动交替进行,使 LLM 在决策过程中同时生成推理轨迹与外部动作。 [144]. Shinn et al. “Reflexion: Language Agents with Verbal Reinforcement Learning”. arXiv, 2023. (arXiv: 2303.11366) Reflexion: 通过语言化的自我反思作为强化信号,使 Agent 从失败经验中迭代改进。 [145]. USTC. “Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents”. arXiv, 2026. (arXiv: 2606.X) 提出元认知记忆策略优化方法,提升长程任务中 Agent 的记忆管理与利用能力。 [146]. “Rethinking Continual Experience Internalization for Self-Evolving LLM Agents”. arXiv, 2026. (arXiv: 2606.X) 重新审视 Agent 持续经验内化机制,提出自进化 Agent 的学习框架。 [147]. Chroma. “Harness-1: Reinforcement Learning for Search Agents”. arXiv, 2026. (arXiv: 2606.X) 将强化学习应用于搜索 Agent 的训练,提升信息检索与多步搜索能力。 [148]. Microsoft. “OpenWebRL: Online Multi-turn RL for Visual Web Agents”. arXiv, 2026. (arXiv: 2606.X) 面向视觉 Web Agent 的在线多轮强化学习框架,在真实网页环境中训练 Agent。 [149]. “AutoLab: Can Frontier Models Solve Long-Horizon Auto Research?”. arXiv, 2026. (arXiv: 2606.X) 评估前沿模型在长程自主研究任务中的能力,探索自动化科学研究 Agent 的可行性。 [150]. “ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment”. arXiv, 2026. (arXiv: 2606.X) 构建面向前瞻性 AI 研究判断的 Agent 评估基准。 [151]. “Streaming Communication in Multi-Agent Reasoning”. arXiv, 2026. (arXiv: 2606.X) 提出多 Agent 推理中的流式通信机制,提升多 Agent 协作的效率与实时性。 [152]. “Multi-Agent Computer Use”. arXiv, 2026. (arXiv: 2606.X) 探索多 Agent 协同使用计算机完成任务的框架与能力。 [153]. “MLEvolve: A Self-Evolving Framework for Automated ML Algorithm Discovery”. arXiv, 2026. (arXiv: 2606.X) 提出自进化框架用于自动化机器学习算法发现,让 Agent 自主改进 ML 算法。 [154]. “The Meta-Agent Challenge: Are Agents Capable of Autonomous Agent Development?”. arXiv, 2026. (arXiv: 2606.X) 探讨 Agent 能否自主开发新 Agent,评估元 Agent 能力的基准与挑战。 [155]. UCSD. “Agentic Chain-of-Thought Steering”. arXiv, 2026. (arXiv: 2606.X) 提出 Agent 场景下的思维链引导方法,优化 Agent 的推理轨迹与决策路径。 [156]. Tsinghua. “Agent libOS: A Library-OS-Inspired Runtime for LLM Agents”. arXiv, 2026. (arXiv: 2606.X) 借鉴库操作系统设计理念,为 LLM Agent 构建轻量级运行时系统。 B.16 记忆与持续学习 如何让语言模型在部署后持续学习新知识而不遗忘旧能力,是走向通用智能的关键挑战。 [157]. Google. “Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories”. arXiv, 2026. (arXiv: 2606.X) 类比生物睡眠机制,提出语言模型在离线阶段自我修改与记忆巩固的方法。 [158]. “MemTrain: Self-Supervised Context Memory Training”. arXiv, 2026. (arXiv: 2606.X) 提出自监督的上下文记忆训练方法,提升模型对长程上下文的记忆与利用能力。 [159]. “Measuring the Depth of LLM Unlearning via Activation Patching”. arXiv, 2026. (arXiv: 2606.X) 通过激活补丁技术测量 LLM 遗忘的深度,评估模型是否真正移除了目标知识。 [160]. “Rethinking the Stability-Plasticity Trade-off from Architectural Perspective”. arXiv, 2026. (arXiv: 2606.X) 从架构视角重新审视稳定性与可塑性的权衡,提出持续学习中的架构设计原则。 B.17 安全与评估 随着 LLM 与 Agent 系统的广泛应用,安全性评估与基准构建成为确保系统可靠运行的基础设施。 [161]. “Pressure-Testing Deception Probes in LLMs”. arXiv, 2026. (arXiv: 2606.X) 对 LLM 中的欺骗探测器进行压力测试,评估其在对抗场景下的鲁棒性。 [162]. CMU. “The Chain Holds, the Answer Folds: Trace-Answer Dissociation”. arXiv, 2026. (arXiv: 2606.X) 揭示推理链与最终答案的解耦现象:模型可能生成正确的推理链但给出错误答案。 [163]. “TRiSM for Agentic AI: Trust, Risk, and Security Management”. arXiv, 2026. (arXiv: 2606.X) 提出面向 Agent AI 的信任、风险与安全管理框架(TRiSM)。 [164]. Technion. “A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks”. arXiv, 2026. (arXiv: 2606.X) 改进 Agent 基准的覆盖度与难度设计,提出更全面的评估方法论。 [165]. SYSU. “Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models”. arXiv, 2026. (arXiv: 2606.X) 指出静态基准的不足,提出面向生产环境的 Agent 运行时评估方法(RAMP)。 [166]. UIUC. “AdaPlanBench: Evaluating Adaptive Planning under Constraints”. arXiv, 2026. (arXiv: 2606.X) 构建约束条件下自适应规划能力的评估基准。 [167]. CMU. “K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts”. arXiv, 2026. (arXiv: 2606.X) 基于韩语语境的网页浏览 Agent 基准,填补非英语浏览任务的评估空白。 [168]. “MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications”. arXiv, 2026. (arXiv: 2606.X) 构建面向真实个人应用的语言模型 Agent 评估基准。 [169]. Ant Group. “BraveGuard: From Open-World Threats to Safer Computer-Use Agents”. arXiv, 2026. (arXiv: 2606.X) 从开放世界威胁出发,构建更安全的计算机使用 Agent 防护框架。 [170]. “Diagnosing Harmful Continuation in Answer-Correct Long-CoT Traces”. arXiv, 2026. (arXiv: 2606.X) 诊断长链推理中答案正确但推理过程有害的情况,揭示推理安全性与正确性的解耦。 [171]. “Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based RL”. arXiv, 2026. (arXiv: 2606.X) 系统复现并分析基于评分标准 RL 中的奖励黑客现象,提出检测方法。 [172]. “FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification”. arXiv, 2026. (arXiv: 2606.X) 通过细粒度自验证扩展测试时计算,提升模型输出的可靠性与准确性。 B.18 综述与概览 下列综述论文为理解 Transformer 与大语言模型的全景提供了系统性参考。 [173]. Zhao et al. “A Survey of Large Language Models”. arXiv, 2023. (arXiv: 2303.18223) LLM 全面综述:系统梳理了大语言模型的发展脉络、核心技术、训练方法与评估体系。 [174]. Besta et al. “Reasoning Language Models: A Blueprint”. arXiv, 2025. (arXiv: 2501.11223) 推理模型蓝图:从架构、训练到评估全面刻画推理语言模型的设计空间。 [175]. “Large Language Models for Data Synthesis”. arXiv, 2025. (arXiv: 2506.X) 综述大语言模型在数据合成中的应用,涵盖文本、代码与多模态数据生成。 注:标注 2606.X 的论文为 2026 年 6 月最新预印本,arXiv ID 完整号尚待确认。标注 2506.X 的论文为 2025 年 6 月论文。


附录 C 公式速查

本附录集中列出全书各章涉及的核心数学公式,按主题归类并附简要说明,便于读者快速查阅和比照。 C.1 符号约定 下表汇总全书使用的主要数学符号,按首次出现的章节排列。 符号 含义 Q, K, V 查询、键、值矩阵 dmodel 模型隐藏层维度 dk , dv 每个注意力头的 Key / Value 维度 h 注意力头数 N Transformer 层数 dff 前馈网络隐藏层维度(通常 d = 4 ⋅ d ) ff model n 序列长度 WiQ , WiK , WiV , WO 多头注意力的线性投影矩阵 W1 , W2 前馈网络两层全连接的权重矩阵 b1 , b2 前馈网络偏置向量 γ, β 层归一化的可学习缩放与偏移参数 ϵ 防止除零的小常数 Nwarmup 学习率预热步数 ϵls 标签平滑参数 V 词汇表大小 T 知识蒸馏温度 α 蒸馏损失中硬标签与软标签的权重系数 B ALiBi 线性偏置矩阵 ϕ(⋅) 线性注意力的核函数特征映射 Φ(x) 标准正态分布的累积分布函数(GELU 定义中使用) pos token 在序列中的位置索引 m ALiBi 各注意力头的斜率参数 C.2 注意力机制 C.2.1 缩放点积注意力 QK⊤ Attention(Q, K, V) = softmax ( )V dk Transformer 注意力机制的核心算子。Q、K、V 分别为查询、键、值矩阵,内积 QK 度量各查询与各键的相似度,除 ⊤ 以 d 防止点积方差随维度增大而导致 softmax 落入饱和区。 k C.2.2 多头注意力 MultiHead(Q, K, V) = Concat(head1 , … , headh )WO headi = Attention(QWiQ , KWiK , VWiV ) 将输入线性投影到 h 个不同的低维子空间,各头独立计算注意力后沿特征维拼接,再经 W 混合各子空间信息。不同头 O 可以学习不同层面的依赖模式。 C.2.3 ALiBi 线性偏置 QK⊤ Attention(Q, K, V) = softmax ( + B) V, Bij = m ⋅ (j − i) dk ALiBi 不在输入或注意力计算中引入任何位置嵌入,仅在 softmax 前对注意力分数加一个固定的线性偏置矩阵。偏置 m ⋅ (j − i) 随距离线性增长(因果掩码下始终为负),迫使模型关注近邻 token。不同注意力头使用几何级数分布的斜率,无 需训练即可实现优异的长度外推。 C.2.4 FlashAttention 核心思想 FlashAttention 不改变注意力计算的数学定义,而是通过 IO 感知的工程优化实现加速。其核心策略为分块计算与在线 softmax:将 Q、K、V 沿序列维度切块,在 GPU 的 SRAM 中完成局部计算,避免将 n × n 规模的中间矩阵 S 和 P 写出 到 HBM。反向传播通过重计算(Recomputation)换取内存,最终实现 O(n d) 的理论运算量不变,但 HBM 访问量降至 2 渐进最优下界,实际加速 2–4 倍。 C.2.5 线性注意力核方法 标准注意力中 sim(q , k ) = exp(q k / d ),复杂度 O(n )。线性注意力通过核函数分解 sim(q , k ) = ϕ(q ) ϕ(k ),利 ⊤ 2 ⊤ 用矩阵乘法结合律交换求和次序: i j i j k i j i j n ϕ(qi )⊤ ∑j=1 ϕ(kj )vj⊤ oi = n ϕ(qi )⊤ ∑j=1 ϕ(kj ) 分子分母中的求和项仅需计算一次(O(nmd)),而非逐对计算(O(n d))。特征映射 ϕ(x) = elu(x) + 1 使相似度非负,保 2 留了 softmax 的关键性质。总复杂度降至 O(nmd),与序列长度成线性关系。 C.3 位置编码 C.3.1 正弦位置编码 pos PE(pos, 2i) = sin ( ) 100002i/dmodel pos PE(pos, 2i + 1) = cos ( ) 100002i/dmodel 使用固定频率的正弦/余弦函数为每个位置生成唯一的编码向量。低维度索引 i 对应高频(捕捉局部词序),高维度索引对 应低频(捕捉段落级趋势),波长覆盖 2π 至 2π × 10000。该编码无需训练参数,且 sin(α + β) 的展开性质使其具备隐式建 模相对位置的能力。 C.3.2 旋转位置编码 RoPE (2i) ] [ (2i+1) ] cos mθi − sin mθi f{q,k} (xm , m) = [ xm sin mθi cos mθi xm RoPE 通过二维旋转矩阵将位置信息注入 query 和 key 向量,使注意力内积天然编码相对位置:q k = q R k。由 ⊤ ⊤ d 于旋转矩阵的正交性,内积结果仅依赖于相对位置 n − m,且不引入额外的可学习参数。LLaMA、Qwen、ChatGLM 等 m n Θ,n−m 主流模型均采用此方案。 C.4 前馈网络与归一化 C.4.1 前馈网络 ReLU 版本(原论文): FFN(hi ) = max(0, hi W1 + b1 )W2 + b2 GELU 版本(现代实现): FFN(hi ) = GeLU(hi W1 + b1 )W2 + b2 , GeLU(x) = x ⋅ Φ(x) FFN 是位置逐元素的两层全连接网络。W 将维度从 d 扩展至 d (通常 4 倍),W 压缩回原维度。GELU 以正态分 1 model 2 布累积分布函数 Φ(x) 作为平滑门控,在负半轴保留非零梯度,通常比 ReLU 带来约 0.5%–1% 的困惑度改善。 ff C.4.2 层归一化 d d 1 1 μ= ∑ xi , σ= ∑(xi − μ)2 + ϵ d i=1 d i=1 x−μ y=γ⊙ +β σ 层归一化沿特征维度对每个样本独立计算均值和标准差,使每层激活的均值近似为 0、标准差近似为 1。γ 、β 为可学习 的缩放与偏移参数,ϵ 防止除零。LN 对 batch size 不敏感,天然适配变长序列场景。 C.5 残差连接与子层整合 Post-LN(原论文方案,LN 在残差之后): Output = LayerNorm(x + Sublayer(x)) Pre-LN(现代方案,LN 在子层之前): Output = x + Sublayer(LayerNorm(x)) 残差连接为梯度提供了一条不经过子层变换的直通路径。反向传播中加法节点的局部梯度恒为 1,即使中间子层梯度极 小,损失信号仍能无损回传至浅层,是深层 Transformer 稳定训练的基础。 C.6 训练与优化 C.6.1 Noam 学习率调度 αt = d−0.5 −1 model ⋅ min (t ⋅ Nwarmup , t −0.5 ) Noam 调度分为两个阶段:前 N 步学习率从 0 线性增长至峰值,确保 Adam 的自适应状态平稳建立;之后按逆平方 warmup 根 t 衰减,使模型逐步缩小搜索半径。d 因子使不同尺寸模型的学习率保持可比尺度。 −0.5 −0.5 model C.6.2 标签平滑与交叉熵损失 平滑后的目标分布(ϵ 为平滑参数,V 为词汇量): ls ϵls q(k ∣ x) = (1 − ϵls ) ⋅ 1[k=y] + V 平滑交叉熵损失: V Lsmooth = − ∑ q (k ∣ x) log p(k ∣ x) k=1 标签平滑将概率质量从正确类别重新分配给所有类别,防止模型对训练标签过度自信。原论文采用 ϵ = 0.1。虽然平滑会 ls 使困惑度上升,但通常能改善 BLEU 等下游指标。 C.6.3 知识蒸馏损失 L = α ⋅ LCE (y, y^student ) + (1 − α) ⋅ T 2 ⋅ LKL (pteacher , pstudent ) 蒸馏损失由两项加权组成:学生与真实标签的交叉熵 L ,以及学生与教师输出分布的 KL 散度 L 。温度 T > 1 使教师 CE KL 输出分布更平滑,类别间结构信息被放大。T 因子补偿温度缩放对梯度的影响。α 平衡硬标签与软标签的权重。 C.7 复杂度对照表 下表汇总 Transformer 各核心操作的计算与空间复杂度,n 为序列长度,d 为隐藏层维度,d 为 FFN 中间层维度,h 为 注意力头数,d 为单头 Key 维度。 ff k 操作 计算复杂度 空间复杂度 说明 Self-Attention O(n2 ⋅ d) O(n2 ⋅ d) 需存储 n × n 注意力矩阵 Multi-Head Attention O(n2 ⋅ d) O(n2 ⋅ d) 与 Self-Attention 同阶 FlashAttention O(n2 ⋅ d) O(n ⋅ d) IO 优化,HBM 访问降至理论下界 Linear Attention O(n ⋅ d2 ) O(d2 ) 核方法近似,与序列长度线性相关 Sparse Attention O(n n ⋅ d) O(n n ⋅ d) 具体取决于稀疏模式 FFN O(n ⋅ d ⋅ dff ) O(d ⋅ dff ) 位置逐元素,d 通常为 4d ff Layer Normalization O(n ⋅ d) O(n ⋅ d) 沿特征维归一化 Positional Encoding O(n ⋅ d) O(n ⋅ d) 固定编码或可学习嵌入 KV Cache − O(n ⋅ h ⋅ dk ) 自回归生成时缓存历史 Key/Value 以上公式与复杂度覆盖了 Transformer 从核心注意力运算到训练优化、高效推理的完整技术栈。公式均以标准记号给 出,正文提供完整推导。


附录 D 模型能力对比

D.1 架构演进总览 从 2017 年原始 Transformer 到 2026 年现代大模型,架构经历了多次范式变迁。以下表格汇总各阶段的关键里程碑。 阶段 代表模型 年份 关键架构创新 原始架构 Transformer 2017 Self-Attention, Multi-Head Attention, Positional Encoding 预训练时代 BERT, GPT-2 2018–2019 MLM, 自回归预训练, Pre-LN 规模化 GPT-3, T5 2020 In-Context Learning, 文本到文本统一框架 指令对齐 InstructGPT, ChatGPT 2022 RLHF, 人类反馈对齐 开源生态 LLaMA, LLaMA-2 2023 RoPE, GQA, SwiGLU, RMSNorm 高效稀疏 DeepSeek-V2/V3 2024 MLA, MoE, FP8 训练 推理增强 o1, DeepSeek-R1 2024–2025 Test-Time Compute, GRPO, 思维链 多模态统一 GPT-4o, Gemini 2024–2025 原生多模态, 百万 Token 上下文 混合注意力 DeepSeek-V4, Kimi K3 2026 CSA+HCA, KDA, 百万级上下文 路线分化 Qwen 3.8 Max, GLM 5.3 2026 混合注意力, 深度耦合, 512K-1M 上下文 D.2 模型基本参数 以下数据综合技术报告与公开信息,截至 2026 年 6 月。 模型 机构 发布 总参数 激活参 数 上下文长度 架构 开 源 GPT-4o OpenAI 2024.5 未公 开 - 128K 原生多模态Dense 否 GPT-4.5 OpenAI 2025.2 未公 开 - 128K Dense 否 o1 OpenAI 2024.9 未公 开 - 128K Dense+推理链 否 o3 OpenAI 2025.4 未公 开 - 200K Dense+推理链 否 o4-mini OpenAI 2025.4 未公 开 - 200K Dense+推理链 否 Claude 3.5 Sonnet Anthropic 2024.6 未公 开 - 200K Dense 否 Claude 4 Opus Anthropic 2025.5 未公 开 - 200K+ Dense+Extended Thinking 否 Claude 4 Sonnet Anthropic 2025.5 未公开 - 200K+ Dense+Extended Thinking 否 Gemini 2.0 Flash Google 2025.2 未公 开 - 1M 原生多模态 否 模型 机构 发布 总参数 激活参 数 上下文长度 架构 开 源 Gemini 2.5 Pro Google 2025.3 未公 开 - 1M+ 原生多模态+Thinking 否 Gemini 2.5 Flash Google 2025.3 未公 开 - 1M+ 原生多模态+Thinking 否 DeepSeek-V3 DeepSee 2024.1 671B 37B 128K MoE+MLA 是 k 2 DeepSeek-R1 DeepSee 2025.1 671B 37B 128K MoE+MLA+RL推理 是 k DeepSeek-V4-Pro DeepSee k 2026.4 1.6T 49B 1M MoE+CSA+HCA+mHC 是 DeepSeek-V4- DeepSee 2026.4 284B 13B 1M MoE+CSA+HCA 是 Flash k Llama 4 Scout Meta 2025.4 109B 17B 10M MoE 是 Llama 4 Maverick Meta 2025.4 402B 17B 1M MoE 是 Qwen3 Alibaba 2025.4 235B 约 20B 256K MoE 是 Kimi k1.5 Moonsho 2025.1 未公 - 128K MoE+RL推理 否 t 开 Kimi K2 Moonsho 2025.7 未公 - 128K MoE+RL推理 否 t 开 Kimi K3 Moonsho 2026.7 2.8T - 1M MoE+KDA+Gated MLA 是 t Qwen 3.8 Max 阿里巴巴 2026.8 2.4T 46B 1M MoE+QMoA+PQC 是 GLM 5.3 智谱 AI 2026.8 1.5T 52B 512K MoE+分块线性注意力 是 MiniMax-01 MiniMax 2025.1 456B 45.9B 1M(训练)/4M(推理) MoE+Lightning Attention 是 Grok-3 xAI 2025.2 未公 开 - 1M Dense+推理 否 Mistral Large 2 Mistral 2024.7 123B 123B 128K Dense 否 Command R+ Cohere 2024.4 104B 104B 128K Dense+企业RAG 否 D.3 知识基准 模型 MMLU MMLU-Pro AGIEval HellaSwag WinoGrande ARC-C GPT-4o 88.7 - - - - - GPT-4.5 89.3 - - - - - Claude 4 Opus 91.2 - - - - - Gemini 2.5 Pro 90.5 82.1 - - - - DeepSeek-V3 88.5 75.9 - - - - DeepSeek-V4-Pro - - - - - - Qwen3 (235B) 89.1 78.2 - - - - Llama 4 Maverick 87.3 74.5 - - - - MiniMax-01 88.1 - - - - - Kimi K3 - - - - - - 模型 MMLU MMLU-Pro AGIEval HellaSwag WinoGrande ARC-C Qwen 3.8 Max 90.8 82.5 - - - - GLM 5.3 90.1 81.0 - - - - Qwen 3.8 Max 90.8 82.5 - - - - GLM 5.3 90.1 81.0 - - - - D.4 推理基准 模型 AIME 2024 AIME 2025 MATH-500 GPQA Diamond Codeforces o3 (high) 96.7 - 99.2 93.1 98th %ile o4-mini (high) 92.3 - 98.5 88.7 95th %ile o1 83.3 - 96.4 78.0 89th %ile DeepSeek-R1 79.8 - 97.3 71.5 97th %ile DeepSeek-V4-Pro - - - - - Kimi k1.5 (Long-CoT) 77.5 - 96.2 - 94th %ile Kimi K2 88.1 - 98.3 85.2 96th %ile Kimi K3 - - - - - Qwen 3.8 Max 95.2 - 99.0 91.5 98th %ile GLM 5.3 92.7 - 98.6 88.9 96th %ile Gemini 2.5 Pro 85.0 - 97.8 84.0 - Claude 4 Opus 82.1 - 96.8 80.5 - Qwen3 (235B) 78.5 - 95.1 72.0 - Llama 4 Maverick 62.8 - 88.4 56.7 - D.5 代码基准 模型 HumanEval MBPP LiveCodeBench SWE-bench Verified o3 97.6 - 75.2 71.5 Claude 4 Opus 96.2 - 72.3 65.8

DeepSeek-R1             96.3               -            65.9                      49.2
DeepSeek-V3             92.8               -            55.6                      42.0
DeepSeek-V4-Pro         -                  -            -                         -

Kimi K2 95.5 - 70.1 58.3 Kimi K3 - - - - Qwen 3.8 Max 97.5 - 74.8 68.9 GLM 5.3 96.8 - 71.4 64.2 Gemini 2.5 Pro 95.1 - 68.8 63.7 Qwen3 (235B) 94.2 - 60.3 45.0 Llama 4 Maverick 91.5 - 52.1 38.2 D.6 多模态基准 模型 MMMU MathVista MMBench Video-MME GPT-4o 69.1 63.8 83.4 - Claude 4 Opus 72.3 67.5 85.1 - Gemini 2.5 Pro 73.8 69.2 86.3 81.5 Qwen2.5-VL (72B) 68.2 65.1 82.7 78.2 MiniMax-VL-01 65.0 58.3 80.1 - Qwen 3.8 Max 74.5 71.2 88.1 84.6 GLM 5.3 73.1 69.8 86.9 - D.7 Agent 基准 模型 WebArena OSWorld AgentBench SWE-bench Agent Claude 4 Opus Agent 48.5 35.2 82.0 65.8 Gemini 2.5 Pro Agent 42.3 30.1 78.5 63.7 GPT-4o Agent 38.2 25.8 75.2 55.1 Kimi K2 Agent 35.1 22.5 72.3 58.3 Qwen 3.8 Max Agent 44.8 31.7 79.2 66.3 GLM 5.3 Agent 41.6 29.4 76.8 61.9 D.8 数据说明 •表中短横线表示该数据未在公开技术报告或可靠第三方评测中获取 •部分模型因发布较晚数据仍在收集中 •Agent基准受部署配置影响较大,不同评测框架的结果可能有差异 •多模态基准中,部分模型为纯文本模型(如 DeepSeek-R1),未列入 •DeepSeek-V4、Kimi K3、Qwen 3.8 Max 与 GLM 5.3 于 2026 年发布,基准评测数据尚待独立第三方验证

License

原书采用 CC BY-NC 4.0

📑 章节目录

1

第 1 章 AI 算法概述

《AI 算法权威指南》第 1 章:AI 算法概述。

2

第 2 章 输入与位置编码

《AI 算法权威指南》第 2 章:输入与位置编码。

3

第 3 章 核心组件

《AI 算法权威指南》第 3 章:核心组件。

4

第 4 章 生成与输出

《AI 算法权威指南》第 4 章:生成与输出。

5

第 5 章 训练与优化

《AI 算法权威指南》第 5 章:训练与优化。

6

第 6 章 预训练与数据

《AI 算法权威指南》第 6 章:预训练与数据。

7

第 7 章 后训练与持续适应

《AI 算法权威指南》第 7 章:后训练与持续适应。

8

第 8 章 现代大模型架构

《AI 算法权威指南》第 8 章:现代大模型架构。

9

第 9 章 前沿模型案例

《AI 算法权威指南》第 9 章:前沿模型案例。

10

第 10 章 长上下文与推理

《AI 算法权威指南》第 10 章:长上下文与推理。

11

第 11 章 强化学习

《AI 算法权威指南》第 11 章:强化学习。

12

第 12 章 推理增强

《AI 算法权威指南》第 12 章:推理增强。

13

第 13 章 生成式模型

《AI 算法权威指南》第 13 章:生成式模型。

14

第 14 章 多模态

《AI 算法权威指南》第 14 章:多模态。

15

第 15 章 Agent 系统

《AI 算法权威指南》第 15 章:Agent 系统。

16

第 16 章 世界模型

《AI 算法权威指南》第 16 章:世界模型。

17

第 17 章 安全与评估

《AI 算法权威指南》第 17 章:安全与评估。

18

第 18 章 FlashAttention

《AI 算法权威指南》第 18 章:FlashAttention。