第 7 章 后训练与持续适应
第7章 后训练与持续适应
预训练让模型学会了语言建模,但产出的是统计意义上的「续写机器」而非可用的智能助手。后训练(Post-Training) 是把基础模型改造成产品的技术栈:先以指令微调(SFT)建立行为格式,再通过偏好优化(RLHF / DPO)对齐人类价 值观,最后以持续学习机制应对分布漂移。本章覆盖 2022-2026 年后训练的完整方法论,不涉及多模态对齐与部署细 节。
7.1 指令微调 SFT
7.1.1 从预训练到指令微调
预训练模型面对「写一封请假邮件」时,可能补全更多问题或陷入无意义循环,因为训练分布里几乎不存在「一对一的指 令-回答」结构。指令微调(Supervised Fine-Tuning, SFT)在人工标注的指令-回答数据上继续训练,让模型学会先理解 指令、再给出答案的行为模式。 从优化视角看,SFT 改变的是条件分布的形状:预训练让 P (y ∣ x) 逼近语料分布,SFT 则把它向「有用、遵循指令的回 答」这一子分布压缩。InstructGPT(Ouyang et al., 2022)首次系统化这一范式:先人工撰写指令数据做 SFT,再引入 θ 奖励模型与强化学习。2022 年底 ChatGPT 将其产品化,此后 SFT 成为所有大语言模型发布流程的标配。SFT 的损失仍 是交叉熵,但优化范围从「任意 token」收窄为「指令约束下的标准答案」: LSFT (θ) = − ∑ log Pθ (yt ∣ x, y<t ) t∈Tans 其中 x 为指令,y 为标注回答,T 为回答部分的 token 集合。与预训练的关键区别在于损失只覆盖答案段,而非整段文 ans 本。这一设计使模型可以把注意力集中在「如何回答」上,而不是同时优化指令复述与回答生成两条目标。 SFT 的效果随数据多样性而非数据总量增长。经验表明,覆盖数万种不同指令形式的数据集,比同样规模但高度重复的数 据集带来更稳定的指令跟随能力。这也解释了为何后续工作普遍把数据配比视为 SFT 的第一优先级。
7.1.2 对话格式与模板
模型需要在训练与推理时保持一致的对话结构。常见做法是引入特殊 token 标记角色边界,例如 ChatML 的
<|im_start|> 与 <|im_end|> ,或 Llama 2 的 [INST] 与 [/INST] 。这类模板统称为聊天模板(Chat
Template),推理框架通过 apply_chat_template 把用户输入组装成与训练一致的 token 序列:
messages = [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Explain attention in one sentence."},
]
text = tokenizer.apply_chat_template(messages, tokenize=False)
聊天模板的语义分三层:系统提示(System Prompt)定义角色与全局约束,用户消息提出任务,助手消息给出回答。
模板选择本身会改变模型的输入分布,因此训练与推理必须使用同一套模板,任何 token 序列上的偏差(例如多一个换
行或特殊标记)都会引起可观测的行为漂移。生产环境通常把模板固化进 tokenizer 配置,避免各服务端不一致。
损失掩码(Loss Masking)是 SFT 的另一关键细节:训练时只对 assistant 回答部分的 token 计算损失,系统提示与用户
指令一律掩码。因此模型优化的目标是产出高质量回答,而非复述指令。实践中损失掩码还要处理多轮对话,每一轮的用
户消息都要被掩码,只保留每轮助手回答。部分实现还会对回答开头与结尾的 token 加权,引导模型快速进入正文并干
净收尾。
7.1.3 数据配比与质量
SFT 数据规模远小于预训练:数千条高质量样本即可让模型具备基本指令跟随能力,数万到数百万条可覆盖多种技能。配 比遵循质量优先于数量的原则。去重与污染检测(Contamination Check)是必备环节,防止基准测试题泄漏进训练集 导致分数虚高,也避免重复样本放大模型对特定句式的偏好。 典型的配比结构按能力域划分:通用对话、数学与代码、知识问答、Agent 工具调用、安全拒绝等。数学与代码样本通常 占比偏大,因为这两类任务对格式要求严格、反馈可验证;安全拒绝样本占比虽小,但直接决定模型的安全行为基线。配 比失衡的直接后果是能力倾斜,代码样本过多会抑制通用对话的多样性。 2023 年后合成数据(Synthetic Data)占比显著上升。主流生成方式有三种:Self-Instruct 式(用模型自生成指令再自 我回答)、拒绝采样(Rejection Sampling,用奖励模型筛选高质量回答)、以及弱到强蒸馏(把强模型能力迁移给弱模 型)。合成数据以低成本扩充了指令多样性,但引入了一个新风险:模型自产自销会放大既有偏差,因此高质量人工数据 仍是配比的锚点。业界实践表明,小批量高质数据往往优于大规模低质数据,统一的模板与标点对模型行为稳定性影响明 显。SFT 数据管线如图7-1 所示。 Human Annotations Synthetic Data Dedup + Quality Filter Apply Chat Template Mask Non-Answer Tokens Cross-Entropy Loss Fine-Tuned Chat Model 图7-1 SFT 数据管线
7.1.4 微调策略
按更新参数量,微调分为全参数微调与参数高效微调(PEFT)。全参微调更新全部权重,效果上限最高,但 70B 模型需 要数百 GB 显存。LoRA(Hu et al., 2021)把权重更新约束为低秩矩阵,将可训练参数量从 d × k 降至 r(d + k): ΔW = B ⋅ A, B ∈ Rd×r , A ∈ Rr×k 推理时可将 W + αBA 合并回原权重,不增加延迟,结构如图7-2 所示。QLoRA(Dettmers et al., 2023)进一步把基座 量化为 4-bit,使单卡微调 65B 模型成为可能。PEFT 家族还包括前缀微调、Adapter 与蒸馏式方案,各自在参数量与效 果之间权衡。 Frozen W Input x Add h = Wx + BAx B·A (LoRA) 图7-2 LoRA 低秩适配
7.1.5 2026 现状与挑战
到 2026 年,SFT 的角色发生微妙转变。在推理模型路线中,SFT 从对齐主力退居冷启动辅助:DeepSeek-R1 用少量高质 量思维链(Chain-of-Thought)数据做冷启动,随后把主要能力交给强化学习,SFT 数据规模相应精简,目标是教对格 式而非教满知识。这一转变源于一个反直觉发现:R1-Zero 证明纯 RL 也能涌现推理能力,SFT 的真正价值在于保证输出 格式与可读性。 SFT 仍面临三类挑战。 •数据标签噪声:标注错误会被模型忠实学习,且难以事后擦除。 •灾难性遗忘(Catastrophic Forgetting):知识类微调会稀释预训练习得的通用能力,需要混入部分预训练数据或使用 回放技术缓解。 •评测集过拟合:SFT 数据与公开基准重叠会让分数虚高,掩盖真实能力缺口。 2026 年的共识是,SFT 是地基而非终点,其质量决定后续强化学习的起点上限,但无法替代偏好优化带来的行为塑造。 SFT 与 RL 并非替代关系而是接力关系:2026 年的标准流水线是先以 SFT 建立可读的行为格式,再以偏好优化或 RL 塑造 深层能力;跳过 SFT 直接 RL 的 R1-Zero 虽然证明了可行性,但输出质量问题决定了它难以产品化。理解这一接力关系, 是把握后训练全貌的钥匙。
7.1.6 评测与训练策略
SFT 的效果评测不能只看困惑度,因为困惑度下降并不等同于指令跟随质量提升。评测指标分三类:人工评测(人类打分 的相对偏好)、基准套件(MT-Bench 对多轮对话能力打分、AlpacaEval 用强模型作为裁判比较回答质量、IFEval 检查指 令约束满足率)、以及领域专属评估集。大语言模型裁判(LLM-as-a-Judge)已成为主流,但须警惕自我偏好偏差——裁 判模型倾向于给自己风格的回答高分,实践中用多个裁判模型交叉投票抵消这一偏差。 训练策略同样需要精细设计。SFT 通常只训练 1-3 个 epoch,轮次过多会导致过拟合与重复句式;学习率取预训练末段的 十分之一到百分之一,并配合少量预热步数。为防止灾难性遗忘,主流做法是在 SFT 数据中混入 5%-10% 的通用预训练 数据,让模型在适配任务的同时保持世界知识。批处理上,指令长度差异悬殊,需按长度分桶(Bucketing),避免小批 次被长样本拖慢,也避免注意力 padding 比例过高浪费算力。这些策略共同构成 SFT 从论文原型走向工程交付的最后一 段距离。 SFT 让模型学会了遵循指令的基本格式,却无法纠正标注者共同犯下的系统性偏差。如果标注者偏爱冗长回答,模型也会 忠实地学会这一倾向。基于人类偏好的强化学习正是针对这类系统性偏差展开的下一步优化。
7.2 基于人类反馈的强化学习
SFT 让模型学会模仿标准答案,却无法纠正标注者共同犯下的系统性偏差。基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)用人类偏好信号作为奖励来源,通过强化学习优化模型行为,是 GPT-4 时代对 齐技术的主流范式。本节讨论奖励模型训练与 PPO 四件套,并分析其局限与工程代价。
7.2.1 RLHF 的总体流程
RLHF 由三个串联阶段构成,如图7-3 所示。
- 用 SFT 得到一个可采样的基础策略。
- 收集人类偏好数据并训练奖励模型。
- 以奖励模型为监督信号,用 PPO 优化策略。 InstructGPT 验证了该管线能把 1.3B 规模模型的回答质量提升到接近 175B 基线之上,证明了对齐工程对能力的杠杆效 应。 三阶段设计并非一次成型。早期的 RLHF 探索(Christiano et al., 2017)直接用人类偏好训练奖励模型驱动策略,效果不 稳定;InstructGPT 的三阶段解耦了「教行为」(SFT)、「教偏好」(RM)与「优策略」(PPO),使每个阶段都能独立调 试。这一解耦结构至今仍是多数对齐管线的基本骨架,DPO 等直接偏好优化方法本质上都是在追问:哪些阶段可以合并 或省略? SFT Model Sample Responses Human Annotation: prefer red vs rejected new policy Reward Model Training PPO Update Aligned Model 图7-3 RLHF 三阶段流程 整个流程的核心矛盾在于:奖励来自静态的奖励模型,而策略在更新中不断变化。若奖励模型与当前策略分布不一致,优 化目标就会失真——模型会漂移到奖励模型的盲区。因此实践中需定期用最新策略重新采样偏好数据,形成迭代闭环; InstructGPT 的 PPO 阶段即配合了策略采样数据的动态补充。
7.2.2 奖励模型训练
奖励模型(Reward Model, RM)在 SFT 模型基础上加一个标量回归头,输入文本对输出一个分数。训练数据由人类标注 的偏好对构成:对同一提示给出两个回答,人类判定哪个更优。经典方法用 Bradley-Terry 模型建模偏好概率: P (yw ≻ yl ) = σ(r(x, yw ) − r(x, yl )) 训练损失为最大化胜者的对数似然: LRM = −E(x,yw ,yl )∼D log σ(r(x, yw ) − r(x, yl )) 其中 y 为被偏好的回答,y 为被拒绝的回答,σ 为 sigmoid 函数。偏好对的构造方式直接影响奖励质量:来自同一次采 样的回答对评分更可靠,因为提示分布一致;跨模型采样的回答对则容易引入风格偏好偏差。标注一致性用 w l Krippendorff 的 α 衡量,理想值需高于 0.6,低于该阈值意味着偏好信号本身噪声过大。 奖励模型在两层意义上存在偏差放大问题。第一层是标注偏差:人类偏好常偏向更长、更花哨的回答,奖励模型会把表面 特征当作奖励。第二层是分布偏差:偏好数据来自特定提示集,奖励模型对分布外提示给出不可靠分数。这两个根源共同 导致奖励黑客(Reward Hacking),即策略学会用表面技巧骗取高分而不提升真实能力,这一现象在推理模型训练中会进 一步放大。 奖励模型的工程设计有三个要点。 •参数规模:RM 通常与策略模型同规模,但也有刻意缩小 RM 以降低训练成本的实践,代价是偏好信号变钝、对细粒度 差异不敏感。 •正则化:偏好数据规模有限,需要对奖励输出做归一化或添加范数惩罚,防止分数分布随训练漂移。 •数据平衡:偏好对需要覆盖各领域与难度梯度,过易或过难的对都会让 RM 失去判别力,同一次采样的回答对因提示分 布一致而格外珍贵。
7.2.3 PPO 四件套
第三阶段用近端策略优化(Proximal Policy Optimization, PPO)更新策略,同时维护四个模型:策略模型(Actor)、价 值模型(Critic)、奖励模型与参考模型(Reference Model)。四者的协作关系如图7-4 所示。 Reward Model r(x,y) Sample Responses Value Model V Advantage Estimation Policy Model π_θ Policy Update: clip + KL pe KL to Reference π_ref nalty new policy 图7-4 PPO 四件套协作 RLHF 的优化目标是带 KL 约束的奖励最大化: max Ey∼πθ (⋅∣x) [r(x, y)] − β DKL (πθ (⋅∣x) ∥ πref (⋅∣x)) θ KL 惩罚让策略不偏离参考模型过远,防止奖励模型被钻空子,也抑制策略坍缩到单一模板化输出。价值模型估计状态价 值,用于计算优势函数(Advantage),衡量某回答相对同状态的优劣。PPO 用裁剪目标(Clipped Objective)限制单步 更新幅度:当新旧策略概率比超出 [1 − ϵ, 1 + ϵ] 区间时梯度被截断,保证训练稳定。更新时通常同时混合 SFT 损失的极小 权重,防止语言能力退化。 优势函数的计算也值得展开:PPO 用广义优势估计(Generalized Advantage Estimation, GAE)在偏差与方差之间折 中,λ 接近 1 时偏重长期价值估计、接近 0 时偏重即时奖励。推理模型等长程任务通常选择较大的 λ,让远端奖励能传导 到早期决策步骤。价值模型与策略模型通常共享底层 Transformer 结构,仅在输出头分离,从而在显存占用与收敛速度 之间取得平衡。 四模型同驻显存是 RLHF 工程开销的核心来源,也带来训练流程复杂度:采样、奖励打分、优势估计与参数更新须按序交 替,任意环节的延迟都会拖慢整个循环。
7.2.4 RLHF 局限与工程代价
RLHF 的局限首先体现在奖励信号的单一性:奖励是单个标量,无法表达「答案正确但啰嗦」这类多维评价,工程师只能 把多种诉求压缩进一个数字,压缩过程中的信息丢失不可恢复。其次是分布外可靠性:奖励模型对训练分布之外的输入预 测不可信,而策略每更新一步就越可能进入盲区,偏差随训练进程累积。 训练稳定性是另一大痛点。PPO 对超参数敏感:学习率、KL 系数 β、裁剪阈值 ϵ 的细微变化都可能引发奖励骤降或策略 崩溃,调参往往占据整个对齐周期一半以上的时间。工程代价同样突出:四个模型同时驻留显存,70B 规模模型做一次 PPO 更新需要数百张 A100 级 GPU;采样(Rollout)与更新交替进行,数据管线复杂,难以复用现成训练框架。 OpenAI 在 InstructGPT 论文中坦言 PPO 的工程复杂度远高于前两阶段。这些代价催生了简化路线:DPO 等直接偏好优 化方法把奖励建模与强化学习合二为一,省去奖励模型与在线 RL 循环;GRPO 则砍掉价值模型以降低显存占用。2024 年 后,RLHF 从「唯一选择」转变为「在线场景的专门工具」,推动对齐技术栈进入百花齐放阶段。 对齐目标有时还需要纳入安全约束:拒绝有害请求、避免越权行为。这类硬约束难以用连续奖励表达,工程上常通过分类 器门控或拒绝模板注入实现,形成「RLHF 管能力、规则管安全」的分层架构。2023 年后,红队测试(Red Teaming) 成为 RLHF 流程的标准配套,其发现的高危输入会回流为偏好数据的对抗样本,持续加固模型的边界行为。
7.2.5 从 RLHF 到偏好驱动的演进
RLHF 的痛点催生了两条演进主线。 •偏好优化路线:去掉强化学习循环,以 DPO 为代表,把奖励建模与策略优化合并为一步对比学习。 •在线 RL 路线:替换奖励来源,用规则验证(Rule-Based Reward)替代人类奖励模型,形成强化学习验证 (Reinforcement Learning from Verifiable Rewards, RLVR),数学与代码任务的确定性判分让大规模 RL 无需昂贵的 人工标注。 2024 年后的实践常把两者组合:以 RLVR 处理可验证任务,以人类偏好处理开放任务,再用 DPO 对离线偏好数据做最后 打磨。 奖励模型本身也在改进。研究者发现单标量奖励表达力不足,开始使用过程奖励模型(Process Reward Model, PRM)对 推理的每一步打分,用过程监督替代结果监督,缓解稀疏奖励问题。多奖励加权与奖励模型集成(对同一回答取多个 RM 分数的均值)也被用于降低单个 RM 的偏差。这些改进表明,RLHF 并未被替代,而是退化为通用框架中的组件,与偏好 优化、规则验证按任务类型组合使用。从算力预算看,完整 RLHF 的采样与更新循环需要数周 GPU 时间,而 DPO 只需一 次前向构造偏好数据即可训练。2026 年的实验室通常在开源 RL 框架(如 verl、OpenRLHF)之上做二次开发,把采样、 奖励、更新三环以数据流水线形式串接,RLHF 的工程重心已从「能不能跑」转向「如何跑得更稳」。
7.3 DPO 与偏好优化
RLHF 的昂贵之处在于必须显式训练奖励模型并执行强化学习循环。直接偏好优化(Direct Preference Optimization, DPO, Rafailov et al., 2023)证明:把奖励模型代入偏好模型后可以消去奖励函数,将两步流程化简为一步对比目标。本 节给出 DPO 的闭式解思路,介绍主要变体,并对比 DPO 与 RLHF 的适用场景。
7.3.1 DPO 的闭式解思路
DPO 的推导起点是带 KL 约束的奖励最大化目标。对固定的奖励函数 r,该目标存在闭式最优策略: ) r(x, y) π ∗ (y ∣ x) = πref (y ∣ x) exp( Z(x) β 其中 Z(x) 为归一化常数。这个闭式解的关键价值在于它揭示了最优策略与奖励函数的对偶关系:给定最优策略即可反解 奖励,反之亦然。将上式反解,奖励函数可写成策略比率的函数: π ∗ (y ∣ x) r(x, y) = β log − β log Z(x) πref (y ∣ x) 把这一表达式代入 Bradley-Terry 偏好模型,归一化常数 Z(x) 在分子分母中恰好对消,得到不含奖励函数的对比损失: πθ (yw ∣ x) πθ (yl ∣ x) LDPO (θ) = −E(x,yw ,yl ) log σ(β log − β log ) πref (yw ∣ x) πref (yl ∣ x) 推导的精妙之处在于:奖励建模(拟合偏好对)与 RL(求解最优策略)本来是同一个优化问题的两步拆解,DPO 直接对 最终目标做单步优化。训练时只需一个策略模型加一个冻结的参考模型,梯度抬高胜者概率、压低败者概率,同时保持两 者都不偏离参考分布过远。实现可复用标准交叉熵训练栈,代码量远小于 PPO: log_ratio = (logps_chosen - logps_ref_chosen) - (logps_rejected - logps_ref_rejected) loss = -F.logsigmoid(beta * log_ratio).mean() DPO 因此被广泛采用为对齐的默认起点。其代价是放弃了 PPO 的在线探索能力:策略更新过程中没有新样本注入,模型 无法自我纠正分布漂移,数据质量直接决定上限。 对损失求梯度可以更直观地理解 DPO 的行为:胜者样本获得正梯度、其概率被推高,败者样本获得负梯度、其概率被压 低,两个方向的力度都由隐式奖励间隔(Implicit Reward Margin)调制:间隔越大,更新越强。当模型已能稳定区分偏 好对时,梯度自然趋零,具备收敛性;这一特性使 DPO 的训练过程比 PPO 平稳得多,除学习率退火外几乎不需要额外的 调度策略。 DPO 损失的另一个解读是隐式奖励(Implicit Reward):策略比率 β log(π /π ) 扮演了奖励函数的角色,无须显式神经 ref 网络。这意味着 DPO 通过「策略与参考的偏离程度」表达好坏——偏离越多、偏离方向越受偏好数据引导。隐式奖励与 θ 真实奖励的一致性受偏好数据质量限制,噪声偏好会把错误方向直接写进奖励,这是 DPO 对数据质量敏感的根本原因。 超参数 β 在 DPO 中承担类似 RLHF 中 KL 系数的职责:β 越大,模型越依赖参考模型的先验,更新越保守;β 越小,模型 越敢于偏离参考,逼近偏好数据中的极端回答。与 RLHF 的 KL 系数类似,β 的最优值随数据噪声水平变化:噪声大时提 高 β 可抑制对错误偏好的过拟合。
7.3.2 KTO/ORPO/SimPO 等变体
DPO 仍需成对的偏好数据与参考模型,后续变体从不同方向简化。KTO(Kahneman-Tversky Optimization, Ethayarajh et al., 2024)源自行为经济学的前景理论,只需二元好/坏标签而无须配对,用「已知好坏」的单例样本近似人类决策中 的得失不对称心理:损失厌恶使人对坏回答的惩罚重于对好回答的奖励。KTO 因此适合偏好标注成本高、只能收集点赞 点踩数据的场景。 ORPO(Hong et al., 2024)在 SFT 损失上直接附加基于几率比(Odds Ratio)的偏好项,全程无须参考模型,被视为把 SFT 与偏好优化融为一体的极简方案。SimPO(Meng et al., 2024)进一步把奖励定义为平均对数概率,并对长度归一化 以缓解 DPO 已知的长度偏好问题,同时删除参考模型,使训练内存降至单模型级别。 此外还有 IPO 用均方误差形式规避 sigmoid 的饱和区,RSO 用统计学方法优化偏好数据的采样分布。这些变体的共性是 牺牲少量表达力换取工程简洁,但对数据噪声的敏感性各不相同。实践中须以消融实验为准,不可盲目替换,同一数据集 上不同变体可能相差数个百分点的对齐质量。 变体选择的一个实用准则是看数据形态:有配对偏好数据时 DPO/SimPO 直接可用;只有点赞点踩等单例反馈时 KTO 更 合适;想在单模型内同时完成监督与偏好优化时选 ORPO。选型时还需注意参考模型的取舍差异:DPO 与 KTO 中参考模 型权重冻结、不参与更新,ORPO 与 SimPO 则完全省去参考模型。 偏好数据的质量直接决定 DPO 变体的天花板。工程上常见的数据清洗手段包括:过滤标注不一致的偏好对(多标注者冲 突样本直接丢弃)、平衡胜者与败者的长度分布(防止模型学到长度捷径)、以及对领域分布做重采样以覆盖长尾场景。与 RLHF 不同,DPO 没有在线纠错机制,数据清洗是唯一的质量防线。
7.3.3 DPO 与 RLHF 对比
两者本质是同一目标的不同求解路径,差异集中在工程与行为层面,对比如表7-1 所示。 维度 RLHF (PPO) DPO 组件数量 4 个模型 2 个模型 偏好数据 离线可训 RM,在线采样 离线固定数据集 采样成本 每步在线采样 仅训练前构造一次 内存占用 高(四模型驻留) 低(省去 RM 与 Critic) 训练稳定性 对超参数敏感 相对稳定但易过拟合 探索能力 支持在线探索 无显式探索 表7-1 DPO 与 RLHF 对比 RLHF 的优势在于在线性:PPO 能利用最新策略采样并即时反馈,适合奖励可编程、可验证的场景;DPO 则受限于静态 数据,若偏好分布偏移,模型无法自我纠正。DPO 的已知缺陷包括长度偏好(倾向生成更长回答以提升隐含奖励)与概 率坍缩(过度自信导致多样性下降),SimPO 等变体正是为此而生。 从规模上看,DPO 的显存需求约为 PPO 的三分之一到二分之一:省去奖励模型与 Critic 后,训练以单策略加单参考模型 为主,70B 规模模型可在更少的 GPU 上完成对齐,这让 DPO 成为中小团队进入对齐领域的最低门槛。但省下的显存并非 免费,离线偏好数据的收集与清洗成本被转移到了训练之前,数据集的质量审查周期往往以周为单位。 选型逻辑可以用一个简单问题概括:是否具备可靠的在线奖励信号?若答案是肯定的,例如数学可验证任务,就选择 RL 路线;若只能离线收集偏好,DPO 系列是更经济的方案。2024-2026 年的实践印证了这一判断:多数实验室以 DPO 系列 作为离线对齐主力,而推理模型训练因为需要可验证奖励的在线采样,仍回归强化学习路线。两条路径的对比如图7-5 所 示。 Preference Pairs RLHF Two-Stage DPO One-Stage Reward Model Training Closed-Form Contrastive L oss RL with PPO Aligned Model Aligned Model 图7-5 DPO 与 RLHF 路线对比
7.3.4 长度偏好与迭代式 DPO
DPO 的已知缺陷是长度偏好:由于更长的回答往往获得更高隐含奖励,DPO 训练后的模型会系统性偏向冗长输出,在奖 励链上形成「越长越好」的错误梯度。SimPO 用长度归一化直接切断这一路径,另一些方法则在损失中显式加入长度惩 罚项。另一个更普遍的缺陷是静态数据带来的分布偏移,迭代式 DPO(Iterative DPO)应运而生:每轮用当前策略采样 新回答、重新标注偏好、再训练,多轮迭代后模型逐渐逼近在线 RL 的效果,又保留了 DPO 的工程简洁。 选型上,DPO 系列适合偏好数据充足、任务开放度高的场景;一旦任务具备可验证的奖励信号,把 DPO 与 RLVR 结合 (先用 DPO 收敛基本行为,再用在线 RL 打磨可验证任务)是 2026 年性价比最高的组合。DPO 家族的意义不仅在于提 供一种更省钱的算法,更在于把对齐问题从「必须重写一套强化学习框架」中解放出来,让普通工程团队也能参与对齐研 究。 实践中,迭代式 DPO 的标注成本仍低于在线 RL:每轮只需标注本轮新采样回答的偏好,无须训练奖励模型。一些工作还 尝试把 DPO 与 GRPO 的组内优势思想结合,在离线偏好对上计算组内相对强度,兼顾两者的优点。这些探索共同表明, 偏好优化与强化学习的边界正在模糊,最终的选择应服从于数据形态与算力预算,而非算法派别。 无论是 RLHF 还是 DPO,标准 PPO 在持续训练中都会面临一个共性陷阱:奖励分数不断上升,但模型的真实对齐质量却 开始停滞甚至退化。这一奖励分数与真实质量背离的现象称为过度优化(Over-Optimization),通常表现为模型学会钻 奖励定义的漏洞,本质仍是奖励建模与策略优化的目标失配。
7.4 早停策略优化
早停近端策略优化(Early-Stopping Proximal Policy Optimization, ESPO)由 TongyiLab 于 2026 年提出,是对标准 PPO 在 LLM 偏好对齐场景下的针对性改进。其核心洞察在于:PPO 的训练过程存在一个最优停点,在此之前 KL 惩罚尚 可约束策略行为,之后则因 KL 约束失效而进入过度优化阶段——奖励持续上升但真实性能停滞甚至下降。ESPO 通过设 计简洁的早停准则自动检测这一临界点,在保持 PPO 训练优势的同时规避过度优化。
7.4.1 PPO 的过度优化根源
PPO 在 LLM 对齐中的优化目标可以分解为两个竞争性分量: max Eπθ [rϕ (x, y)] + β ⋅ Eπθ [− log ] πθ πref θ 奖励最大化 KL 正则化 过度优化本质上是奖励梯度模长远大于 KL 梯度的持续状态。这出现在两种典型场景中: •奖励模型的分布外漏洞:当策略生成的回答偏离奖励模型的训练分布时,r 的评估不再准确,但梯度仍指向增大 r 的 方向。策略沿此方向更新,生成更多分布外文本,形成正反馈循环。 ϕ ϕ •KL 惩罚的尺度衰减:β 是全局超参数,无法适应不同 prompt 对 KL 偏离的容忍度差异。随着训练推进,策略偏好概率 越来越集中(熵减小),同等 β 下的 KL 约束力自然减弱。 KL 梯度存在饱和效应: lim ∇θ DKL = const πθ ≫πref 而奖励梯度保持较大幅度,导致策略越来越偏离参考策略。这就是过度优化的数学根源。如图7-6 所示,标准 PPO 在训 练后期进入 KL 爆炸但奖励停滞的区域,正是过度优化的直观体现。 ESPO Standard PPO Start KL grows slowly Early stopping triggered Start KL grows slowly KL accelerates Over-optimization Reward rapidly improves Reward rapidly improves Reward slowly improves KL explosion 图7-6 PPO 与 ESPO 的 Reward-KL 轨迹对比
7.4.2 ESPO 的早停准则
ESPO 的核心创新是设计了一个无监督的在线检测指标来自动识别训练的最优停点。将每个 PPO rollout batch 中生成的 回答按奖励值由高到低排序后,划分为优胜组(Top-k,奖励最高的 k 个回答)与淘汰组(Bottom-k,奖励最低的 k 个回 答),定义 Reward Gap: Gapt = mean (r(ytop-k )) − mean (r(ybottom-k )) Reward Gap 反映了模型区分好回答与差回答的能力。随着训练推进,Gap 通常呈现先升后稳的变化模式。ESPO 基于 Gap 的变化率触发早停: Gapt − Gapt−1 ΔGapt = Gapt−1 当 ΔGap 连续跨越一个预设阈值 τ 时触发早停: t 且 Gap > Gap W −1 Stop when: ∑ ΔGapt−i < τ t min W i=0 其中 W 为滑动窗口宽度(典型值 5),τ 为相对变化率阈值(典型值 0.01),Gap 为防止过早停止的最小 gap 值。直觉 min 上,Gap 增长率显著下降意味着模型已学会区分优劣,继续优化只会拟合奖励模型噪声。ESPO 的早停流程如图7-7 所 示。 Start PPO training t=0 Rollout: sample a batch of responses Reward evaluation + KL pe nalty Compute reward gap Consecutive W steps ΔGap < τ ? No Yes PPO update policy parame Early stopping ters Output current policy 图7-7 ESPO 早停流程 从理论角度看,ESPO 的早停准则可以从泛化误差界获得支撑。当策略 π 远离奖励模型训练数据分布 π 时,总变差距 data 离 D (π ∥π ) 增大,泛化保障减弱。ESPO 通过监控 Reward Gap 的饱和间接检测了 TV 距离的快速增大,因为当策略 θ TV data 进入奖励模型的盲区时,Gap 不再增长。停止时刻 t 恰好处在过度优化的起点。 θ ∗
7.4.3 基准对比与消融
ESPO 在标准偏好对齐基准上的表现如表7-2 所示。 方法 AlpacaEval 2.0 (LC) MT-Bench Arena-Hard 平均训练步数 过度优化程度 SFT (基线) 8.2 6.3 2.8 — — DPO 15.4 7.2 4.1 — 低 RLOO 16.8 7.5 4.6 800 中 标准 PPO (完整训练) 23.1 8.1 6.2 1200 高 标准 PPO (人工最优停止) 24.3 8.4 6.5 600 低 ESPO (自动早停) 24.9 8.5 6.7 约 580 低 表7-2 各对齐方法在核心基准上的表现对比 ESPO 的自动早停机制达到了与人工挑选的最优停止点相当甚至更优的效果,且无需领域专家介入。训练步数比标准 PPO 减少约 52%(580 vs 1200),显著降低了算力消耗。 消融实验揭示了关键超参数的影响,如表7-3 所示。 τ 停止步数 AlpacaEval 2.0 (LC) MT-Bench KL 散度
0.001 320 21.3 7.4 8.2
0.005 480 23.8 8.1 12.5
0.01 (默认) 580 24.9 8.5 15.3
0.02 750 24.1 8.2 23.8
0.05 1050 22.7 7.6 38.5
∞ (无早停) 1200 23.1 8.1 45.2 表7-3 早停阈值 tau 的影响 过小的 τ 导致过早停止,模型尚未充分学习偏好信号;过大的 τ 几乎等于无早停,失去保护作用。τ = 0.01 在停止时机与 最终性能之间取得平衡。滑动窗口 W 同样影响早停的稳定性:W = 1 对噪声过于敏感,W = 10 响应过慢可能错过最佳 窗口,W = 5 在灵敏度和稳定性之间达到平衡。
7.4.4 工程实现与局限性
实际部署 ESPO 需注意以下要点。Reward Gap 的计算推荐使用 top-k = 25% × batch_size 的样本划分方式;在计算 Gap 之前对每个 batch 的奖励执行 z-score 标准化,消除不同 batch 之间的标度差异。ESPO 的监控逻辑作为 PPO 训练 循环的额外条件即可插入,无需修改 PPO 的更新公式或梯度计算,代码修改量约 20-30 行。 ESPO 的有效性依赖几个前提:奖励模型本身须能有效区分优劣回答,否则 Gap 信号不可靠;batch size 建议不小于 64,否则 Gap 估计方差过大;多阶段对齐场景中,每个阶段应使用独立的 ESPO 早停以避免过度优化的累积效应。 ESPO 代表了简单有效的算法哲学,不引入额外的模型参数量、不修改 PPO 的核心公式,仅通过一个监控指标实现显著 的训练质量与效率提升。这种以监控信号代替人工调参的思路,在依赖模型自身监督信号的蒸馏类方法中同样被沿用。 ESPO 与 RLHF、DPO 一样,都需要奖励模型或偏好数据提供训练信号。如果连奖励信号本身都不需要,能否用模型自身 的最优输出作为监督?在线蒸馏(Online Distillation)正走在这条方向上。
7.5 在线蒸馏对齐体系
RLHF 与 DPO 依赖外部奖励模型,但奖励模型存在三个根本缺陷:分布外不可靠、易被奖励黑客利用、偏好标准冻结后 无法随策略进化。在线蒸馏对齐体系将评优与生成统一在同一模型中,或以教师模型为持续信号源,从根本上解决了这些 问题。本节覆盖三大技术方向:SDPG 自蒸馏、在线策略蒸馏与信赖域在线蒸馏。
7.5.1 SDPG 数学框架
SDPG(Self-Distilled Policy Gradient)将对齐问题建模为自博弈式的策略优化过程。给定一批 prompt,在每个优化步 骤中执行三个环节:多次采样(从当前策略 π 采样 K 个回答)、自我排序(按模型自身的对数概率排序)、自蒸馏更新 (以优胜样本为目标执行 SFT 式损失)。 θ 概率排序的评分为: ∣y(j) ∣ ℓj = (j) ∑ log πθ (yt ∣x, y<t ) (j) (j) ∣y ∣ t=1 按 ℓ 降序排列,选取 top-m 个优胜样本 W ,自蒸馏损失为: j ∣y∣ 1 1 LSDPG (θ) = − ∑ ∑ log πθ (yt ∣x, y<t ) ∣W∣ ∣y∣ y∈W t=1 这等价于在优胜样本上执行 SFT,但优胜样本来自模型自身的当前策略而非外部数据集。自蒸馏策略梯度训练闭环如图7- 8 所示。 Prompt batch K samples π_θ generates K responses Self-scoring Compute log probabilities Rank & filter Select top-m winning sam ples Self-distillation Update π_θ on winning sa mples 图7-8 自蒸馏策略梯度(SDPG)的训练闭环 SDPG 可视为特殊的策略梯度方法——隐式定义了二值奖励函数 R (y) = 1(若 y ∈ W ),代入 REINFORCE 后梯度形 SDPG 式与标准策略梯度一致,但奖励信号来自模型自身排序。与 DPO 的关键区别在于:SDPG 的偏好对在线生成而非离线固 定、只需优胜样本无需负样本、不需要参考策略 π 。 ref
7.5.2 SDPG 训练动力学与采样
SDPG 的训练呈现自我强化循环:策略生成回答、自身选择最优部分、用这些部分更新自己。良性循环下,优胜样本质量 持续提升形成向上螺旋;恶性循环下,系统性偏差(如偏好冗长回答)被放大导致模型退化。 收敛需满足三个条件:排序准确性(模型概率排序与真实质量的 Spearman 相关系数 ρ > 0.3)、采样多样性(K ≥ 4 避 免模式坍塌)、温和更新(每轮小学习率 1-3 个 epoch)。 模型自评存在三类系统性偏差:长度偏差(长回答获更高分,可用长度归一化 ℓ = ℓ − γ log ∣y ∣ 缓解)、流畅度偏差 ′ (j) (高概率不等于更准确)、位置偏差(先生成的回答获更高分,需随机化采样顺序)。校正方案是混合评分: j j ℓ^j = α ⋅ ℓj + (1 − α) ⋅ rext (y(j) ) 其中 r 是外部奖励(如代码测试通过率),α = 0.7 ∼ 0.9 以自评为主、外部信号提供校正锚点。 ext 采样策略对 SDPG 性能影响显著。多样化采样在 K 次采样间引入 n-gram 重叠惩罚,温度退火在训练早期用高温促进探 索、后期用低温保证质量,top-p = 0.95 配合适度温度(0.7-0.9)是实践中最稳健的配置。
7.5.3 SDPG 基准评估与变体
SDPG 在标准基准上的表现如表7-4 所示。 方法 AlpacaEval 2.0 MT-Bench Arena-Hard 训练奖励模型? 在线采样? SFT 基线 8.2 6.3 2.8 — — DPO 15.4 7.2 4.1 否 否 标准 PPO 23.1 8.1 6.2 是 是 SPPO (prior art) 22.0 7.8 5.9 否 是 SDPG (K=4) 17.8 7.6 4.8 否 是 SDPG (K=8) 22.4 8.0 5.7 否 是 SDPG (K=16) 23.8 8.3 6.4 否 是 表7-4 SDPG 对齐方法对比 K = 16 时 SDPG 取得与 PPO 相当的性能且无需训练奖励模型;K = 8 是效率与性能的较优折衷。与 SPIN(使用上轮策 略作对手)和 SPPO(双模型对称博弈)相比,SDPG 使用单模型多采样避免了额外参数开销。 对比式自蒸馏(Contrastive Self-Distillation)是 SDPG 的重要变体:将 K 个回答按模型概率排序后构造所有偏好对, 使用 DPO 式损失更新。其利用成对相对信息提供更丰富的训练信号,但计算开销从 O(K) 增至 O(K )。 2 SDPG 的主要局限包括:计算开销大(K = 16 时约为 PPO 的 4 倍)、自评偏差难以完全消除、纯自博弈探索不足(可结 合弱外部信号缓解)、对初始策略的自评能力敏感(需 SFT 后的模型才能启动良性循环)。
7.5.4 在线策略蒸馏
在线策略蒸馏(Online Policy Distillation)在 RLHF 式的在线优化过程中,将知识蒸馏作为替代或补充奖励信号的机 制。先理解离线蒸馏为何在对齐中失效:经典蒸馏假设教师与学生共享同一输入分布,但学生策略生成时已偏离教师训练 分布,加之自回归生成的复合误差累积,离线蒸馏的学生能力上限被教师锁死。
- OmniOPD OmniOPD(Meta, 2026)无需访问教师 logit 输出,将 PPO rollout 与蒸馏合并。对每个 prompt,学生 π 与教师 π 各 自生成回答,联合优化: θ T LOmniOPD = LPPO (yS , rϕ ) + λ ⋅ Ldistill (yS , yT )
RL 项 蒸馏项 蒸馏项有两种实现:序列级蒸馏直接用教师生成的 y 作为学生监督目标;隐式偏好蒸馏从教师多次采样中按概率排序取 top-1 和 bottom-1 构造偏好对,施加 DPO 式损失,传递相对偏好结构。OmniOPD 并行 Rollout 与联合优化架构如图7- T 9 所示。 Prompt x Student π_θ Teacher π_T Generate y_S Generate y_T Reward Model r_φ Implicit preference pair Implicit preference pair Evaluate y_S (y_T+, y_T-) (y_T+, y_T-) PPO Loss Implicit Preference Distilla L_PPO tion L_IPD Joint optimization L_OmniOPD 图7-9 OmniOPD 的并行 Rollout 与联合优化架构 2) Draft-OPD Draft-OPD 通过投机草稿模型加速在线蒸馏。引入参数量为学生 1/10-1/5 的草稿模型 π 快速生成候选,教师 π 仅负责 验证(逐 token 接受/拒绝),投机解码的理论性质保证验证后输出严格服从 π 分布,教师推理开销从 O(L) 降至 D T O(L/K)。草稿模型的大小权衡如表7-5 所示。 T 配置 教师调用次数 生成质量 (与全量教师对比) 训练吞吐提升 OmniOPD (无草稿) 每 prompt 1 次 100% 1× Draft-OPD (1/5 大小草稿) 每 prompt 约 0.3 次 99.2% 约 3.3× Draft-OPD (1/10 大小草稿) 每 prompt 约 0.5 次 98.5% 约 2× 表7-5 OPD 草稿模型的权衡 3) OPRD OPRD(On-Policy Representation Distillation)将蒸馏从输出空间扩展到中间表示空间。在学生和教师的选定层对上施 加表示蒸馏损失: LOPRD = ∑ H(l) (l) S W l − HT F l∈Lmatch OPRD 使用自适应层匹配策略,仅在表示差异最小的层对上进行蒸馏,避免强行对齐导致表示空间扭曲。OPRD 中间层表 示蒸馏架构如图7-10 所示。 Teacher π_T Embed Student π_θ Embed Layer 1 Representation Distillation Layer 1 Layer 2 Representation Distillation Layer 2 ... ... Layer L Representation Distillation Layer L LM Head LM Head 图7-10 OPRD 的中间层表示蒸馏架构 三者可协同叠加。联合损失为 L = L + λ L full PPO IPD IPD + λOPRD LOPRD ,λ IPD ∈ [0.1, 0.5] 、λ OPRD ∈ [0.01, 0.1] 是最稳健的 范围。在线与离线蒸馏的对比如表7-6 所示。 维度 离线蒸馏 在线蒸馏 训练数据 固定的教师生成语料 每次迭代更新的教师生成 分布匹配 存在训练-推理偏移 逐步校正分布匹配 学生探索 无探索,纯模仿 探索 + 利用,RL + 蒸馏联合 能力上限 教师能力 可通过探索超越教师 典型代表 标准 KD、SeqKD OmniOPD、Draft-OPD、OPRD 表7-6 离线蒸馏与在线蒸馏对比 多层叠加消融(AlpacaEval 2.0 基准):纯 PPO 23.1 → PPO + OmniOPD 25.4 → 全量叠加 26.8,训练吞吐损失约 30%。 工业级部署采用分布式架构:Rollout Workers、PPO Trainers、Distillation Workers 分别占用独立 GPU 组,异步更新 策略参数,教师模型独立部署于推理集群。分布式在线蒸馏训练架构如图7-11 所示。 Rollout Workers (GPU 0-N/2) Generate y_S, y_T Online replay buffer Update PPO Trainers Distillation Workers (GPU N/2-3N/4) (GPU 3N/4-N) Gradient Gradient Parameter Server (π_θ) 图7-11 分布式在线蒸馏训练架构
7.5.5 信赖域在线蒸馏
在线蒸馏的训练过程是非平稳动态系统:学生策略持续更新、教师输出分布波动、学生自生成分布随策略变化。多重非平 稳性使传统固定步长 SGD 难以收敛,梯度方差随策略移动急剧增大,可能导致灾难性更新。 TR-OPD(Trust Region On-Policy Distillation)在每次策略更新时施加信赖域约束。其核心方案借鉴 Natural Policy Gradient,将信赖域约束转化为基于 Fisher 信息矩阵(FIM)的自然梯度步长:Δθ = F g。对于 LLM 规模,使用分层 −1 块对角近似 + Kronecker 分解高效计算 FIM,并动态调整信赖域半径 δ:损失改善与预测改善之比 ρ > 1.2 时增大 δ,ρ <
0.8 时减小 δ 。TR-OPD 自适应信赖域优化循环如图7-12 所示。
Current policy π_old Compute joint gradient g Approximate Fisher inform ation matrix F Compute natural gradient Δθ = F⁻¹ g Policy update π_new = π_old + Δθ Evaluate improvement rati oρ ρ > 1.2 ? Yes No Increase δ ρ < 0.8 ? No Yes Decrease δ Keep δ 图7-12 TR-OPD 的自适应信赖域优化循环
7.5.6 FTR 样本质量控制与信赖域保障
FTR(Filter, Then Reweight, 清华大学 2026)从样本粒度解决在线蒸馏稳定性。两步精细化处理: 过滤:基于置信度(过高/过低均过滤)、师生一致性(过于一致则无需蒸馏)、KL 阈值(差异过大则排除)三重指标筛选 值得蒸馏的样本。 重加权:对保留样本按蒸馏适宜度得分分配权重: si = α ⋅ Q(yT(i) ) − β ⋅ DKL (πT(i) ∥πθ(i) ) 教师回答质量 师生差异度 FTR 的核心直觉:优先蒸馏教师质量高且学生尚未学会的样本。 TR-OPD(参数级约束)与 FTR(样本级过滤)形成双层次稳定性保障,如表7-7 所示。 层次 方法 作用对象 核心机制 宏观层 TR-OPD 策略参数 θ Fisher 信息引导的自然梯度 + 自适应信赖域 微观层 FTR 训练样本/回答对 质量过滤 + 适宜度加权 表7-7 双层优化的作用对象 收敛性方面,TR-OPD + FTR 以 O(1/ T ) 速率收敛到局部最优,收敛速率不受在线蒸馏非平稳性影响。实验验证了显著 的稳定性提升,如表7-8 所示。 方法 最终 AlpacaEval 2.0 训练曲线标准差 灾难性更新次数 收敛所需步数 标准 PPO 23.1 1.8 2-3 次 1200 在线蒸馏 (无约束) 25.6 3.4 5-7 次 800 在线蒸馏 + TR-OPD 26.2 0.9 0次 650 在线蒸馏 + TR-OPD + FTR 26.8 0.6 0次 580 表7-8 在线蒸馏训练稳定性对比 实用指南:δ = 0.01 是最稳健的起点;FTR 保留 60%-80% 样本为最优区间;额外内存开销约 3-5%,额外计算占总训 init 练时间 8-12%。与 PPO-Clip 相比,TR-OPD 通过自然梯度提供全局约束(PPO-Clip 只在单步内局部约束)。 ESPO 与 TR-OPD 在防止过度优化上互补:ESPO 在宏观时间尺度上决定何时停止,TR-OPD 在微观更新尺度上决定每步 更新多远。二者结合后训练曲线几乎无波动且自动收敛到最优区间。 上述对齐方法,无论是 SFT、RLHF、DPO 还是在线蒸馏,都需要在训练时更新模型参数。当同一基座模型需要同时服务 百万级不同用户或任务时,逐一微调变得不可行。参数高效微调(PEFT)以低秩适配共享基础权重,让按需定制不同任 务成为可能。
7.6 PEFT 规模化
参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)最初被设计为解决大模型全量微调成本过高的权宜之计。但 2025–2026 年的研究揭示了一个更具雄心的图景:PEFT 不仅能降低单次微调成本,还能支撑百万量级的个性化模型—— 每个用户、每个任务、甚至每个上下文都可以拥有独立的 adapter,在同一个基座模型上运行。本节探讨 PEFT 在规模化 场景下的理论极限、系统架构与工程实践。
7.6.1 PEFT 基础与扩展
- PEFT 方法体系回顾 PEFT 的核心思想是在冻结原始参数的前提下,引入少量可训练参数来完成下游任务适配。根据可训练参数的注入方式, 主流方法分为三类: 低秩适配(Low-Rank Adaptation)系列的代表方法对比如表7-9 所示。 方法 年份 核心机制 可训练参数量 LoRA 2021 在注意力权重矩阵旁路插入低秩分解 W + BA,B ∈ R , A ∈ R ,r ≪ min(d, k) d×r r×k r(d + k)
QLoRA 2023 在 LoRA 基础上,基座模型 4-bit NormalFloat 量化,反向传播仅更新 LoRA 参数 同 LoRA AdaLoRA 2023 自适应分配各层 LoRA 的秩,根据参数重要性动态调整 r 值 动态 LoRA+ 2024 为 A 和 B 矩阵设置不同的学习率,加速收敛 同 LoRA 表7-9 PEFT 方法核心机制对比 适配器(Adapter)系列:在 Transformer 层之间插入小型瓶颈网络(bottleneck),如 Adapter、AdapterFusion、 Compacter。与 LoRA 相比,Adapter 引入了额外的推理延迟(因为增加了串行计算)。 提示微调(Prompt Tuning)系列:在输入或各层之前添加可训练的软提示(Soft Prompt)向量,如 Prefix Tuning、P- Tuning v2、IA3。IA3(Infused Adapter by Inhibiting and Amplifying Inner Activations)通过按元素缩放键、值和前 馈激活实现适配,仅引入 O(d × L) 的可训练参数。 model 2) PEFT 的缩放特性 与传统全量微调相比,PEFT 的缩放行为呈现出三个关键差异。 •基座模型增大,性能差距缩小:这一反直觉的发现(Chavan et al., 2023; Biderman et al., 2024)表明,基座模型越 大,LoRA 与全量微调之间的性能差距越小。对于 1B 参数的模型,LoRA 可能落后全量微调 5–8 个百分点;但对于 70B 参数模型,差距缩小到 1–3 个百分点。一种解释是:大模型拥有更丰富的内部表示空间,只需对少数关键子空间进行 调整即可实现充分的领域适配,而 LoRA 的秩 r 恰好捕获了这些关键子空间。 •秩缩放:LoRA 的秩 r 与下游性能的关系并非单调递增,性能随秩增大而指数式收敛: Perf(r) ≈ Perfmax ⋅ (1 − e−λr ) 对于大多数任务,r = 8 ∼ 64 即可达到全量微调 95%+ 的性能,继续增大秩的边际收益极低。 •多任务干扰与协作:当在同一基座模型上训练多个 LoRA 时,不同 LoRA 之间的参数可能产生任务干扰(Task Interference),为任务 A 优化的低秩更新可能破坏模型对任务 B 的表现。但实证表明,由于 LoRA 的参数总量极小 (通常 < 1% 基座参数),这种干扰在实践中并不严重,甚至在合适的设计下能产生正面迁移。 3) 百万个性化模型 2026 年发表的 “On the Scaling of PEFT” 推动了 PEFT 研究的视角转变:从一种微调方法到一种模型分发架构。 场景定义:假设一个大型语言模型服务提供商,需要为 100 万用户每人维护一个个性化 adapter: •基座模型:一个 1T 参数的多模态 LLM(约 2TB 存储) •每个 adapter:以 LoRA 秩 r = 64 嵌入,约 100MB 参数 •总 adapter 参数量:100 万 × 100MB = 100TB •存储挑战:adapter 总存储量为基座模型的 50 倍 多 Adapter 内存分析: 在 GPU 显存中同时持有多个 adapter 是批量服务的关键瓶颈。假设基座模型占用 80GB 显存(1×H100),剩余存储 adapter 的预算约为 80GB(用于 KV Cache 和中间激活的部分更少)。在 100MB/adapter 下,单节点最多同时加载约 800 个 adapter。 对于百万级 adapter 的规模,需要设计多级 adapter 缓存架构: User request Scheduler: Is user's Adapt er on GPU? No Host Memory Layer CPU RAM: Hot Adapter cac he Miss Storage Layer (SSD: All Adapters) Yes Hit Swap out cold Adapter Load to host RAM Load to GPU GPU Layer Base model resident Hot Adapter Batch 图7-13 多级 Adapter 缓存与调度架构 如图7-13 所示,百万 adapter 的规模化依赖三个层次的优化: •存储层:SSD 持有全部 adapter,压缩格式存储(4-bit 量化后约 25MB/adapter) •主机内存层:缓存最近和预计将被访问的 adapter,利用用户行为的时间局部性 •GPU 层:仅保留当前 batch 的活跃 adapter,batch 内部 adapter 通过融合技术高效执行 4) 批量 PEFT 推理的融合方案 当单个 GPU batch 中包含属于不同 adapter 的请求时,adapter 的执行面临分歧问题:不同 adapter 有不同的 A 和 B 矩 阵,无法直接批量矩阵乘法。 三种主要融合策略: •序列化执行(Naive Sequential):按 adapter 分组依次执行,复杂度 O(B) 次前向传播,适合 adapter 种类远小于 batch size 的场景(如仅 3–5 个热门 adapter 覆盖了 90% 的请求)。 •批次拼接融合(Batch-Concatenation Fusion):将不同 adapter 的低秩矩阵沿对角线拼接为块对角矩阵,实现单次批 量矩阵乘法: Fused(W , {Ak , Bk }B k=1 ) = W + block_diag(B1 , … , BB ) ⋅ block_diag(A1 , … , AB ) 这要求所有 adapter 具有相同的秩 r,但可复用高效的 BLAS 实现。 •S-LoRA(Serving Concurrent LoRA Adapters, 2024):引入统一分页(Unified Paging)机制将 LoRA 权重与 KV Cache 一同纳入分页管理,避免 adapter 切换时的大块内存分配。其批量推理的核心是平铺矩阵乘法(Tiled Matrix Multiplication),将不同秩的 adapter 权重填充到统一 tile 尺寸,用定制 CUDA kernel 高效执行。 三种融合策略在批量推理场景下的性能对比如表7-10 所示。 融合策略 延迟 (B=32, r=64) 吞吐 (req/s) 实现复杂度 序列化 320ms 100 低 批次拼接 85ms 376 中 S-LoRA 52ms 615 高 表7-10 批量 PEFT 推理策略的性能对比 5) Adapter 之间的协作 除了推理时的融合,训练阶段也存在 adapter 之间的协作优化: •Adapter Fusion:将多个任务 adapter 的中间表示通过注意力机制融合,产生一个组合 adapter。这在多任务学习场 景中尤其有效,例如将在代码补全和代码审查两个 adapter 上融合,得到更全面的编程助手 adapter。 •Adapter 迁移:利用已训练 adapter 来初始化新任务的 adapter。给定源任务 S 的 adapter 参数 (A , B ),目标任务 T 的初始化可以设置为 A = A + ϵ , B = B + ϵ ,其中 ϵ , ϵ 为小噪声注入以防止过快的源任务坍塌。 S S (0) (0) S A S B A B •模型动物园(Model Zoo)的 PEFT 实现:用 PEFT 替代传统模型动物园中的完整模型副本,将存储成本从 O(K ⋅ N ) T T 降至 O(N + K ⋅ P ),其中 K 为任务/用户数,N 为基座参数量,P 为 adapter 参数量,P ≪ N 。这一降维对大规模部 署具有变革性的意义。 6) PEFT 规模化的挑战与开放问题 尽管前景广阔,PEFT 规模化仍面临几个开放挑战: •灾难性遗忘的累积:在连续适配数百个任务时,早先训练的 adapter 可能因基座模型隐式表示漂移而效能退化。定期 的 adapter 回归测试或睡眠重训(类似人的记忆巩固)可能是必要的。 •Adapter 安全的隔离:在百万用户各持有一个 adapter 的场景,需要保证 adapter A 不能通过模型输出读取或干扰 adapter B 的用户数据。这一安全属性的形式化与验证仍是开放问题。 •Scaling Law 的未知边界:当 adapter 数量从 100 增长到 10,000 再到 1,000,000 时,是否会出现相变式的性能退化, 目前尚无系统研究。理论上的信号处理视角(adapter 可视为互不干扰的子空间旋转)可能提供洞察,但实践验证仍欠 缺。
7.6.2 高级话题
- PEFT 与全量微调的融合 随着 PEFT 规模化逐渐走向成熟,一个自然的问题浮现:PEFT 与全量微调之间是否存在一个最优融合点? •混合微调(Hybrid Fine-tuning):冻结部分层进行全量微调,其余层使用 PEFT。例如在 70B 模型中冻结底层 60 层 (通用语言知识),全量微调顶层 20 层(任务特定知识),再在注意力矩阵上叠加 LoRA adapter。初始实验表明,这种 混合策略在 70B+ 规模的模型上,可以在保持 PEFT 效率的同时将性能差距缩小到接近零。 •PEFT 作为全量微调的初始化:先用 PEFT 快速探索超参数空间(因训练速度可快 3–5×),找到最优配置后,可将其作 为全量微调的初始化起点。由于 PEFT 和全量微调共享相同的基座模型,这种渐进式全量微调在某些任务上比直接全量 微调收敛得更快、最终性能也更好。 •Adapter 蒸馏(Adapter Distillation):将多个经过充分训练的 PEFT adapter 的知识蒸馏到一个全量微调的模型中。 在百万 adapter 的场景中,这代表了一种收敛路径,将分散的个性化适配知识聚合到一个能力更强的统一模型中。
- PEFT 的隐私与安全维度 PEFT 在隐私保护方面具有独特的架构优势,这在规模化的个性化场景中尤为关键。 •差分隐私 PEFT:因为 PEFT 只更新极少量的参数,将差分隐私(Differential Privacy)与 PEFT 结合会引入更少的噪 声,噪声的方差与参数量的平方根成正比。对于 LoRA 秩 r = 64 的 adapter(约 100MB),DP 引入的性能损失远小于 对全量参数(约 70GB)施加同等隐私预算的影响。 •联邦 PEFT:在联邦学习场景中,每个客户端(用户设备)持有私有的个性化数据,希望在本地训练 adapter 后仅上传 adapter 参数(而非原始数据)到中心服务器。PEFT 的小参数量使通信开销降低数百倍,使联邦学习的实际部署成为 可能。 •Adapter 的审计追溯:每个 adapter 可以带有数字签名和训练元数据(数据来源、训练时间、方法参数),形成完整的 审计追溯链。在企业合规场景中,这允许精确追踪“模型行为 X 是由哪个用户的 adapter 引入的”,这在全量微调中几 乎不可能做到。
- PEFT 缩放的前沿架构 前沿研究正在推动 PEFT 从压缩微调向结构化适配跨越: •MoRA(Mixture of Rank-Adapted Experts, 2025):借鉴 MoE 的思想,维护多个不同秩的 LoRA 专家,通过路由器 (router)根据输入 token 的特征动态选择激活哪些专家,使单个 adapter 可以处理任务内部的不同子场景(如代码 生成中的补全 vs 修复子场景),而无需训练多个独立的 adapter: E MoRA(h) = W0 h + ∑ gi (h) ⋅ Bi Ai h i=1
其中 g (h) 为路由器为输入 h 分配的专家 i 的权重,∑ g (h) = 1。
i i i
•SVF(Singular Value Fine-tuning, 2025):直接在基座模型权重矩阵的奇异值谱上进行微调,冻结奇异向量,仅训练
奇异值的缩放因子。这是 PEFT 参数效率的极限形式:每个权重矩阵仅引入 min(d, k) 个可训练参数(等于矩阵的秩),
在保持表达能力的同时将参数量缩至极小。
•Adapter 压缩的第二曲线:通过 MoRA、SVF 等方法,PEFT 参数量可以再缩减一个数量级,从基座模型的 0.1–1% 降
至 0.01–0.1%。对于百万 adapter 的部署场景,这意味着总存储从 100TB 降至 10TB,使得完全驻留在内存中的热
adapter 缓存更具可行性。上述架构演进的参数效率变化如图7-14 所示。
PEFT Architecture Evolve
MoRA 2025
LoRA 2021 QLoRA 2023 AdaLoRA 2023
SVF 2025 Singular values only 0.010.1% of base parame
ters
Rank r=164
0.1~1% of base parameter
s
图7-14 PEFT 架构的参数效率演进
4) 从 PEFT 到模型即服务
将 PEFT 规模化转化为可运营的模型即服务(Model-as-a-Service),需要一个完整的运维体系。以下是一个推荐的部署
层级:
- Adapter 注册中心(Adapter Registry):一个集中的元数据仓库,记录每个 adapter 的能力标签(适配的任务/领 域)、性能指标(在标准 benchmark 上的得分)、版本号、训练配置、所有者、数据来源摘要。注册中心是 adapter 发 现和调度的基础。
- Adapter 质量门禁(Adapter Quality Gate):每个新上传的 adapter 在进入生产状态前必须通过自动化的质量门禁: 功能正确性测试(生成指定格式的输出)、安全红线测试(不输出有害内容/不泄露训练数据)、性能回归测试(在标准 基准上不低于基线)。
- 智能路由(Intelligent Routing):接收用户请求后,根据请求特征(领域、难度、语言、用户身份)自动选择最匹配 的 adapter。路由策略可以是基于规则的(白名单+分类器),也可以是基于强化学习的(在线学习最优路由)。对于未 被任何 adapter 覆盖的请求,回退到基座模型或通用 adapter。
- 持续监控与退化检测(Continuous Monitoring):实时监控各 adapter 的推理延迟、生成质量分布、拒绝率等指标。 当检测到 adapter 性能退化(可能是基座模型升级导致的表示偏移,也可能是数据分布的变化),自动触发重训或告 警。 四层运维架构的请求处理流程如图7-15 所示。 User request Intelligent Router Match to suitable Adapter No match Load Adapter Fallback to base model Batch Inference Engine Continuous monitoring Anomaly detection Alert/auto-rollback
图7-15 Adapter 即服务的四层运维架构 PEFT 的规模化让模型适配变得轻量,但每次适配都在改变模型参数的子空间。当适配次数累积到数百乃至数千时,一个 根本性问题浮出水面:模型是否会忘记它最初学到的一切?这一担忧指向灾难性遗忘现象,它是模型从静态对齐走向持续 适应时必须跨越的门槛。
7.7 灾难性遗忘与记忆巩固
灾难性遗忘(Catastrophic Forgetting)是持续学习的根本障碍,记忆巩固则是缓解遗忘的核心机制。本节系统分析遗忘 的成因、度量方法及缓解策略,并介绍受生物神经科学启发的模型睡眠机制与自监督记忆训练框架。
7.7.1 遗忘的深层机制
遗忘不仅仅是参数被覆盖,其深层机制涉及三个层面:
- 表征漂移(Representation Drift) 新数据训练导致隐藏层激活统计量发生偏移。形式上,记原始模型第 l 层对于输入 x 的激活向量为 h (x; θ ),训练后变为 ∗ h (x; θ )。漂移程度由 Wasserstein 距离量化: l ′ l 1/p Wp (pl , ql ) = ( inf E(u,v)∼γ [∥u − v∥p ])
γ∈Γ(pl ,ql ) 当 W > ϵ 时,下游分类器/解码器以 h 为输入,其决策边界被破坏。 l 2) 梯度干扰(Gradient Interference) 在参数空间中,新任务梯度 ∇L 与旧任务梯度 ∇L 的冲突: new old cos(∇Lnew , ∇Lold ) < 0 意味着优化旧任务的参数方向与优化新任务相反。批量更新时,旧知识被梯度平均效应消解。 3) 冗余崩溃(Redundancy Collapse) 预训练模型的参数存在大量冗余(多个参数组合编码相同的知识)。新任务训练尚有冗余空间可用时干扰有限,一旦过度 优化耗尽冗余空间,遗忘便会急剧加速。遗忘加速的冗余崩溃过程如图7-16 所示。 New task training Parameter update mode Consume redundant space Use redundant space Critical point Minor interference: accept able drift Further training Redundancy collapse: kno wledge structure destructi Forgetting rate: 0-5% on Forgetting rate: 20-50% 图7-16 遗忘的冗余崩溃机制
7.7.2 遗忘的度量体系
定量衡量遗忘程度需要多维度指标,如表7-11 所示。 指标 定义 公式 后向迁移 (BWT) 新训练后旧任务精度下降 1 T −1 T −1 ∑i=1 (RT ,i − Ri,i ) 前向迁移 (FWT) 旧训练对新任务的帮助 1 T T −1 ∑i=2 (Ri−1,i − Riinit ) 知识保留率 (KR) 特定知识的正确率变化 Accaf ter Accbef ore 遗忘温度 (FT) 遗忘速度的倒数 FT = 1/ 遗忘率 表7-11 持续学习与遗忘的评估指标 对于 LLM 而言,标准的后向迁移度量存在局限:完整的旧任务精度阵列难以获取。实践中常用方案是定义锚点查询集, 一组精心采样的评测问题,在每次训练后测试其精度变化。
7.7.3 经典缓解方法
- 弹性权重巩固(EWC) EWC 通过 Fisher 信息矩阵识别重要参数,对新训练的更新施加约束: ∑ Fi (θi − θi∗ )2 λ L(θ) = Lnew (θ) + i 其中 F = E i ∂ 2 x∼Dold [( ∂θi log p(x∣θ)) ] 是参数 θ 对旧数据对数似然的敏感性。高 Fisher 信息的参数被冻结。 i
def ewc_loss(model, current_params, old_params, fisher_diag, lambda_ewc):
loss = task_loss(model)
for name, param in model.named_parameters():
_old = old_params[name]
_fisher = fisher_diag[name]
loss += (lambda_ewc / 2) * torch.sum(_fisher * (param - _old) ** 2)
return loss- 经验回放(Experience Replay) 从旧任务中采样数据与新任务数据混合训练。关键设计: •存储预算:保留旧样本的数量 •采样策略:随机 vs 重要性采样 vs 最大干扰采样 •回放比例:每个 batch 中旧样本占比 对于 LLM,经验回放面临数据存储和隐私的双重挑战。一种可行方案是使用合成回放——用模型自身生成旧任务的伪样 本。
- 知识蒸馏(LwF - Learning without Forgetting) 通过蒸馏损失使新模型的输出与旧模型一致: LLwF = KL(pold (y∣x)∥pnew (y∣x))
优势是不需要存储旧数据,劣势是新旧任务差异大时蒸馏效果下降。
7.7.4 LLM 特化方案
- LoRA 合并策略 对于 LLM 微调,LoRA(Low-Rank Adaptation)的低秩更新空间天然限制了遗忘范围,多任务合并架构如图7-17 所示。 Base Model Task B Adapter Task A Adapter A matrix A matrix Original weights W B matrix B matrix W + BA_A W + BA_B W + BA_A + BA_B
Task A inference Task B inference Multi-task inference 图7-17 LoRA 多任务合并架构 合并挑战:当两个 LoRA 的 BA 更新方向冲突时,直接加和可能导致两个任务都退化。解决方案包括: •正交投影:约束新 LoRA 的更新方向与已有 LoRA 正交 •加权合并:根据任务间相似度动态分配权重 •门控路由:为不同输入动态选择对应的 LoRA 组合 2) 分层更新策略 2026 年发表的研究从架构角度重新审视稳定性-可塑性权衡,核心发现: •不同层对遗忘的敏感度不同:深层(高层语义)对遗忘更敏感,浅层(低级特征)变化空间更大 •MLP 层比注意力层更易遗忘:知识更多存储在 FFN 权重中,注意力参数更侧重通用计算模式 •分类头是遗忘热点:LM Head 的参数更新对所有下游任务的 logit 分布影响最直接 基于这些发现的分层策略如表7-12 所示。 层类型 更新策略 学习率 正则化 Embeddings 全量更新 1.0x L2 轻约束 Attention(浅层) LoRA 更新 1.0x 无 Attention(深层) LoRA 更新 0.5x 蒸馏约束 FFN 选择性 LoRA 0.3x EWC 强约束 LM Head 冻结 0 完全冻结 表7-12 逐层参数更新策略
7.7.5 模型睡眠与记忆巩固
Google Research 于 2026 年提出的「Language Models Need Sleep」假说,将生物神经科学中的睡眠记忆巩固理论引 入 LLM 领域,为模型的持续学习开辟了全新视角。
- 生物启发的理论框架 在生物神经系统中,睡眠,尤其是慢波睡眠和快速眼动睡眠,在记忆巩固中发挥关键作用: •海马体-皮层对话:睡眠期间海马体回放白天的经历模式,驱动皮层形成长期记忆 •突触稳态假说:睡眠通过降低突触权重,为次日学习腾出空间 •系统巩固:记忆从海马体依赖逐渐转为皮层依赖,实现知识的长期稳定存储 将这一理论映射到 LLM,对应关系如表7-13 所示。 生物概念 LLM 对应 实现机制 海马体 上下文窗口/短期记忆 KV Cache 中的即时交互历史 皮层 模型参数 前馈网络中的知识编码 记忆回放 重要交互的重训练 基于重要性采样的梯度更新 突触稳态 参数正则化 权重衰减与重要性约束 记忆巩固 参数融合 从上下文记忆到参数记忆的转化 表7-13 生物记忆机制与 LLM 的对应
- 模型睡眠的循环架构 Google 提出的模型睡眠框架包含交替的清醒与睡眠阶段,循环架构如图7-18 所示。 Wake Stage Receive user interaction Execute reasoning/generat ion Record experience trajecto ry Compute experience impo rtance score Sleep Stage Read high-importance exp eriences Replay synthesis training Selective parameter updat e Memory consolidation an d integration Parameter regularization/c leanup 图7-18 模型睡眠的清醒与睡眠循环架构 清醒阶段:模型正常服务,记录用户交互经验(输入、输出、奖励信号)。每条经验被赋予一个重要性分数: s(e) = α ⋅ r(e) + β ⋅ surprise(e) + γ ⋅ diversity(e)
其中 r(e) 为奖励信号(如用户反馈),surprise(e) 衡量经验与模型预期的偏差,diversity(e) 衡量经验与已回放经验的差异 度。 睡眠阶段:模型离线,对高重要性经验进行回放训练。关键设计选择: •回放比例:参与每次睡眠的经验比例,实验表明 10%-20% 的顶层经验回放最为有效 •学习率调度:睡眠阶段使用远低于清醒微调的学习率,防止过拟合回放数据 •巩固温度:引入温度参数控制知识从易失到稳定的转化速度 3) 自修改机制 模型睡眠的核心创新在于自修改(Self-Modification),模型不仅通过梯度更新调整参数,还主动识别和修改参数空间中 需要更新的区域:
def self_modify(model, memory_buffer, importance_threshold):
# 1. Identify high-importance memories
high_priority = [m for m in memory_buffer
if m.importance > importance_threshold]
# 2. Compute gradient for each memory
for memory in high_priority:
output = model(memory.input)
loss = consolidation_loss(output, memory.target,
current_params=model.parameters(),
original_params=model.original_parameters())
grads = loss.backward()
# Selective apply: only update low-Fisher parameters
for name, param in model.named_parameters():
fisher = model.fisher_info[name]
mask = (fisher < importance_threshold)
param.grad *= mask
model.step()
# 3. Regularization cleanup
model.synaptic_homeostasis(decay_rate=0.01)选择性更新的关键:Fisher 信息矩阵度量了每个参数对已学知识的敏感度。高 Fisher 信息的参数承载重要知识,应予以 保护;低 Fisher 信息的参数是空白区域,可用于编码新知识。 4) 记忆巩固的损失函数 模型睡眠的核心训练目标是一个多任务损失函数: Lconsolidation = Lreplay + λ1 Lstability + λ2 Lregularization 其中: •回放损失:L = −E [log p (y ∣x )],最大化回放经验的似然 replay e∼M θ e e •稳定性损失:L = ∑ F (θ − θ ) ,以 Fisher 信息 F 加权约束参数偏离 ∗ 2 stability i i i •正则化损失:L = ∥θ∥ ,防止参数过度膨胀 i i regularization λ 和 λ 是平衡系数。典型设置为 λ = 0.1, λ = 0.001。 1 2 5) 实验效果与局限性 Google 在多个基准上的实验结果表明,模型睡眠的效果如表7-14 所示。 任务 无睡眠 标准回放 模型睡眠 提升 知识保留率 (30天) 67.3% 78.5% 91.2% +12.7% 新知识学习效率 1.0x 0.75x 0.92x +17% 推理精度稳定度 82.1% 85.3% 89.8% +4.5% 表7-14 模型睡眠机制的效果 核心发现: •模型睡眠显著提升了长期知识保留率,30 天保留率从 67.3% 提升至 91.2% •睡眠阶段的学习率敏感性高于清醒阶段,最优学习率约为清醒阶段的 1/10 •经验重要性分数中的 diversity 分量对防止死记硬背至关重要 当前局限: •需要额外的离线计算窗口,不适合 7×24 小时服务的系统 •重要性分数校准依赖足够的交互数据积累 •目前仅在中等规模模型(7B-70B)上验证,超大规模模型的自修改效果待确认
7.7.6 自监督记忆训练
MemTrain(2026)提出了一套自监督的上下文记忆训练框架,使 LLM 能够自主决定记住什么和何时回忆,无需人工标 注记忆标签。
- 记忆编码器架构 MemTrain 的核心是一个独立的记忆编码器(Memory Encoder),与主模型的注意力层协同工作,协同架构如图7-19 所 示。 Main Model Input Token Memory System Memory Encoder (Memory Store) Memory Retrieval Embedding Layer Self-Attention + memory r
ead Training Signal Compression reconstructi Contrastive Learning Loss Next Token Prediction Feed-Forward Network on loss 图7-19 记忆编码器与主模型协同架构 记忆编码器的设计区别于主模型: •采用更小的隐藏维度(通常为主模型的 1/4-1/8),增加压缩压力 •使用独立的位置编码,标记交互发生的时间远近 •输出为固定长度的记忆向量 m ∈ R ,d 通常为 256-512 t dm m 2) 记忆读写机制 写操作(Memory Write) 在每个交互步骤,记忆编码器将当前上下文压缩为记忆向量: mt = Encoderϕ (xt , ht−1 , mt−1 ) 其中 x 为当前输入,h 为主模型上一步的隐藏状态,m 为上一步的记忆。记忆编码通过一个 GRU 式的更新门实现 选择性保留: t t−1 t−1 ~ + (1 − z ) ⊙ m m t = zt ⊙ m t t t−1 zt = σ(Wz [xt ; ht−1 ; mt−1 ] + bz ) 更新门 z 决定了新信息覆盖旧信息的比例。 t 读操作(Memory Read) 在注意力计算时,从记忆存储中检索相关记忆并注入当前上下文:
def memory_injected_attention(Q, K, V, memory_store, current_query):
# 1. Retrieve relevant memories
relevance_scores = cosine_similarity(current_query, memory_store.keys)
top_k_indices = topk(relevance_scores, k=16)
retrieved_memories = memory_store.values[top_k_indices]
# 2. Use memories as additional Key-Value pairs
K_augmented = concat([K, retrieved_memories.K])
V_augmented = concat([V, retrieved_memories.V])
# 3. Extended attention computation
attention_output = softmax(Q @ K_augmented^T / sqrt(d)) @ V_augmented
return attention_output记忆检索使用余弦相似度,检索窗口通常为 16-64 条最近记忆。 3) 自监督训练目标 MemTrain 的训练不需要人工标注什么该记住。通过三个自监督目标联合优化。 •对比学习损失:判定记忆的相关性。 exp(sim(q, m+ )/τ ) Lcontrast = − log N ∑j=1 exp(sim(q, mj )/τ ) 其中 q 为当前查询表征,m 为正例记忆(相关记忆),τ 为温度参数。正例通过同一上下文后续步骤需要该记忆自动构 + 造。 •压缩重建损失:确保记忆保留关键信息。 Lrecon = ∥xt − Decoder(mt )∥2 记忆向量 m 通过一个小型解码器重建原始输入,迫使编码保留必要信息。 t •下一 Token 预测损失:记忆的实用性验证。 Lnpt = − log pθ (yt ∣x<t , m<t ) 记忆注入是否提升了下一 Token 的预测精度,这是训练信号的最终检验。 总损失:L = L + αL + βL total npt contrast recon 4) 上下文压缩原理 MemTrain 的记忆编码本质上是一种上下文压缩,将长序列压缩为固定长度的向量。与直接截断或摘要相比,各方法的对 比如表7-15 所示。 方法 压缩率 信息保真度 训练需求 推理开销 直接截断 可配置 低(丢失尾部) 无 无 摘要压缩 约 10:1 中(语义保留) 需要摘要模型 额外推理 检索增强 可变 中(依赖检索质量) 需要索引 检索延迟 MemTrain 约 50:1 高(梯度引导) 自监督训练 编码器前向 表7-15 上下文压缩方法对比 压缩的本质:记忆编码器通过梯度信号学习区分值得记住和可以遗忘的信息。对比训练中,被检索到的记忆获得正梯度, 不被检索的记忆被抑制,由此形成一个自组织的记忆选择机制。 5) 性能基准 MemTrain 在多会话交互和长上下文理解任务上的表现如表7-16 所示。 任务 基准方法 MemTrain 提升 多会话问答 (Multi-Session QA) 72.3% 85.6% +13.3% 长文档摘要 (LongDoc-10K) 28.4 (ROUGE-L) 32.1 (ROUGE-L) +13.0% 对话连贯性 (Persona-Chat) 3.82 (BLEU) 4.21 (BLEU) +10.2% 知识更新 (TempLAMA) 61.2% 79.8% +18.6% 表7-16 MemTrain 的效果提升 关键发现:MemTrain 在需要长期记忆保持的任务上优势最明显(知识更新任务提升 18.6%),而短期上下文理解任务上 提升有限,这说明独立记忆编码器主要解决了参数记忆的遗忘问题。 遗忘机制的深入理解揭示了一个重要事实:模型的知识分布在特定的网络层与参数子空间中,可以被精确定位与操作。这 一认识不仅指导了缓解遗忘的策略,更为主动移除特定知识(机器遗忘)提供了技术基础。
7.8 机器遗忘
机器遗忘(Machine Unlearning)指从已训练模型中选择性移除特定知识,同时保持其他知识的完整性。与持续学习中 的灾难性遗忘不同,遗忘是主动的、有目标的删除操作,且通常不可逆。本节系统阐述机器遗忘的定义、方法论与评估体 系。
7.8.1 定义与场景
机器遗忘的核心需求来自合规与安全场景,如表7-17 所示。 场景 示例 需求 版权合规 移除受版权保护的训练数据的影响 精确遗忘,不可逆 隐私保护 移除个人身份信息的记忆 差分隐私保证 有害内容 删除模型学到的危险知识 彻底抹除 事实纠错 更新过时或错误的知识 精准替换 表7-17 机器遗忘的应用场景 与持续学习的差异:遗忘是删除而非添加,且通常不可逆——被遗忘的知识不应被重新激活。这一特性使机器遗忘成为比 持续学习更具挑战性的问题。
7.8.2 激活补丁方法论
2026 年发表的「Measuring the Depth of LLM Unlearning via Activation Patching」提出了首个系统化的遗忘深度测量 方法论,为机器遗忘提供了量化工具。其核心思想是通过在不同层替换激活值(Activation Patching),定位知识存储的 深度。
- 实验流程 实验流程如图7-20 所示。 Original model Select target knowledge K to forget Execute unlearning on K Generate post-unlearning model Layer-by-layer patch testin
g Patch Operation Restore original activation at layer L Take original model layer Test reactivation level of K L output Replace unlearned model l Layer L depth vs reactivati ayer L output on rate Continue unlearned mode l inference 图7-20 激活补丁定位知识存储深度 2) 补丁操作 设原始模型为 M ,遗忘后模型为 M orig 。在层 l 处执行补丁: unlearned = h (x) (使用原始激活替换遗忘模型的激活) (patched) orig h l l 然后继续用 M unlearned 完成后续推理。如果补丁后知识 K 被重新激活,说明层 l 是关键的记忆存储位置。 3) 遗忘深度的形式定义 Punlearned (K∣x) δ(l) = Ppatched (K∣x, l) 其中 P (K∣x) 为模型对目标知识 K 的输出概率。δ(l) ≈ 1 表示补丁无效:层 l 不存储该知识。δ(l) ≪ 1 表示补丁有效:层 l 是关键存储层,原始知识从这里被恢复。
7.8.3 深度测量的核心发现
研究在 MUSE(Memory Understanding and Safety Evaluation)和 TOFU(Task of Fictitious Unlearning)两个基准 上,对多个模型进行了逐层分析,结果如表7-18 所示。
- 深度分布曲线 模型 浅层(1-8) δ 中层(9-16) δ 深层(17-24) δ 最深(25+) δ Llama-2-7B (32层) 0.92 0.45 0.18 0.87 Llama-3-8B (32层) 0.88 0.52 0.22 0.91 Qwen-2.5-7B (28层) 0.94 0.61 0.31 0.89 表7-18 各层参数变化幅度的分布 δ 越接近 0,补丁恢复效果越强,说明该层是知识存储的关键位置。
- 核心发现 深度测量揭示了三个核心发现。 •U 型深度曲线:知识存储呈现中深层集中、浅层和最深层次之的 U 型分布。中间层的补丁恢复效果最强(δ 最小)。 •FFN 层是主要存储点:在 FFN 层的输出处执行补丁,恢复率远高于在注意力输出处执行补丁,验证了知识主要存储在 FFN 权重中的论断。 •遗忘的层次差异:梯度类遗忘方法(Gradient Ascent, SCRUB)更倾向在浅-中层消除知识;蒸馏类方法(KL Minimization)更倾向在深-最深层消除知识。 Distillation-based Unlearning Gradient-based Unlearning
Shallow retention: modera Shallow retention: poor te KL Minimization Deep-deepest layer knowl Gradient Ascent Shallow-middle layer kno edge elimination wledge elimination Deep retention: good Deep retention: moderate 图7-21 梯度类与蒸馏类遗忘方法对比 两类方法消除知识的层次差异对比如图7-21 所示。
7.8.4 遗忘质量评估
除深度测量外,研究还定义了三项遗忘质量指标:
- 知识移除率(KRR) Accbef ore − Accaf ter KRR =
Accbef ore − Accrandom 完美遗忘的 KRR=1(退化为随机)。KRR 量化了遗忘的相对彻底程度。 2) 相邻知识保持率(AKR) Accneighbor,af ter AKR = Accneighbor,bef ore 衡量遗忘操作的手术精度,即是否只移除了目标知识而保留了相关知识。高 AKR 表示精准遗忘,低 AKR 表示误伤。 3) 不可恢复性(IR) 1 Ppatched (K∣x, l) IR = 1 − max ( ) = 1 − max ( ) Punlearned (K∣x) l δ(l) l IR 衡量被遗忘的知识在任何层执行补丁后的最大恢复程度。IR=1 表示知识完全不可恢复;IR=0 表示知识可通过某层的补 丁完全恢复。
7.8.5 主流遗忘方法对比
主流遗忘方法在遗忘质量三项指标上的表现如表7-19 所示。 方法 KRR AKR IR 训练成本 Gradient Ascent 0.95 0.72 0.68 1x epoch KL Minimization 0.82 0.88 0.51 1x epoch SCRUB (hybrid) 0.91 0.85 0.74 2x epoch Activation Patching-Guided 0.93 0.91 0.82 1.5x epoch 表7-19 主流遗忘方法对比 激活补丁引导的遗忘(2026 年提出)是综合最优方案:
- 先用补丁测量定位目标知识的关键层
- 仅对关键层的 FFN 输出执行梯度修正
- 对其他层施加蒸馏约束,保持知识完整性 这一策略将 AKR 从 0.72(Gradient Ascent)提升至 0.91,同时保持了高 KRR(0.93)和高 IR(0.82),体现了精准手术 的遗忘效果。
7.8.6 与持续学习的协同
机器遗忘与灾难性遗忘看似矛盾,一个要删除知识,一个要保持知识,但在实际系统中二者需要协同工作。 •选择性遗忘后的知识保护:执行机器遗忘后,模型仍需持续学习新任务。此时 EWC(Elastic Weight Consolidation)、经验回放等方法可用于保护未遗忘的知识不被新一轮训练覆盖。 •遗忘与记忆的层次分离:深度测量研究表明,知识存储呈 U 型分布。这一发现指导系统设计:将需要永久保留的核心 知识存储在浅层和深层(这些层对遗忘操作不敏感),将需要灵活更新的知识存储在中层(这些层易于精确修改)。 •差分隐私与机器遗忘的互补:差分隐私提供统计层面的隐私保证,但会引入噪声降低模型性能。机器遗忘提供精确的知 识删除,但计算成本较高。两者结合,先用差分隐私限制信息泄漏,再用机器遗忘精确移除敏感数据,是当前隐私保护 的最优实践。