第 11 章 AI 算法Transformer大模型

第 11 章 强化学习

第11章 强化学习

本章覆盖强化学习(Reinforcement Learning, RL)的核心算法原理,为语言模型的后训练优化提供统一的理论框架,数 学基础为各类算法的推导提供起点。

11.1 强化学习数学基础

强化学习研究智能体与环境交互、通过试错学习最优行为的一般问题。语言模型的生成过程可以抽象为一个马尔可夫决策 过程(Markov Decision Process, MDP),本节先给出其形式化定义,再推导回报与贝尔曼方程,最后讨论策略与最优性 的关系。

11.1.1 马尔可夫决策过程

马尔可夫决策过程是强化学习的标准数学模型,用五元组 (S, A, P, R, γ) 描述: •S 为状态集合(State Space),元素记作 s; •A 为动作集合(Action Space),元素记作 a; •P 为状态转移概率(Transition Probability)P(s ∣ s, a),表示在状态 s 执行动作 a 后转移到状态 s 的概率; ′ ′ •R 为奖励函数(Reward Function)R(s, a),表示在状态 s 执行动作 a 后获得的即时奖励; •γ ∈ [0, 1] 为折扣因子(Discount Factor)。 MDP 假定奖励函数与转移概率只依赖当前状态和动作,这一形式化覆盖了绝大多数序贯决策问题。根据是否终止,任务 分为回合制(Episodic)与持续式(Continuing)两类:回合制任务在到达终止状态后结束,持续式任务无限进行。回 合制任务常把终止状态视为吸收态,其后的奖励恒为 0,语言模型生成正是典型的回合制任务。 MDP 的核心假设是马尔可夫性(Markov Property):下一状态只取决于当前状态与动作,与更早的历史无关: Pr(st+1 ∣ st , at , st−1 , at−1 , …) = Pr(st+1 ∣ st , at ) 马尔可夫性并非限制表达力,而是把全部历史压缩进状态这一单一变量,使决策只依赖当前状态。状态包含的信息越完 整,该假设越接近成立。 智能体在每一时刻依据策略选择动作,环境返回下一状态与即时奖励,如此往复形成轨迹 s , a , r , s , a , r , …。回报 0 0 1 1 1 2 (Return)G 是从时刻 t 开始的折扣累积奖励: t ∞ Gt = rt+1 + γrt+2 + γ 2 rt+3 + ⋯ = ∑ γ k rt+k+1 k=0 对语言模型而言,生成过程与 MDP 存在自然对应:状态是当前已生成的 token 序列,动作是下一个 token,转移是确定 性的自回归拼接,奖励来自偏好信号或规则判定。状态直接取序列本身而非其向量表示,因为自回归是一个确定性的拼接 过程,序列即完整的历史信息,恰好满足马尔可夫性。由于词表有限,状态与动作集合都是离散有限的;生成输出结束符 后过程终止,不再发生转移。对应关系如图11-1 所示。 Agent: policy network Environment action: next token Transition: s' = s + a Policy π_θ(a|s) Reward r(s, a) next token preference signal state s' + reward r 图11-1 MDP 与语言模型生成的对应 这一对应关系有几个直接后果。其一,初始状态是提示词(Prompt),整段生成构成一个回合(Episode),终止于输出 结束符;其二,奖励只在整个序列完成后才被判定,属于稀疏奖励,必须依靠折扣累积把终点信号沿轨迹传回起点;其 三,策略本身被建模为可微的参数化分布 π (a ∣ s),参数即模型权重,这为后续用梯度方法直接优化期望回报铺平了道 路。 θ 奖励信号的来源决定其性质。规则奖励直接由结果判定,如数学答案是否正确,客观但稀疏;偏好奖励由人工或模型对候 选序列排序得到,反映人类偏好,稠密却含噪声。后训练算法对两类信号的处理方式不同,前者常配规则验证器,后者需 要单独训练奖励模型。

11.1.2 回报与贝尔曼方程

折扣因子 γ 决定回报对未来奖励的重视程度。γ 接近 0 时回报偏向近期奖励,智能体目光短浅;γ 接近 1 时远期奖励被充 分保留,智能体愿意为长远目标承受短期代价。对无限时域的问题,γ < 1 还保证折扣和收敛,使回报总有界。对语言模 型而言,即时奖励稀疏,只有完整序列才能被判定,因此 γ 往往取接近 1 的值,让模型关注整条轨迹的累积质量。 折扣因子的选取还涉及方差权衡。γ 越接近 1,回报累积的未来越长,估计方差越大,训练越不稳定;γ 过小又会让模型 忽略远期的结构性奖励。实际中常取 0.9 至 1.0 之间的值,对单回合的生成任务也常直接取 1,在回合结束时一次性结算 整段奖励。 状态值函数(State Value Function)V (s) 是从状态 s 出发、按照策略 π 行动所能获得的期望回报: π V π (s) = Eπ [Gt ∣ st = s] 动作值函数(Action Value Function)Q (s, a) 是在状态 s 执行动作 a 后、再按策略 π 行动的期望回报: π Qπ (s, a) = Eπ [Gt ∣ st = s, at = a] 两个值函数都回答同一类问题——「按当前策略走下去能拿到多少累积奖励」,区别在于是否把动作固定下来。V 对状态 π 排序,Q 额外对动作排序,后者的价值在于决策时无需再依策略展开,直接比较各动作的 Q 值即可。 π 回报满足递归关系 G = r + γG ,代入定义并把期望按当前动作与下一状态展开,即可把「整条轨迹的期望回报」分 解为「一步即时奖励加下一状态值」,得到贝尔曼期望方程(Bellman Expectation Equation): t t+1 t+1 V π (s) = ∑ π(a ∣ s) ∑ P(s′ ∣ s, a) [R(s, a) + γV π (s′ )] a s′ Qπ (s, a) = R(s, a) + γ ∑ P(s′ ∣ s, a) ∑ π(a′ ∣ s′ )Qπ (s′ , a′ ) s′ a′ 两个方程互为递归定义:V 是 Q 依策略取平均,Q 的下一步又回到 V ,二者构成互相咬合的方程组。策略固定时, π π π π 每个状态一个未知数,方程组是线性的,且解唯一,这一性质称为策略求值(Policy Evaluation)。值函数之间的关系如 图11-2 所示。 average over policy Q_π(s, a) Bellman backup V_π(s) action value V_π(s') state value next state value 图11-2 状态值与动作值的关系 如果把「依策略随机选动作」替换为「取使期望最大的动作」,递归关系就收紧为贝尔曼最优方程(Bellman Optimality Equation): V ∗ (s) = max ∑ P(s′ ∣ s, a) [R(s, a) + γV ∗ (s′ )] a s′ Q∗ (s, a) = R(s, a) + γ ∑ P(s′ ∣ s, a) max ′ Q∗ (s′ , a′ ) a s′ 其中 V 、Q 为最优值函数。最优方程因含 max 运算而非线性,无法像期望方程那样直接求闭式解,需要迭代求解。期 ∗ ∗ 望方程对固定策略给出线性方程组,可求唯一解,这构成策略求值的核心;最优方程则通常用值迭代(Value Iteration) 或策略迭代(Policy Iteration)逼近,每一步迭代都利用贝尔曼备份把一步奖励传播到所有可达状态。贝尔曼方程把对无 限轨迹的求值化为对单个状态的递归计算,是动态规划、时间差分学习与所有基于值的强化学习算法的理论根基。

11.1.3 策略、值函数与最优性

策略(Policy)是从状态到动作选择的映射,决定智能体在每个状态的行为。确定性策略(Deterministic Policy)记作 a = π(s),每个状态只对应一个动作;随机性策略(Stochastic Policy)记作 π(a ∣ s),在每个状态给出动作的概率分布。 对有限 MDP,至少存在一个确定性最优策略,且最优值函数 V 必然可达。确定性策略便于实现与评估,但缺乏探索能 ∗ 力:若初始时刻的概率估计有偏,确定性选择会固化错误动作。随机性策略则天然携带探索与利用(Exploration- Exploitation)的权衡,通过概率分配在「试新动作」与「利用已知最优」之间取得平衡。探索与利用的张力是强化学习 的核心难题:纯利用只取当前估计最优的动作,可能因估计误差错过真正最优;纯探索在状态空间漫游,无法积累有效收 益。随机性策略以概率形式把两者统一,高概率选当前最优,保留一定概率尝试其他动作。对语言模型,温度参数直接控 制这一权衡,温度越高分布越平,探索性越强。因此语言模型的策略始终是随机性策略,且直接建模为可微分布 π (a ∣ s) ,这是策略梯度方法能起作用的前提。 θ 值函数与 Q 函数通过策略相连接: V π (s) = ∑ π(a ∣ s)Qπ (s, a) a Vπ给出状态层面的评估,Q 额外把动作纳入条件,能回答「在这个状态应该选哪个动作」。最优策略 π (Optimal Policy)π 在所有状态上取到最优值 V (s) = max V (s),与之对应的 Q 函数满足 Q (s, a) = R(s, a) + ∗ ∗ π ∗ γE [V (s )],对 Q 逐状态取贪心即可恢复 π 。最优值函数唯一,最优策略却不唯一,Q 值并列时取任意最优动作都可 π ∗ ′ ∗ ∗ s′ 行。对语言模型,最优策略通常在 KL 约束下退化为平滑的概率分布,而非把概率集中到单一动作的贪心选择。事实上, 若令策略取对 Q 的贪心(Greedy)动作,所得新策略至少不比原策略差,重复该策略改进(Policy Improvement)步 π 骤可单调逼近最优策略,这一性质正是策略迭代与 Q 学习收敛的保证。 最优性成立的深层依据是贝尔曼最优性原理(Bellman Optimality Principle):一个最优策略的任一段子轨迹,对由该段 首状态出发的后续过程仍构成最优策略。全局最优要求每一步都对「未来最优」做局部选择,这正是值函数能够递归分 解、动态规划能够求解 MDP 的根本原因。它说明强化学习问题具备最优子结构:最优值函数不需要枚举全部策略,只要 逐状态比较「当前奖励加最优未来」即可确定。 本节建立的 MDP 框架是各类后训练算法的共同底座。偏好优化类方法从偏好数据中估计与 Q 函数同构的奖励信号,策略 优化类方法在估计奖励后沿策略梯度方向更新策略,并用 KL 散度约束抑制策略漂移。策略梯度方法直接对 π 求梯度,天 然支持随机策略,无需先求 Q 再取贪心,因而成为语言模型后训练的主流选择。理解值函数、贝尔曼方程与最优性原 θ 理,是把握 RLHF 与 GRPO 设计取舍的前提。

11.2 策略梯度与 Actor-Critic

本节介绍基于梯度的策略优化方法,覆盖策略梯度定理的推导、REINFORCE 的蒙特卡洛估计与基线削减、Actor-Critic 框架、PPO 的信赖域目标及其在 RLHF 中的对应形式,以及面向连续动作空间的 DDPG 与 SAC。不覆盖进化策略等无梯 度方法,也不覆盖离线强化学习。

11.2.1 策略梯度定理

策略梯度(Policy Gradient)方法把强化学习视为参数化分布上的优化问题。设策略 π (a ∣ s) 由参数 θ 刻画,目标函数定 义为初始状态上的期望折扣回报: θ T J(θ) = Eτ ∼πθ [∑ γ t rt ] t=0 其中 τ = (s , a , r , s , … ) 为轨迹,γ 为折扣因子。直觉上,若某动作在统计意义上带来更高的回报,就该提高它被选中 0 0 0 1 的概率,梯度正是这一调整方向的定量刻画。 对目标函数求参数梯度,需要穿过对随机轨迹的期望。利用对数导数技巧(log-derivative trick)∇ P (τ ) = P (τ ) ∇ log P (τ ),可把梯度改写为期望形式: θ θ θ θ θ ∇θ J(θ) = Eτ ∼πθ [∇θ log Pθ (τ ) R(τ )] 其中 R(τ ) = ∑ γ r 。轨迹概率分解为 P (τ ) = p(s ) ∏ π (a ∣ s ) p(s ∣ s , a ),取对数后仅策略项依赖参数,环境动态 t 项的梯度为零,于是得到策略梯度定理(Policy Gradient Theorem)的采样形式: t t θ t θ t t t+1 t t ∇θ J (θ) = Eτ [∑ ∇θ log πθ (at ∣ st ) R(τ )] T t=0 该形式有两个关键性质。其一,推导不依赖环境动态模型,只需对轨迹采样即可无偏估计梯度,适用于转移未知或黑盒环 境。其二,由因果性,t 时刻的动作只影响其后的奖励,全轨迹回报可替换为从该时刻起的折扣回报,其条件期望正是动 作值函数 Q (s , a ),由此得到定理的通用形式: π t t ∇θ J (θ) = Es∼dπ , a∼πθ [∇θ log πθ (a ∣ s) Qπ (s, a)] 其中 d 为策略诱导的状态分布。与基于值函数的方法相比,策略梯度直接优化目标而非经由动作值隐式改策,天然适合 π 大规模参数化策略,也能收敛到随机最优策略——语言生成中的逐 token 采样正是此类策略。代价是梯度估计依赖采样, 方差成为贯穿本节的主题:整个演进过程的主线,就是如何用低方差且偏差可控的估计量替代 Q (s, a)。 π

11.2.2 REINFORCE 与方差削减

REINFORCE(Williams, 1992)把期望替换为单条轨迹的蒙特卡洛(Monte Carlo)估计:按当前策略采样整条轨迹,对 每一步用回报与对数概率梯度之积更新参数: T T θ ← θ + α ∑ ∇θ log πθ (at ∣ st ) Gt , Gt = ∑ γ t −t rt′ ′ t=0 t′ =t 其中 G 为从 t 时刻起的折扣回报,α 为学习率。单条轨迹的采样即可得到梯度的无偏估计,实现如下: t

REINFORCE with a state-value baseline (single episode)

def reinforce(env, policy, value, gamma): states, actions, rewards = [], [], [] state, done = env.reset(), False

     while not done:
         action = policy.sample(state)
         states.append(state)
         actions.append(action)

state, reward, done = env.step(action)

         rewards.append(reward)
     returns = discounted_returns(rewards, gamma)   # G_t = sum_k gamma^k * r_{t+k}
     policy_loss = 0.0
     for state, action, ret in zip(states, actions, returns):
         baseline = value.predict(state)            # baseline b(s) = V(s)
         policy_loss -= policy.log_prob(action, state) * (ret - baseline)
     return policy_loss

REINFORCE 无偏但方差大:单次回报同时受动作采样与环境转移两类随机性影响,方差随轨迹长度增长,收敛缓慢。削 减方差的自然手段是引入基线(baseline)。利用期望恒等式 E [∇ log π (a ∣ s)] = 0,从回报中减去与动作无关的量 b(s) 不改变梯度期望,却能吸收回报中与该动作无关的噪声: a θ θ ∇θ J (θ) = E [∑ ∇θ log πθ (at ∣ st )(Gt − b(st ))] T t=0 常见的基线选择: •零基线:不削减方差,对应原始 REINFORCE; •回报滑动平均:用历史回报均值近似最优常数基线,实现简单,削减有限; •值函数基线:b(s ) = V (s ),即状态 s 下的期望回报,是状态依赖基线中的理论最优。 t π t t 从方差削减的角度可明确选择原则。设 g = ∇ log π (a ∣ s ),最优常数基线为 t θ θ t t E [∥gt ∥2 Gt ] b∗ = E [∥gt ∥2 ] 常数基线只能吸收全局噪声,而状态依赖的 V (s ) 能进一步吸收随状态变化的回报差异,方差更低。代价是值函数本身 π 需估计,估计误差会以偏差形式进入梯度,因此基线并非越大越好。 t 值函数基线还提供了回报的分解视角:G − V (s ) 度量该条轨迹的实际回报高出此状态期望回报的部分。把基线替换为随 策略演化的可学习值函数,就得到 Actor-Critic 结构。 t t

11.2.3 Actor-Critic 框架

Actor-Critic 将策略与值函数拆为两个组件:Actor 是策略网络 π ,负责决策;Critic 是值函数网络 V (s) 或 Q (s, a),负 责评估动作优劣。Critic 承担两个角色:作为低方差基线,以及作为回报的引导(bootstrap)来源,用一步估计替代整 θ ϕ ϕ 条轨迹的蒙特卡洛回报。 当基线取为状态值函数时,回报与基线之差即优势函数(Advantage Function): Aπ (s, a) = Qπ (s, a) − V π (s) 优势度量当前状态下选择动作 a 相对平均水平高出多少,是方差最低且信息完整的策略梯度信号。将其代入策略梯度定理 的通用形式,得到 Actor-Critic 的更新方向: ∇θ J (θ) = Es∼dπ , a∼πθ [∇θ log πθ (a ∣ s) Aπ (s, a)] Critic 用一步时序差分(Temporal Difference, TD)估计优势,避免蒙特卡洛长轨迹的高方差。定义 TD 误差(TD Error): δt = rt + γVϕ (st+1 ) − Vϕ (st ) 期望层面 E[δ ∣ s , a ] = Q(s , a ) − V (s ),即优势的无偏估计,且只需相邻两步交互即可计算。Critic 以 TD 目标 r + γV (s ) 回归更新,Actor 沿 ∇ log π (a ∣ s ) δ 方向更新。 t t t t t ϕ t t ϕ t+1 θ θ t t t 如图11-3 所示,Actor 与 Critic 共享同一批环境交互数据:Critic 输出值函数并计算 TD 误差,Actor 依据优势信号调整动 作概率,两个网络交替更新。 Environment s_t, r_t Critic value V_phi bootstrap r + gamma V(s') TD error delta_t Advantage A(s_t, a_t) policy gradient Actor policy pi_theta action a_t 图11-3 Actor-Critic 框架结构 单步 TD 误差方差低但偏差大,蒙特卡洛回报无偏但方差大。GAE(Generalized Advantage Estimation, Schulman et al. 2016)以折扣加权把两者统一: ∞ = ∑(γλ)l δt+l GAE(γ,λ) A^t l=0 λ=0 退化为单步优势,方差小偏差大;λ = 1 等价于蒙特卡洛回报,无偏但方差大。调节 λ 在偏差与方差之间连续折 中,是 PPO 在语言模型场景下的标准配置。 在策略与值函数交替更新的循环中,Critic 的准确度直接影响优势估计质量:值函数过拟合会把系统性偏差引入 Actor 梯 度,欠拟合则方差回升。实践中值函数与策略常共享底层特征提取,以更小的学习率单独更新 Critic,这一节奏在语言模 型的 PPO 实现中同样沿用,并与 KL 正则共同约束训练动态。

11.2.4 PPO 与信赖域方法

朴素策略梯度对步长极敏感:步长过大,策略分布单次更新后可能崩坏且难以恢复;步长过小则收敛缓慢。根因在于参数 空间的欧氏距离与策略分布变化之间没有单调关系。信赖域方法(Trust Region Method)直接约束每次更新前后策略分 布的差异,信赖域策略优化(Trust Region Policy Optimization, TRPO)以 KL 散度作为约束条件,但需要近似求解带约 束优化,工程实现复杂。 PPO(Proximal Policy Optimization, Schulman et al. 2017)以两种近似实现信赖域约束:

  1. 裁剪替代目标(Clipped Surrogate Objective):定义概率比 r (θ) = π (a ∣ s )/π (a ∣ s ),目标为 t θ t t θold t t LCLIP (θ) = Et [min (rt (θ) A^t , clip (rt (θ), 1 − ϵ, 1 + ϵ) A^t )] 当优势 A^ > 0 时,若概率比超过 1 + ϵ,min 取到裁剪后的常数,梯度为零,禁止过度提高动作概率;当 A^ < 0 时,概率 比低于 1 − ϵ 的部分被截断,防止过度压低。裁剪使目标函数本身成为约束,无需二阶求解。 t t
  2. KL 惩罚形式:把约束改写为目标中的软惩罚项 LKL (θ) = Et [rt (θ) A^t − β DKL (πθold ∥πθ )] 系数 β 控制偏离旧策略的成本,可依据实测 KL 值自适应调节。裁剪是硬边界,KL 惩罚是软约束,两者回答同一问题: 如何在不破坏已有行为的前提下提升回报。在 RLHF 等对齐实践中,裁剪形式因实现简单而成为默认选择。 RLHF(Reinforcement Learning from Human Feedback)中的 PPO 是上述框架在语言模型上的实例化。语言模型即策 略 π ,其决策是自回归 token 级:给定上下文 x 与已生成前缀 y ,每一步输出下一个 token y ,整条回复构成一条轨 <t 迹。组件对应关系: θ t •奖励信号:奖励模型(Reward Model, RM)或规则判分器对整条序列给出标量得分,是稀疏的序列级信号; •优势估计:GAE 将序列级奖励按 TD 误差回溯分配到每个 token,使 token 级策略梯度获得稠密信号; •概率比:以参考模型 π 为分母,r (θ) = π (y ∣ x, y )/π (y ∣ x, y ),更新前的旧策略即参考模型; ref t θ t <t

ref t <t •KL 正则:目标中额外加入 −β D (π ∥π ) 项,防止策略过度优化奖励而偏离参考模型的表达习惯,控制对齐税 KL ref (Alignment Tax)。 θ 如图11-4 所示,语言模型 PPO 的回传路径把序列级奖励逐步分解为逐 token 优势,并与 KL 惩罚合并构成最终更新目 标。 Prompt x Policy pi_theta autoregressive token decis ions Response y_1 ... y_T Reward model Reference model pi_ref sequence-level score Per-token advantage KL penalty GAE and critic -beta times KL(pi, pi_ref) Clipped surrogate loss 图11-4 语言模型 PPO 的回传路径 综合目标写作 LRLHF (θ) = Ex, y [ T ∑ min (rt (θ) A^t , clip (rt (θ), 1 − ϵ, 1 + ϵ) A^t )] − β Ex [DKL (πθ (⋅ ∣ x) ∥ πref (⋅ ∣ x))] T t=1 其中 A^ 由 Critic 与 GAE 计算。该形式把提高奖励与不偏离参考模型两个目标整合进单一损失,是主流对齐管线 (InstructGPT、Llama 等)的核心更新规则。关于序列长度,实践上常对累计奖励做长度归一化,避免长回复因累计更 t 多 token 而获得系统性优势;KL 惩罚则在每个 token 上计算并累加,与奖励项处于同一量纲。PPO 在语言模型上以数千 条提示构成一个优化批,配合 token 级值函数与 GAE,构成 RLHF 三阶段流程(SFT、奖励建模、PPO 优化)的最终环 节。

11.2.5 DDPG 与 SAC 连续控制

连续动作空间中动作是实值向量,离散 softmax 策略失效,且动作方向本身携带梯度信息。DDPG(Deep Deterministic Policy Gradient, Lillicrap et al. 2016)与 SAC(Soft Actor-Critic, Haarnoja et al. 2018)是面向连续控制的代表方法。 DDPG 基于确定性策略梯度(Deterministic Policy Gradient, DPG):策略输出确定性动作 μ (s),梯度沿值函数对动作的 导数方向上升: θ ∇θ J (θ) = Es∼D [∇a Qμ (s, a) a=μ (s) ∇θ μθ (s)] θ 其中 D 为经验回放(Experience Replay)缓冲池。确定性策略免去对动作空间的积分,回放缓冲解耦数据生成与参数更 新,支持离策略(off-policy)利用历史样本。训练稳定性依赖两个机制:目标网络(Target Network)以软更新 θ ← ′ τ θ + (1 − τ )θ 缓慢跟随在线网络,缓解目标非平稳与样本相关性;探索依赖向动作注入噪声,因为确定性策略本身不产 ′ 生随机性。 SAC 在最大熵框架(Maximum Entropy Framework)下训练随机策略,目标在期望回报之外同时最大化熵 (Entropy): J(θ) = ∑ E [r(st , at ) + α H (π(⋅ ∣ st ))] t 熵项鼓励策略保持行为多样性,避免过早坍缩到单一动作,改善探索效率与对多模态最优的适应。软值迭代(Soft Value Iteration)把熵项并入贝尔曼方程: Q(s, a) = r(s, a) + γ Es′ [V (s′ )] , V (s) = Ea∼π [Q(s, a) − α log π(a ∣ s)] 策略沿软值方向迭代直至收敛。工程实现中 SAC 用两个 Q 网络取较小值抑制过估计,配合经验回放与目标网络,样本效 率在连续控制基准上通常优于 DDPG;温度系数 α 平衡回报与熵,可随训练自动调节。α 的自动调节把熵当作带目标熵约 束的可学习参数求解,避免为每个任务手工调参;相比之下 DDPG 的探索噪声幅度需按任务手动设定。 DDPG 结构简单、确定性输出便于部署;SAC 以熵正则换取探索鲁棒性,是连续控制基准的默认选择。两者构成面向连续 动作空间的两条路线:确定性策略加值函数方向梯度,与随机策略加熵正则的软目标。

11.3 离策略与离线强化学习

本节覆盖强化学习从在线离策略学习到离线学习的演进脉络:先以 Q 学习与 DQN 建立离策略更新的数学基础,再分析经 验回放与目标网络两大稳定机制,随后讨论离线强化学习面对的数据分布问题,最后对比行为克隆与强化学习的差异。假 设读者已了解马尔可夫决策过程与折扣回报的基本概念。

11.3.1 Q 学习与 DQN

Q 学习(Q-Learning)是最经典的离策略(off-policy)算法。它估计状态动作值函数 Q(s, a),即从状态 s 采取动作 a 之 后按策略 π 继续执行所能获得的期望折扣累积回报: ∞ Qπ (s, a) = Eπ [∑ γ t rt s0 = s, a0 = a] t=0 其中 γ ∈ [0, 1) 为折扣因子(discount factor),决定远期回报的相对权重。最优动作值函数 Q (s, a) = max Q (s, a) 满足 ∗ π 贝尔曼最优方程(Bellman optimality equation): π Q∗ (s, a) = r(s, a) + γ Es′ ∼P (⋅∣s,a) [max ′ Q∗ (s′ , a′ )] a

  1. 贝尔曼最优算子与 max 算子 将上式右侧视为对 Q 的算子作用,定义贝尔曼最优算子(Bellman optimality operator) T : ∗ (T ∗ Q)(s, a) = r(s, a) + γ Es′ [max ′ Q(s′ , a′ )] a T∗ 在无穷范数意义下是压缩映射(contractive mapping),迭代 Q ← T Q 从任意初值收敛到唯一不动点 Q ,这是 Q 学 ∗ ∗ 习收敛性的理论依据。 算子中的 max 是离策略性质的来源:更新目标取所有后继动作中的最优者 arg max Q(s , a ),与产生数据的策略无关。 a′ ′ ′ 行为策略(behavior policy)可以是任意探索性策略,如 ϵ-greedy;目标策略(target policy)由 max 算子隐式定义为 贪心策略。数据来源与优化目标分离,使历史数据可以脱离当前策略被反复使用,这是经验回放与离线强化学习能够成立 的根基。 max 算子同时引入正向偏差:对含噪声的估计取最大值会放大高估。动作空间越大、估计噪声越强,高估越显著。
  2. DQN 的深度逼近 Q 学习最初以查表方式维护 Q 值,无法处理大规模状态空间。深度 Q 网络(Deep Q-Network, DQN)(Mnih et al., 2015)用深度神经网络 Q (s, a) 逼近 Q 函数,通过最小化时序差分(Temporal Difference, TD)误差更新参数: θ L(θ) = E(s,a,r,s′ )∼D [(r + γ max ′ Qθ− (s′ , a′ ) − Qθ (s, a)) ] a 其中 D 为经验回放缓冲,θ 为目标网络参数。DQN 在 Atari 游戏上以超越人类的表现证明了深度网络拟合 Q 函数并稳定 − 离策略学习的可行性,成为后续大量深度强化学习工作的基础。

11.3.2 经验回放与目标网络

深度网络与离策略学习结合初期训练常出现震荡甚至发散,DQN 引入两项机制加以解决。 经验回放(Experience Replay)。智能体每步与环境交互产生转移样本(transition)(s , a , r , s ),存入回放缓冲 (replay buffer)D;训练时从中均匀随机采样小批量更新网络。其作用有二: t t t t+1 •打破样本相关性:相邻时刻的转移高度相关,顺序更新会使梯度方向产生系统性偏差,随机采样使训练样本近似独立同 分布 •提高数据利用率:每条转移可被多次复用,稀疏奖励场景下同等交互量能支撑更多梯度步数 目标网络(Target Network)。TD 目标 r + γ max Q(s , a ) 与预测 Q(s, a) 共享参数,每次更新同时改动目标本身,形如 a′ ′ ′ 追逐移动靶,训练易发散。DQN 维护一份延迟同步的参数副本 θ 专用于计算目标:在线参数每步更新,目标参数每隔固 − 定步数复制一次,或以软更新 θ ← τ θ + (1 − τ )θ 平滑同步。目标与预测解耦后,训练曲线明显平稳。 − − 双 DQN(Double DQN)(van Hasselt et al., 2016)。单网络 DQN 中,max 算子用同一网络选择动作并估计其价值,选 择偏差与估计噪声相互叠加,高估被放大。双 DQN 将选择与评估分离:在线网络选出最优动作,目标网络估计该动作的 价值: r + γ Qθ− (s′ , arg max ′ Q θ (s ′ , a ′ )) a 该改动不增加计算开销,却把 Q 值高估从约 5% 压到接近零。经验回放、目标网络与双 DQN 的组合被后续的连续控制算 法(如 TD3、SAC)普遍继承。

11.3.3 离线强化学习与分布外问题

离线强化学习(offline reinforcement learning),又称批量强化学习(batch reinforcement learning),要求仅用预先 采集的固定数据集学习策略,训练期间不与环境交互: D = {(si , ai , ri , s′i )}N i=1 数据由行为策略或多种策略混合产生,采集完成后无法补充探索。自动驾驶、医疗决策等场景无法在线试错,只能依赖静 态日志,是离线学习的主要动机。

  1. 分布外动作的高估问题 标准 TD 目标中的 max Q(s , a ) 隐式假定可访问任意动作。离线场景下数据集仅覆盖部分动作,对未出现动作的 Q 值只 a′ ′ ′ 能依赖函数逼近器外推。神经网络对未见输入倾向于给出不可靠的高估,max 算子恰好选出其中最高的估值,分布外 (out-of-distribution, OOD)动作因此被系统性高估,策略据此选择从未被验证的动作;离线数据无法提供纠正信号, 高估在自举中不断自我强化。
  2. 保守性方法思想 应对思路是惩罚对 OOD 动作的高估。保守 Q 学习(Conservative Q-Learning, CQL)(Kumar et al., 2020)在 TD 损失 上叠加正则项:压低数据分布之外动作的 Q 值,同时抬升数据内动作的 Q 值: LCQL (θ) = α Ea∼D [log ∑ exp(Qθ (s, a′ )) − Qθ (s, a)] + LTD (θ) a′ 第一项以 log-sum-exp 形式对整体动作分布的 Q 值取上界,再减去数据内动作的 Q 值,使学习到的 Q 函数成为真实值函 数的下界,从而消除对低质量动作的偏好。这一正则化思路与策略约束类方法(在优化中限制策略与行为策略的 KL 距 离)并列为离线强化学习的两大技术路线。
  3. 数据质量与覆盖度的影响 离线学习的性能上限由数据集决定。覆盖度(coverage)决定能否找到最优动作,质量决定学习信号的可靠性:若数据 仅覆盖次优区域,算法无法超越数据内的最优行为;若数据由专家生成,行为克隆已接近最优,保守正则的收益有限。实 践中常以单步回归(只用一个转移估计 Q 值)作为诊断基线,其性能反映了数据集本身的质量下限。 Offline RL Online RL OOD actions overestimate (s, a, r, s') Replay buffer random batch Fixed dataset D no interaction Q update and policy d Conservative regularizatio Environment Q-network update n improved behavior 图11-5 在线强化学习与离线强化学习的训练回路 如图11-5 所示,在线强化学习经回放缓冲与环境循环交互,转移样本持续补充;离线强化学习的数据流封闭在固定数据 集内,无新样本输入,OOD 高估由保守正则抑制,构成两种学习范式的根本差异。

11.3.4 行为克隆与模仿学习

行为克隆(Behavioral Cloning, BC)是最直接的监督式模仿学习:把专家演示视为输入输出对,训练策略 π 最大化轨迹 数据上的对数似然: θ LBC (θ) = −E(s,a)∼D [log πθ (a∣s)] 该目标不估计回报,不涉及状态值函数,是纯粹的监督学习,训练稳定、实现简单。 BC 与强化学习存在三点本质差异: •不利用时序奖励:BC 对演示中的全部动作一视同仁,无法识别哪一步带来高回报,也就无法纠正低质量演示中的局部 失误;RL 借助奖励信号强化高回报动作 •分布漂移(distribution shift):训练时策略所见状态来自专家轨迹,推理时状态由自身行为产生,两步分布不一致; 任何一步误差都把后续状态推向训练分布之外 •复合误差(compounding error):设单步错误率恒为 ϵ,长度为 T 的轨迹上累计误差随 T 线性放大至 O(T ϵ) 量级,长 序列任务中策略迅速偏离专家行为 这些缺陷使 BC 通常作为 RL 的初始化或组件而非终局方法。当奖励难以刻画而演示容易获取(如自动驾驶、机器人操作) 时,BC 是务实的选择;当任务奖励信号明确且可在线评估时,RL 更可能突破演示数据的上限。 当只有成对偏好标注(哪条输出更优)、没有显式动作演示时,无法直接套用 BC 的最大似然目标。这类方法从静态偏好 数据集学习隐式奖励或直接优化策略,不与环境交互,与离线强化学习共享固定数据集假设。DPO(Direct Preference Optimization)等离线偏好优化方法的推导建立在离策略框架之上,其具体内容不再展开。

11.4 多智能体与序列决策

单智能体强化学习假设环境中只有一个决策者。当环境中存在多个相互影响的决策主体,或决策需要前瞻规划时,问题域 扩展为多智能体强化学习、多臂老虎机与模型预测控制三类框架。本节依次梳理三者的形式化设定、代表性算法及其与大 语言模型系统的对应关系。

11.4.1 多智能体强化学习

多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)研究多个决策主体在共享环境中同时学习最优策略的 问题。单智能体马尔可夫决策过程(Markov Decision Process, MDP)假设环境转移仅由唯一决策者的动作决定;当多 个智能体的动作共同影响状态转移时,决策问题升级为随机博弈(Stochastic Game)。

  1. 问题设定 随机博弈以元组 (S, A , … , A , P , r , … , r , γ) 刻画。其中 S 为全局状态空间,A 为智能体 i 的动作空间,转移函数 1 n 1 n i P (s ∣ s, a , … , a ) 由所有智能体的联合动作决定,r 为智能体 i 的奖励函数,γ 为折扣因子。每个智能体以最大化自身长 ′ 1 n i 期折扣回报 ∑ γ r 为目标。 t t i t 当智能体只能观测自身局部信息时,随机博弈退化为部分可观测随机博弈(Partially Observable Stochastic Game, POSG)。此时策略是从局部观测 o 到动作的映射,智能体间信息不对称,学习信号难以区分单个智能体对联合结果的贡 i 献,信用分配(Credit Assignment)问题因此更加突出。 t 非平稳性(Non-Stationarity)是 MARL 的核心难点。单智能体 MDP 在固定策略下环境保持平稳;多智能体环境中,其 他智能体的策略随训练不断演化,从任一智能体视角看,环境处于持续变化之中,传统 Q-learning 的收敛保证不再成 立。
  2. 集中训练分布执行 集中训练分布执行(Centralized Training with Decentralized Execution, CTDE)是当前 MARL 的主流范式。训练阶段, 评论家(critic)可访问全局状态与其他智能体的动作,据此完成信用分配;执行阶段,每个智能体仅依据自身局部观测 独立决策,通信开销与单智能体一致。CTDE 缓解了部分可观测性与非平稳性:集中式评论家提供全局评估,分布式策略 保证部署可行性。 CTDE 的代表实现包括 MADDPG 与 MAPPO。MADDPG 为每个智能体维护一个以全局状态和联合动作为输入的集中式评 论家;MAPPO 将 PPO 扩展到多智能体,用全局状态作为优势估计的输入,以共享参数的方式训练各智能体的策略。
  3. 场景划分与多模型协作 按奖励结构可将 MARL 场景分为三类: •合作型(Cooperative):所有智能体共享同一奖励,以最大化联合回报为目标,如多机器人协同搬运; •竞争型(Competitive):奖励此消彼长,一方的收益即另一方的损失,零和博弈是典型代表; •混合型(Mixed):同时包含合作与竞争成分,如团队对抗。 MARL 与多 Agent 系统(Multi-Agent Systems, MAS)存在清晰对应:多个大语言模型分工协作完成同一任务时,每个模 型可视为一个智能体,其上下文与工具调用结果构成局部观测,任务完成质量构成共享奖励。差异在于经典 MARL 依赖与 环境交互的在线试错,而 LLM 多智能体协作以预训练能力为起点,多以角色协议与编排结构近似合作型或竞争型奖励的 优化。

11.4.2 多臂老虎机与探索

多臂老虎机(Multi-Armed Bandit, MAB)是强化学习的单步简化:决策者面对 K 个臂,每步选择一个并观测来自未知 分布的随机奖励。老虎机没有状态转移,各动作的奖励相互独立,不存在长期信用分配问题,全部难点集中在探索与利用 的权衡(Exploration-Exploitation Tradeoff)。

  1. 遗憾定义 衡量老虎机算法的标准是遗憾(Regret),定义为最优臂的期望奖励与算法实际累积奖励之差: Regret(T ) = T μ∗ − E [∑ rat ] T t=1

其中 μ = max μ 为最优臂的期望奖励。若遗憾以 O( T ) 的亚线性速率增长,说明算法在充分探索后收敛到接近最优。 ∗ 探索策略的共性是在当前收益与信息获取之间分配采样预算:利用(exploitation)依赖已有信息选择高收益动作,探索 a a (exploration)通过尝试不确定动作获取信息。 2) 三类代表性算法 ε-贪心(ε-greedy)以概率 ε 均匀随机选择臂,以概率 1 − ε 选择经验平均奖励最高的臂。它实现简单,但随机探索不区 分臂的不确定性,固定 ε 无法随采样次数衰减,遗憾呈线性上界。 上置信界(Upper Confidence Bound, UCB)以乐观原则驱动探索,每步选择置信上界最大的臂: at = arg max [μ ] 2 ln t ^a + Na (t) a 其中 μ^ 为臂 a 的经验平均奖励,N (t) 为截至 t 时刻臂 a 被选择的次数。第二项为置信区间宽度:被采样少的臂区间更 宽、更易被选中,采样充分后区间收窄,探索自动衰减。UCB 的遗憾界为 O( KT ln T )。 a a 汤普森采样(Thompson Sampling)从贝叶斯视角求解。它为每个臂维护奖励分布的后验,每步从后验中采样一个奖励 估计并选择估计最高的臂。对二值奖励采用 Beta-Bernoulli 模型时,后验为 Beta 分布,采样代价为常数。汤普森采样的 遗憾界与 UCB 同阶,在有限样本下表现常更优。 3) 上下文与在线偏好收集 上下文多臂老虎机(Contextual Bandit)在每次决策前提供上下文特征 x (如用户画像或问题描述),奖励分布随上下文 变化,目标变为学习条件最优策略 a (x) = arg max E[r ∣ x, a]。线性上下文老虎机以线性模型近似奖励函数,把探索从动 t ∗ 作空间扩展到特征空间。 a 上下文老虎机直接对应 LLM 在线偏好收集。提示(prompt)充当上下文,模型采样的多个候选回复充当臂,人类偏好充 当奖励。对同一提示采样多条回复并收集两两比较偏好,以组内相对信号取代单条绝对评分,可降低采样方差、抑制奖励 分布偏移。这一思想正是 GRPO 等无评论家算法以采样组构建相对优势基线的原理基础。

11.4.3 模型预测控制

模型预测控制(Model Predictive Control, MPC)源于过程控制,核心思想是在每个时刻基于环境模型向前规划有限时 域,求解最优动作序列后只执行第一个动作,随后以新观测重新规划。框架由三个要素构成: •预测模型(Prediction Model):描述状态转移的动态函数,可由物理方程或神经网络给出; •优化目标(Objective):规划时域内的累积代价函数,反映期望行为与安全约束; •滚动时域(Receding Horizon):只执行计划的第一步,下一时刻重新规划,形成闭环。

  1. 滚动优化框架 设动力学为 s = f (s , u ),MPC 在每个时刻求解如下有限时域最优控制问题: t+1

t t H−1 min ∑ c(st+k , ut+k ) + cT (st+H ) s.t. st+k+1 = f (st+k , ut+k ) ut:t+H−1 k=0 其中 c 为阶段代价,c 为终端代价,H 为规划时域。求解后仅执行第一个动作 u ,进入下一时刻后以实测状态重新求 解。滚动优化使策略具备闭环反馈能力,规划误差与模型失配在每步通过新观测得到修正。如图11-6 所示,该循环由状 T t 态观测、模型预测、时域求解与动作执行四个阶段构成,并在每个时刻往复。 World model Horizon optimizer Apply first action u_t s' = f(s, u) min sum of stage costs State s_t Environment s_(t+1) receding horizon 图11-6 滚动时域的优化循环 MPC 把决策表述为带约束的最优化问题,因此能自然处理动作界限与安全条件等约束。代价在于每步求解的计算开销随 规划时域与状态维度增长,实时性成为部署瓶颈。 2) 与基于模型强化学习的联系 基于模型的强化学习(model-based RL)泛指以环境模型为中间产物的一类方法,其共同前提是先学习转移模型 f^ ≈ f ,再用其替代真实环境进行想象(Imagination)与规划。MPC 是其中直接的一类:不显式学习价值函数,而是在决策时 通过模型进行前瞻搜索(Planning at Decision Time)。 世界模型(World Model)为 MPC 提供预测模型。当转移模型由大语言模型承担时,给定当前状态与候选动作,模型预 测下一状态,规划器据此在虚拟轨迹上评估并选择动作。这与世界模型用于想象训练的用法一致,差异在于 MPC 把模型 用于决策时的搜索,而非训练时的数据增强。 MPC 与基于值函数的 model-based RL 分工互补:前者把计算投入决策时的前瞻规划,对模型精度与实时求解器要求 高;后者把计算投入训练阶段,将学到的价值或策略固化为快速决策。两者都以环境模型为纽带,构成规划与学习两条互 补路径。