第 7 章 强化学习SWE-RLRLEM

第 7 章:评估驱动的进化 II:从轨迹到强化学习

第 7 章:评估驱动的进化 II:从轨迹到强化学习

本章核心

评估信号不仅是改进提示的燃料,更是强化学习的 reward 来源。 当轨迹级评估与 RL 结合,优化从"改文本"(第 6 章)升级为"训策略"。

这一章回答三个问题:

  1. 评估信号怎么变成 RL 的 reward?reward 有哪四种来源?
  2. 轨迹级 RL 的代表方法(SWE-RL、AgentFlow 等)是怎么工作的?
  3. 自我改进循环与"评估器自身的进化"是什么?最大的风险(Reward Hacking)怎么防?

7.1 评估信号反哺训练:reward 的四种来源

评估与进化不止于 prompt/skill,还通向 RL 训练。按 reward 信号来源分层,正好覆盖"规则 → 环境 → judge → rubric"四类:

1. 规则可验证 reward(RLVR/GRPO)

测试用例即 reward。 这是最干净、最可复现的"评估 → RL"闭环。

  • SWE-RL:用测试套件做 reward 的代码 Agent RL——Agent 生成的代码能通过测试就给正奖励
  • Gemini for CodingDeepSeek-R1-0529:同属 RLVR 范式

为什么它最可靠?因为"代码过了测试"是客观、确定性的信号,不存在判官偏差,也不存在奖励模型被 hack 的风险(相对而言)。

2. 环境 reward(无需 reward model)

用环境反馈替代 reward model:

  • RLEM(Kawin Ethayarajh 等,"RL for LMs using Environment Rewards"):用 LM-as-judge / 环境反馈替代 reward model,是"评估信号直接当 reward"的理论原型
  • Tülu 3 Agent 变体同理

3. LLM-judge / rubric 作 reward

当任务没有确定性 verifier 时,用 LLM judge 或评分量表(rubric)当 reward:

  • Self-Rewarding LMs:模型自己给自己打分作为 reward
  • Meta-Rewarding:meta-judge 评估 judge 的评估质量
  • DR-Tülu(deep research):evolving rubric——rubric 本身随训练演化

这一类的风险最高(judge 可能被 hack),但也是最贴合书名 "Evolving" 的一类——评估标准本身也在进化。

4. 完整后训练配方:Tülu 3

Tülu 3(Ai2)提供了"评估信号贯穿后训练全流程"的教科书案例:

SFT → DPO → RLVR → PFT(偏好微调)

每个阶段都用不同的评估信号:SFT 用示教数据、DPO 用偏好对、RLVR 用规则 reward、PFT 用偏好微调。评估信号不是一个点,而是一条贯穿整个训练流程的线。

轨迹级策略梯度

AGILE、WebRL、RAGEN 展示了一个更进阶的用法:评估信号不仅在训练时用,还在 rollout 中引导探索(WebRL 的自演化课程 + critic)。Agent 在运行时就能根据评估反馈调整策略,而不只是训练完再评估。

7.2 轨迹级 RL 的代表方法

SWE-RL:规则可验证的标杆

SWE-RL(arXiv:2502.18449)是轨迹级 RL 最干净的案例:Agent 在 SWE-bench 环境里修 bug,reward 就是"测试是否通过"。它证明了:

  • 规则可验证的 reward 可以直接驱动 Agent 学会复杂工具调用
  • 不需要人工标注的轨迹,不需要 reward model

AgentFlow:把 RL 塞进多回合 Agent 循环

AgentFlow(Stanford, ICLR'26 Oral, arXiv:2510.05592)解决了多回合 RL 的一个核心难题:信用分配(一条 10 回合的轨迹失败了,到底哪一步错了?)。

它的架构:

  • 四模块协作:Planner(可训练)+ Executor/Verifier/Generator(固定)
  • 只训练 Planner:规划是 Agent 的"大脑",其他模块是"手脚"
  • Flow-GRPO 算法:把轨迹级奖励广播到每个回合 + 组归一化优势 + 单回合更新

Flow-GRPO 的三步

  1. 奖励广播:最终结果奖励(由 LLM-as-judge 判定)广播到所有回合的 action
  2. 组归一化优势:对同一 query 采样 G 条轨迹,组内归一化(高于平均给正优势)
  3. 单回合更新:把多回合 RL 转化为一系列可处理的单回合 PPO 更新

实验结果(论文报告):7B 模型在 10 个 Benchmark 上超越 GPT-4o,工具调用错误率降低 28.4%。

为什么 Flow-GRPO 比 Standard GRPO 更适合 Agent

特性 Standard GRPO Flow-GRPO
奖励粒度 轨迹级 轨迹级(广播到每回合)
信用分配 隐式(整条轨迹共享) 显式广播 + 组归一化
更新粒度 整条轨迹 单回合(1/T_i 归一化)
长轨迹稳定性 差(梯度稀疏) 好(每回合独立更新)

WebRL / AGILE / RAGEN

这三个代表"评估信号引导探索"的方向:

  • WebRL:自演化课程 + critic——根据评估反馈动态调整训练任务难度
  • AGILE:Agent 轨迹级策略梯度
  • RAGEN:把推理与行动结合的训练方法

7.3 自我改进循环

从"生成到反思"的闭环

自我改进循环(行为/轨迹层,区别于第 6 章的提示层):

生成 → 评估 → 反思 → 修订 → 再评估

评估信号以自然语言反思的形式回到 Agent 自己手中。代表方法:

  • Reflexion(NeurIPS 2023):verbal RL + 记忆——Agent 把失败原因写成语言记忆,下次避免
  • Self-Refine:迭代修订——生成初稿 → 自我批评 → 修订
  • CRITIC:工具校验 critique——用工具验证输出,发现错误并修正

与 Prompt 优化的区别

自我改进循环是运行时行为(Agent 在执行任务时自我反思),而 GEPA/SkillOpt 是开发时优化(改进的是部署前的 prompt/skill)。两者互补:

  • 自我改进循环:每个 Agent 实例在任务中变好
  • 开发时优化:Agent 系统在版本间变好

7.4 评估器自身的进化

评估器也是可进化的

这一节直接回应书名——评估器(judge)本身也在进化

  • Self-Rewarding LMs(Meta):策略与 judge 共同进化——模型既是生成者也是评判者,两者一起变强
  • Meta-Rewarding(Meta):meta-judge 评估 judge 的评估质量——judge 的"裁判水平"被更高层评估
  • judge 蒸馏:强 judge 蒸馏进小模型;weak-to-strong judge 训练
  • EvalGen 式自动生成 rubric + 测试集:评估标准本身也在迭代精化

为什么评估器的进化是必要的

回看第 3 章:判官有位置/长度/自我偏好偏差。随着被评模型变强,静态判官会跟不上——它可能给不出区分度、或者被更聪明的模型"看穿"。

评估器进化 = 让评估标准跟随被测对象一起演化。 这是"评估驱动进化"的最后一环:不仅 Agent 在进化,评估 Agent 的标准也在进化。

7.5 持续适应与风险

在线/持续适应

  • Live-SWE-agent:模型发布后,用评估信号持续适应新环境
  • Voyager 技能库:在探索中不断积累技能,Agent 越用越强

这些回答了"模型发布后如何用评估信号持续演化"——与 GEPA/SkillOpt 的离线优化互补。

⚠️ Reward Hacking 与 judge 自证循环

评估信号驱动的进化有自我欺骗风险。 这是全书"进化不能脱离评估"论点的落点。

Reward Hacking 的典型形态

  • Agent 学会了"糊弄 verifier"而不是"真正解决问题"——比如 verifier 只检查文件最后一行,Agent 就只写最后一行跳过所有过程
  • Agent 学会了"讨好 judge"——生成符合 judge 偏好的输出,而非真正有用的输出
  • RL agent 学到虚假工具选择捷径("Spurious Tool Use")——看起来调用了工具,实际没产生价值

Reward Hacking 在 hard task 上通常是负的——因为难任务糊弄不过去。所以一个有效的监控手段是:训练前后跑 Hard 子集的分数变化

防御策略

  1. 评估器与优化目标保持独立:不能"自己训练自己评分"——judge 必须独立于被优化对象
  2. held-out 验证:每个 checkpoint 必过独立 hold-out set,分数不涨就不接受
  3. 多阶段 verifier:给 verifier 加更多检查点,多阶段、多角度
  4. LLM-as-judge 抽检:定期用判官做抽检(不做主指标,做警钟)
  5. KL penalty:Flow-GRPO 里的 β,防止策略偏离参考太远
  6. 人工抽查:高价值/高风险样本必须人工复核

从评估到进化的完整闭环

把第 6、7 章串起来,评估驱动进化的完整闭环是:

评估(定义正确性)
  → 反馈信号(标量 reward / 自然语言反思 / 轨迹偏好对)
    → 优化(Prompt / Skill / 策略 / judge)
      → 再评估(held-out 验证)
        → 循环

每一步的"评估"都在两处出现:作为信号源(驱动优化)和作为门禁(验证改进)。这正是书名 "Evolving" 的含义——评估不是终点,而是进化的燃料。

本章小结

  • reward 有四种来源:规则可验证(SWE-RL)、环境(RLEM)、judge/rubric(Self-Rewarding)、完整配方(Tülu 3)
  • AgentFlow 的 Flow-GRPO 用奖励广播 + 组归一化解决多回合信用分配
  • 自我改进循环(Reflexion/Self-Refine/CRITIC)是运行时的行为级进化
  • 评估器自身也可进化(Self-Rewarding/Meta-Rewarding/judge 蒸馏)
  • ⚠️ Reward Hacking 是最大风险,需评估器独立 + held-out 验证 + 多阶段 verifier 防御

参考资料

论文

  • SWE-RL: Advancing LLM Reasoning via Reinforcement Learning(arXiv:2502.18449)
  • RL for LMs using Environment Rewards(RLEM, Ethayarajh et al.)
  • Tülu 3: Pushing Frontiers in Language Model Post-Training(Ai2)
  • Self-Rewarding Language Models(Meta, 2024)
  • Meta-Rewarding Language Models(Meta, 2024)
  • Reflexion: Language Agents with Verbal Reinforcement Learning(NeurIPS 2023)
  • AgentFlow: Learning Agents via Flow-GRPO(Stanford, arXiv:2510.05592, ICLR'26 Oral)

GitHub 仓库

博客与文章

  • Stanford AgentFlow 深度解析:在流程中训练 Agent 的强化学习框架(本项目博客 2026-08-27)— Flow-GRPO 数据来源
  • 基于 Evaluation 的 AI Agent 开发实践全景指南(本项目博客 2026-08-28)— RL 数据闭环、Reward Hacking 对策、Checkpoint 验证