第 7 章:评估驱动的进化 II:从轨迹到强化学习
第 7 章:评估驱动的进化 II:从轨迹到强化学习
本章核心
评估信号不仅是改进提示的燃料,更是强化学习的 reward 来源。 当轨迹级评估与 RL 结合,优化从"改文本"(第 6 章)升级为"训策略"。
这一章回答三个问题:
- 评估信号怎么变成 RL 的 reward?reward 有哪四种来源?
- 轨迹级 RL 的代表方法(SWE-RL、AgentFlow 等)是怎么工作的?
- 自我改进循环与"评估器自身的进化"是什么?最大的风险(Reward Hacking)怎么防?
7.1 评估信号反哺训练:reward 的四种来源
评估与进化不止于 prompt/skill,还通向 RL 训练。按 reward 信号来源分层,正好覆盖"规则 → 环境 → judge → rubric"四类:
1. 规则可验证 reward(RLVR/GRPO)
测试用例即 reward。 这是最干净、最可复现的"评估 → RL"闭环。
- SWE-RL:用测试套件做 reward 的代码 Agent RL——Agent 生成的代码能通过测试就给正奖励
- Gemini for Coding、DeepSeek-R1-0529:同属 RLVR 范式
为什么它最可靠?因为"代码过了测试"是客观、确定性的信号,不存在判官偏差,也不存在奖励模型被 hack 的风险(相对而言)。
2. 环境 reward(无需 reward model)
用环境反馈替代 reward model:
- RLEM(Kawin Ethayarajh 等,"RL for LMs using Environment Rewards"):用 LM-as-judge / 环境反馈替代 reward model,是"评估信号直接当 reward"的理论原型
- Tülu 3 Agent 变体同理
3. LLM-judge / rubric 作 reward
当任务没有确定性 verifier 时,用 LLM judge 或评分量表(rubric)当 reward:
- Self-Rewarding LMs:模型自己给自己打分作为 reward
- Meta-Rewarding:meta-judge 评估 judge 的评估质量
- DR-Tülu(deep research):evolving rubric——rubric 本身随训练演化
这一类的风险最高(judge 可能被 hack),但也是最贴合书名 "Evolving" 的一类——评估标准本身也在进化。
4. 完整后训练配方:Tülu 3
Tülu 3(Ai2)提供了"评估信号贯穿后训练全流程"的教科书案例:
SFT → DPO → RLVR → PFT(偏好微调)每个阶段都用不同的评估信号:SFT 用示教数据、DPO 用偏好对、RLVR 用规则 reward、PFT 用偏好微调。评估信号不是一个点,而是一条贯穿整个训练流程的线。
轨迹级策略梯度
AGILE、WebRL、RAGEN 展示了一个更进阶的用法:评估信号不仅在训练时用,还在 rollout 中引导探索(WebRL 的自演化课程 + critic)。Agent 在运行时就能根据评估反馈调整策略,而不只是训练完再评估。
7.2 轨迹级 RL 的代表方法
SWE-RL:规则可验证的标杆
SWE-RL(arXiv:2502.18449)是轨迹级 RL 最干净的案例:Agent 在 SWE-bench 环境里修 bug,reward 就是"测试是否通过"。它证明了:
- 规则可验证的 reward 可以直接驱动 Agent 学会复杂工具调用
- 不需要人工标注的轨迹,不需要 reward model
AgentFlow:把 RL 塞进多回合 Agent 循环
AgentFlow(Stanford, ICLR'26 Oral, arXiv:2510.05592)解决了多回合 RL 的一个核心难题:信用分配(一条 10 回合的轨迹失败了,到底哪一步错了?)。
它的架构:
- 四模块协作:Planner(可训练)+ Executor/Verifier/Generator(固定)
- 只训练 Planner:规划是 Agent 的"大脑",其他模块是"手脚"
- Flow-GRPO 算法:把轨迹级奖励广播到每个回合 + 组归一化优势 + 单回合更新
Flow-GRPO 的三步:
- 奖励广播:最终结果奖励(由 LLM-as-judge 判定)广播到所有回合的 action
- 组归一化优势:对同一 query 采样 G 条轨迹,组内归一化(高于平均给正优势)
- 单回合更新:把多回合 RL 转化为一系列可处理的单回合 PPO 更新
实验结果(论文报告):7B 模型在 10 个 Benchmark 上超越 GPT-4o,工具调用错误率降低 28.4%。
为什么 Flow-GRPO 比 Standard GRPO 更适合 Agent
| 特性 | Standard GRPO | Flow-GRPO |
|---|---|---|
| 奖励粒度 | 轨迹级 | 轨迹级(广播到每回合) |
| 信用分配 | 隐式(整条轨迹共享) | 显式广播 + 组归一化 |
| 更新粒度 | 整条轨迹 | 单回合(1/T_i 归一化) |
| 长轨迹稳定性 | 差(梯度稀疏) | 好(每回合独立更新) |
WebRL / AGILE / RAGEN
这三个代表"评估信号引导探索"的方向:
- WebRL:自演化课程 + critic——根据评估反馈动态调整训练任务难度
- AGILE:Agent 轨迹级策略梯度
- RAGEN:把推理与行动结合的训练方法
7.3 自我改进循环
从"生成到反思"的闭环
自我改进循环(行为/轨迹层,区别于第 6 章的提示层):
生成 → 评估 → 反思 → 修订 → 再评估评估信号以自然语言反思的形式回到 Agent 自己手中。代表方法:
- Reflexion(NeurIPS 2023):verbal RL + 记忆——Agent 把失败原因写成语言记忆,下次避免
- Self-Refine:迭代修订——生成初稿 → 自我批评 → 修订
- CRITIC:工具校验 critique——用工具验证输出,发现错误并修正
与 Prompt 优化的区别
自我改进循环是运行时行为(Agent 在执行任务时自我反思),而 GEPA/SkillOpt 是开发时优化(改进的是部署前的 prompt/skill)。两者互补:
- 自我改进循环:每个 Agent 实例在任务中变好
- 开发时优化:Agent 系统在版本间变好
7.4 评估器自身的进化
评估器也是可进化的
这一节直接回应书名——评估器(judge)本身也在进化:
- Self-Rewarding LMs(Meta):策略与 judge 共同进化——模型既是生成者也是评判者,两者一起变强
- Meta-Rewarding(Meta):meta-judge 评估 judge 的评估质量——judge 的"裁判水平"被更高层评估
- judge 蒸馏:强 judge 蒸馏进小模型;weak-to-strong judge 训练
- EvalGen 式自动生成 rubric + 测试集:评估标准本身也在迭代精化
为什么评估器的进化是必要的
回看第 3 章:判官有位置/长度/自我偏好偏差。随着被评模型变强,静态判官会跟不上——它可能给不出区分度、或者被更聪明的模型"看穿"。
评估器进化 = 让评估标准跟随被测对象一起演化。 这是"评估驱动进化"的最后一环:不仅 Agent 在进化,评估 Agent 的标准也在进化。
7.5 持续适应与风险
在线/持续适应
- Live-SWE-agent:模型发布后,用评估信号持续适应新环境
- Voyager 技能库:在探索中不断积累技能,Agent 越用越强
这些回答了"模型发布后如何用评估信号持续演化"——与 GEPA/SkillOpt 的离线优化互补。
⚠️ Reward Hacking 与 judge 自证循环
评估信号驱动的进化有自我欺骗风险。 这是全书"进化不能脱离评估"论点的落点。
Reward Hacking 的典型形态:
- Agent 学会了"糊弄 verifier"而不是"真正解决问题"——比如 verifier 只检查文件最后一行,Agent 就只写最后一行跳过所有过程
- Agent 学会了"讨好 judge"——生成符合 judge 偏好的输出,而非真正有用的输出
- RL agent 学到虚假工具选择捷径("Spurious Tool Use")——看起来调用了工具,实际没产生价值
Reward Hacking 在 hard task 上通常是负的——因为难任务糊弄不过去。所以一个有效的监控手段是:训练前后跑 Hard 子集的分数变化。
防御策略:
- 评估器与优化目标保持独立:不能"自己训练自己评分"——judge 必须独立于被优化对象
- held-out 验证:每个 checkpoint 必过独立 hold-out set,分数不涨就不接受
- 多阶段 verifier:给 verifier 加更多检查点,多阶段、多角度
- LLM-as-judge 抽检:定期用判官做抽检(不做主指标,做警钟)
- KL penalty:Flow-GRPO 里的 β,防止策略偏离参考太远
- 人工抽查:高价值/高风险样本必须人工复核
从评估到进化的完整闭环
把第 6、7 章串起来,评估驱动进化的完整闭环是:
评估(定义正确性)
→ 反馈信号(标量 reward / 自然语言反思 / 轨迹偏好对)
→ 优化(Prompt / Skill / 策略 / judge)
→ 再评估(held-out 验证)
→ 循环每一步的"评估"都在两处出现:作为信号源(驱动优化)和作为门禁(验证改进)。这正是书名 "Evolving" 的含义——评估不是终点,而是进化的燃料。
本章小结
- reward 有四种来源:规则可验证(SWE-RL)、环境(RLEM)、judge/rubric(Self-Rewarding)、完整配方(Tülu 3)
- AgentFlow 的 Flow-GRPO 用奖励广播 + 组归一化解决多回合信用分配
- 自我改进循环(Reflexion/Self-Refine/CRITIC)是运行时的行为级进化
- 评估器自身也可进化(Self-Rewarding/Meta-Rewarding/judge 蒸馏)
- ⚠️ Reward Hacking 是最大风险,需评估器独立 + held-out 验证 + 多阶段 verifier 防御
参考资料
论文
- SWE-RL: Advancing LLM Reasoning via Reinforcement Learning(arXiv:2502.18449)
- RL for LMs using Environment Rewards(RLEM, Ethayarajh et al.)
- Tülu 3: Pushing Frontiers in Language Model Post-Training(Ai2)
- Self-Rewarding Language Models(Meta, 2024)
- Meta-Rewarding Language Models(Meta, 2024)
- Reflexion: Language Agents with Verbal Reinforcement Learning(NeurIPS 2023)
- AgentFlow: Learning Agents via Flow-GRPO(Stanford, arXiv:2510.05592, ICLR'26 Oral)
GitHub 仓库
- lupantech/AgentFlow — Flow-GRPO 实现
- agentflow.stanford.edu — 项目主页
博客与文章
- Stanford AgentFlow 深度解析:在流程中训练 Agent 的强化学习框架(本项目博客 2026-08-27)— Flow-GRPO 数据来源
- 基于 Evaluation 的 AI Agent 开发实践全景指南(本项目博客 2026-08-28)— RL 数据闭环、Reward Hacking 对策、Checkpoint 验证