返回AI书列表
📚 TheAIEra Book 0 章

Agent Evaluation and Evolving: All in One

作者:itech001 GitHub

《Agent Evaluation and Evolving: All in One》完整大纲:从 LLM Benchmark 数据解析、评估方法论全景、Agent 与 Framework 方法解析,到 Agent 与 Skills 优化、黄金数据与 Eval 设计,一本书讲透 Agent 评估与进化。共 5 章 35 节 + 4 附录。

Agent评估LLM评估BenchmarkEvalAgent优化LLM-as-a-JudgeAgent-as-a-JudgeRL书籍

📖 本书大纲

Agent Evaluation and Evolving: All in One

关于本书

Agent评估正在经历双重范式转移:评估对象从单轮输出转向多轮轨迹,评估目的从衡量手段转向优化信号源。本书围绕"如何让评估真正驱动Agent系统改进"这一核心问题,沿五个层次递进展开:

数据解析(基准从何而来)
  → 方法论全景(评估怎么做)
    → 框架方法(工具怎么用)
      → 技能优化(信号怎么用)
        → 实践设计(自己的Agent怎么做)

本书不仅讲"怎么评估",更讲"评估如何驱动进化"——把评估器当作优化器的目标函数,用评估信号反哺 prompt 优化、技能文档训练、轨迹级强化学习,最终形成"评估 → 改进 → 再评估"的持续进化闭环。

内容结构总览

全书共 5 章 35 节 + 4 个附录

主题 核心内容 小节数
第一章 LLM Benchmark 数据解析 排行榜评分机制、基准分类学、数据污染/饱和、动态交互式基准、HF 生态 5
第二章 评估方法论全景 五大范式、LLM-as-a-Judge、Agent-as-a-Judge、轨迹评估、效度与可靠性、安全评估 8
第三章 Agent 与 Framework 方法解析 Harbor、Claude Code EDD、Codex、ADK、RAGAS、观测平台(Opik 等)、开源评估框架 9
第四章 Agent 与 Skills 的优化 统一框架、GEPA、SkillOpt、轨迹级 RL、自我改进循环、持续适应与风险 6
第五章 Golden Data 与 Eval 设计 黄金集构建、合成数据、轨迹标注、EDD 工作流、评分器、选型矩阵、端到端案例 7
附录 参考 工具速查表、论文索引、llm-stats 方法论、阅读路径 4

每章统一结构

每章遵循统一的写作结构:

  1. 核心论点 — 这一章想让你记住的一句话
  2. 小节展开 — 由浅入深的方法、框架与案例
  3. 对比与取舍 — 关键工具/方法/范式的横向对比表
  4. 参考资料 — 论文、官方文档与开源仓库索引

章节导航

第一章:LLM Benchmark 数据解析

核心论点:排行榜是评估的"用户界面",但其背后的评分机制、数据来源和更新策略决定了可比性的边界。理解基准数据的"元信息",比读懂分数本身更重要。

  • 1.1 排行榜的评分机制解剖 — llm-stats.com 的 TrueSkill 贝叶斯评级、自报告 vs 独立复现、盲测偏好 vs 基准分数
  • 1.2 基准的分类学 — 基于 arXiv:2504.19678 的约 60 个基准分类框架;Open Benchmark Index 与 lighteval 的基准检索
  • 1.3 基准数据的有效性危机 — 数据污染、饱和问题、基准与真实能力的错位
  • 1.4 动态与交互式 Agent 基准 — τ-bench、GAIA、LiveCodeBench、HLE、SWE-bench 系列、SWE-Lancer、BrowseComp、WebArena/OSWorld
  • 1.5 排行榜的"元"视角:饱和、污染与效率 — ARC-AGI-2、LiveBench、EvoEval/GenieBench、FRAMES/SimpleQA、成本与效率视角($/task、budget-forced pass@k、Scale SEAL)

第二章:评估方法论全景

核心论点:不存在"万能"的评估方法论。评估范式的选择取决于评估目标、评估对象(Agent 的哪个层次)和资源约束。

  • 2.1 五大评估范式 — 静态基准、动态自适应、交互式 Agentic、人在回路、模型评估(LLM-as-a-Judge)
  • 2.2 LLM-as-a-Judge 的实践与校准 — 专业判官分解、判官提示四要素、多判官共识、判官校准(位置/长度/自我偏好偏差)
  • 2.3 Agent-as-a-Judge 与元评估基准 — Agent-as-a-Judge(Meta)、RewardBench、Judge Arena、判官与任务同源风险
  • 2.4 多轮对话评估的专门方法论 — 评估什么(任务/响应/体验/记忆/规划)× 如何评估(标注/自动化/混合/自评判)
  • 2.5 轨迹评估与中间步骤评分 — ADK POST /run_sse 推理轨迹捕获、tool_trajectory/response_match/自定义函数指标
  • 2.6 评估指标的层次化体系 — 组件级 / 轨迹级 / 系统级
  • 2.7 评估的效度与可靠性 — 测量噪声、统计显著性、test-retest、协议标准化、成本与效率指标
  • 2.8 安全、红队与越狱评估 — 越狱基准(HarmBench 等)、提示注入(AgentDojo/AgentFail)、工具滥用与数据外泄(ASB-2025)、红队工程化(Garak/Inspect AI)

第三章:Agent 与 Framework 方法解析

核心论点:框架的选择决定了评估的粒度和可复现性。没有"最好的框架",只有"最适合当前评估对象和基础设施约束的框架"。

  • 3.1 Harbor — Terminal-Bench 官方 harness,统一接口、并行环境、RL rollout 生成、274+ 数据集注册表
  • 3.2 Claude Code 的评估体系:EDD 原则 — 先定义期望再实现、pass@k、三级评分器体系、第三方工具链(coding-agent-evals/curiocity)
  • 3.3 Codex 的评估实践 — vals.ai 独立基准、Terminal-Bench 2.1 / SWE-bench Verified、任务级别错误分析
  • 3.4 Google ADK 的评估框架 — User Simulation(ConversationScenario)、Golden Path 与轨迹评估
  • 3.5 RAGAS — 无参考评估框架,context_precision/recall、faithfulness、answer_relevancy/correctness
  • 3.6 可观测性驱动的评估平台 — Opik(tracing/实验/LLM判官/PyTest CI/MCP)、LangSmith、Langfuse、Arize Phoenix、MLflow 横向对比
  • 3.7 HuggingFace 评估工具链 — lighteval(1000+ 任务)、evaluate、evaluation-guidebook、Open LLM Leaderboard
  • 3.8 开源评估框架速览 — Inspect AI、promptfoo、DeepEval、OpenAI Evals 对比 + 最小可运行代码骨架
  • 3.9 长上下文与记忆评估 — RULER、LongBench v2、LongMemEval、LoCoMo、HaluMem

第四章:Agent 与 Skills 的优化

核心论点:评估的终极价值不在于"衡量"而在于"驱动改进"。当评估信号以自然语言反思而非标量奖励的形式反馈时,优化效率获得数量级提升。

  • 4.1 统一框架:评估器就是优化目标 — 反思式/搜索编译式/文本梯度式/技能知识式/轨迹式五范式对比,DSPy 的"metric=损失函数"最佳教材
  • 4.2 GEPA:反思式 Prompt 进化 — 自然语言反思 + Pareto 前沿,ICLR 2026 Oral,超越 GRPO/MIPROv2
  • 4.3 SkillOpt:像训练神经网络一样训练技能 — 训练循环、独立优化器、稳定性机制、零推理时开销、SkillOpt-Sleep 自进化
  • 4.4 轨迹级强化学习:评估信号直接当 Reward — 规则可验证 reward(SWE-RL/RLVR)、环境 reward(RLEM)、judge/rubric 作 reward(Self-Rewarding/DR-Tülu)、Tülu 3 配方、轨迹级策略梯度(AGILE/WebRL)
  • 4.5 自我改进循环与评估器的进化 — Reflexion/Self-Refine/CRITIC;Self-Rewarding/Meta-Rewarding、judge 蒸馏、EvalGen 式自动 rubric
  • 4.6 持续适应与风险 — 在线/持续适应(Live-SWE-agent/Voyager);⚠️ Reward Hacking 与 judge 自证循环

第五章:如何为自己的 Agent 设计 Golden Data 和 Eval

核心论点:黄金数据集是评估的"源代码",其质量决定了评估信号的信噪比。构建黄金数据集不是"收集数据",而是"定义正确性"。

  • 5.1 黄金数据集的定义与核心原则 — 输入/期望输出/元数据三要素、正常/边缘/标记失败三类样本
  • 5.2 构建流程:从错误分析到版本化 — 错误分析 → 种子集 → 标注纪律 → 统计严谨性 → 版本化 → 合成数据扩增(seed 扩写/仿真轨迹/子集蒸馏/去污染)
  • 5.3 Agent 评估的特殊设计考量 — 轨迹标注、多轮对话设计、中间步骤评估、运行时 Schema 集成
  • 5.4 Eval 驱动的开发工作流 — 定义/实现/验证/发布四阶段、持续评估与 CI 门禁、发布后的在线评估闭环(trace 回流/漂移检测/灰度对比)
  • 5.5 评分器的选择策略 — 代码评分器优先、LLM 评分器处理开放式、人工审查安全关键、混合策略
  • 5.6 选型决策矩阵 — 按场景快速定位工具(单模型对比/RAG/观测/编码 Agent/多轮对话/判官校准)
  • 5.7 端到端案例 — 带工具 RAG + 浏览器 Agent 的 8 步评测搭建 walkthrough(数据采集 → 黄金集 → 合成扩增 → 评分器校准 → CI → 成本统计 → 优化闭环 → 在线监控)

附录

  • 附录A:核心工具速查表 — Harbor、RAGAS、GEPA、SkillOpt、ADK、ECC、coding-agent-evals、curiocity、Opik、LangSmith、Langfuse、Arize Phoenix、MLflow、lighteval、evaluate、Open LLM Leaderboard、τ-bench、SWE-bench、Inspect AI、promptfoo、DeepEval、OpenAI Evals、DSPy、TextGrad、AgentDojo
  • 附录B:关键论文索引 — GEPA、Beyond the Leaderboard、Agent-as-a-Judge、RewardBench、多轮对话评估综述、SWE-RL、RLEM、Tülu 3、Self/Meta-Rewarding、DSPy、TextGrad、Reflexion、AgentDojo、SWE-Lancer 等 20 篇
  • 附录C:llm-stats.com 方法论要点 — TrueSkill 保守评分、数据来源、覆盖范围、更新策略
  • 附录D:给读者的下一步 — 按目标(读懂榜单/搭评估/驱动改进/CI 门禁/安全评估/端到端)推荐阅读路径

阅读路径

快速入门(1-2 天)

第一章 → 第三章 3.6/3.8 → 第五章 5.6

目标:理解排行榜、选对评估工具、搭起最小评估。

系统学习(2-3 周)

第一章 → 第二章 → 第三章 → 第四章 → 第五章

目标:完整掌握从"理解基准"到"驱动进化"的全链路,配合第五章 5.7 walkthrough 实践。

前沿热点(1-2 天)

第二章 2.8(安全评估)→ 第四章 4.4(评估反哺 RL)→ 第四章 4.5(评估器进化)

目标:了解 2025-2026 年 Agent 评估最热门的三个方向。


原始大纲: /books/agent-eval-evolving/README.md 配套章节: 待按大纲逐章撰写(ch01-ch05 + 附录)

📑 章节目录

章节正在编写中,敬请期待。