AI Agent 架构:从单体到企业级多智能体
一本框架无关的 AI Agent 架构实战指南:从 Agent 本质、ReAct 循环到工具扩展(MCP/Skills/Hooks)、上下文与记忆、单 Agent 模式、多 Agent 编排、高级推理、生产架构与企业级特性,共 9 部分 33 章。
📖 本书大纲
AI Agent 架构:从单体到企业级多智能体
从概念到生产:框架无关的 AI Agent 架构模式与实战
本书内容整理自开源项目 ai-agent-book(作者 Wayland Zhang,CC BY-NC-SA 4.0 许可)。
原创来源声明:本书中文版整理自 Kocoro-lab/ai-agent-book 仓库,原书网站:waylandz.com/ai-agent-book。本书参考实现为开源项目 Shannon(多 Agent 编排,Apache-2.0)与 ShanClaw(本地 Agent Harness)。
这本书讲什么?
不是框架文档,而是让你理解 Agent 系统设计模式的实战指南。
市面上的 Agent 教程大多停留在:
- 调用 API 实现一个 chatbot Demo
- 某个框架的配置说明和 API 翻译
- Prompt 技巧的堆砌
这些只能让你"用"Agent,不能让你"构建"生产级 Agent 系统。
真正的生产系统需要回答:
- 多 Agent 如何协作? DAG、Swarm、还是 Handoff?
- Token 预算如何控制? 单次调用还是整个 workflow?
- 工具执行失败怎么办? 重试、降级、还是人工介入?
- 如何保证安全? 沙箱隔离、权限控制、审计日志
这本书回答这些问题,配合开源项目 Shannon 提供完整的代码参考。
目标读者
| 读者类型 | 你会获得什么 |
|---|---|
| 后端开发者 | 从零构建 Agent 系统的完整路径 |
| 架构师 | 多 Agent 编排、企业级治理的设计模式 |
| 技术负责人 | 评估和落地 Agent 方案的决策框架 |
前置要求
- 必需:基本编程能力 (Go/Python/Rust 任一)
- 必需:LLM 基础概念 (Token, Prompt, Temperature)
- 有帮助:了解 REST/gRPC API
- 不需要:不需要了解任何特定 Agent 框架
内容结构
全书分为 9 个部分、33 章(外加 3 个附录):
| 部分 | 主题 | 核心内容 |
|---|---|---|
| Part 1 | Agent 基础 | Agent 本质、ReAct 循环 |
| Part 2 | 工具与扩展 | Function Calling、MCP、Skills、Hooks |
| Part 3 | 上下文与记忆 | Context 管理、Memory 架构、会话设计 |
| Part 4 | 单 Agent 模式 | Planning、Reflection、Chain-of-Thought |
| Part 5 | 多 Agent 编排 | DAG、Swarm、Handoff |
| Part 6 | 高级推理 | Tree-of-Thoughts、Debate、Research |
| Part 7 | 生产架构 | 三层设计、Temporal、可观测性 |
| Part 8 | 企业级特性 | Token 预算、OPA 策略、WASI 沙箱、多租户 |
| Part 9 | 前沿实践 | Computer Use、Agentic Coding、Background Agents |
| 附录 | 参考 | 术语表、模式选择指南、FAQ |
阅读路径
快速入门(2-3 天)
前言 → Part1 全部 → 第03章 → 第13章 → 第20章目标:Agent 基础 → 工具调用 → 多 Agent 编排 → 生产架构
系统学习(2-3 周)
Part1-8 顺序阅读,配合 Shannon 代码实践目标:完整掌握从单 Agent 到企业级多 Agent 的全部内容
前沿热点(1-2 天)
第04章(MCP) → 第27章(Deep Research) → 第28章(Computer Use) → 第29章(Agentic Coding)目标:了解 2025-2026 年最热门的 Agent 话题
写作理念
模式优先,框架其次。
框架会过时,但模式不会。每一章都遵循这样的结构:
- 先讲问题 — 什么场景需要这个能力?
- 再讲模式 — 通用的设计模式是什么?(框架无关)
- 然后看实现 — 以 Shannon 为例展示一种实现方式
- 最后对比 — 其他框架如何解决同样的问题
如果你读完一章,能在任何框架中实现同样的模式——那这一章就成功了。
关于时效性
AI Agent 领域发展极快。本书对高变动性内容会明确标注:
时效性提示 (2026-01): 本节内容基于 MCP 规范 v1.0。
核心的架构模式相对稳定,但具体的 API 和工具可能会变化。遇到疑问时,请以官方文档为准。
引用 / Citation
如果本书对您的研究或工作有帮助,请引用:
@book{zhang2026aiagent,
author = {Zhang, Wayland},
title = {AI Agent Architecture: From Monolith to Enterprise Multi-Agent},
year = {2026},
url = {https://waylandz.com/ai-agent-book},
publisher = {Self-published}
}或使用 APA 格式:
Zhang, Wayland. (2026). AI Agent 架构:从单体到企业级多智能体. https://waylandz.com/ai-agent-book
License
本书内容采用 CC BY-NC-SA 4.0 协议。
配套代码 Shannon OSS 采用 Apache 2.0 协议。
原始 GitHub: https://github.com/Kocoro-lab/ai-agent-book 原书网址: https://waylandz.com/ai-agent-book
📑 章节目录
前言
为什么写这本书:从 AI 理论讲解转向 Agent 工程落地,本书是那些踩坑经验的系统整理,模式优先、框架其次。
第 1 章:Agent 的本质
Agent 是能自主完成任务的 AI 系统,核心在于“自己做决定“而不是“你说一句它动一句“。
第 2 章:ReAct 循环
ReAct 是 Agent 的心脏:思考一步,行动一步,观察结果,再思考下一步——它让 AI 更少瞎编、更像在干活。
第 3 章:工具调用基础
工具让 LLM 从“会说“变成“能做“——但工具不是万能药:description 写烂了,LLM 照样选错工具、填错参数。
第 4 章:MCP 协议详解
MCP 是 Agent 工具的“USB 接口“——统一了工具的发现、调用和授权,但它不解决工具本身的质量问题,也不能让一个烂工具变好用。
第 5 章:Skills 技能系统
把 System Prompt、工具白名单、参数约束打包成可复用的配置——这个概念在不同系统有不同实现,但核心思想一致。
第 6 章:Hooks 与事件系统
Hooks 是 Agent 的神经系统——让你在不改核心代码的情况下,观测执行状态、插入自定义逻辑。但 Hook 太多或太慢,会把整个 Agent 拖垮。
第 7 章:上下文工程
上下文窗口是 LLM 的 RAM——它决定了 Agent 在任何时刻能“想起“什么。
第 8 章:记忆架构
记忆系统让 Agent 从“每次都是陌生人“变成“越用越懂你“。但别指望它记住一切——向量相似度不是精确匹配,召回率和准确率需要取舍。
第 9 章:多轮对话设计
多轮对话不是“把消息拼起来“那么简单。状态管理、隐私保护、去重召回——每一个都可能让你的 Agent 翻车。
第 10 章:Planning 模式
Planning 不是“想好了再动手“,而是“边想边做、边做边评估“的持续循环——关键在于知道何时停止,而不是追求完美的计划。
第 11 章:Reflection 模式
Reflection 不是让 Agent 变得完美,而是让它能发现自己的问题——发现问题是改进的第一步,但改进本身仍然需要护栏。
第 12 章:Chain-of-Thought
CoT 不是让 LLM 变聪明,而是让它把隐式推理变成显式步骤——这样你能看到它错在哪,也更容易把它拉回来。
第 13 章:编排基础
多 Agent 编排不是让一群 Agent 各干各的,而是让它们像交响乐团一样协作——有指挥、有分工、有配合。但指挥再厉害,乐手水平不行也白搭。
第 14 章:DAG 工作流
DAG 工作流的本质是依赖图——告诉编排器哪些任务可以同时做,哪些必须等。但图画得再漂亮,执行引擎不靠谱也白搭。
第 15 章:Swarm 模式
Swarm 是让多个 Agent 像团队一样协作——Lead Agent 规划和协调,Worker Agent 各自独立执行,通过共享 Workspace 和 P2P 消息互通有无。个体遵循简单规则,群体涌现复杂智能。
第 16 章:Handoff 机制
Handoff 让 Agent 之间能精确传递数据和状态——从简单的上下文注入到复杂的 P2P 消息协议,选择合适的机制比追求功能完整更重要。
第 17 章:Tree-of-Thoughts
ToT 让 Agent 同时探索多条推理路径,通过评分和剪枝找到最优解——但它不是银弹;成本高、收敛慢,只适合真正需要“试错“的场景。
第 18 章:Debate 模式
Debate 让多个 Agent 从不同立场辩论,通过对抗暴露论证弱点——但它不是万能的;设计不好的辩论只是在浪费 Token。
第 19 章:Research Synthesis
Research Synthesis 把多源并行研究、覆盖率评估、迭代补充整合成高质量的综合报告——关键不是“搜完就算“,而是“评估信息够不够、缺什么、补什么“。
第 20 章:三层架构设计
三层架构不是为了炫技,而是为了让每种语言做它最擅长的事——Go 编排、Rust 隔离、Python 对接 AI 生态。
第 21 章:Temporal 工作流
Temporal 让你的工作流像数据库事务一样可靠——执行到哪里就保存到哪里,崩溃了从断点恢复,不用自己写状态机。
第 22 章:可观测性
可观测性让你的系统像玻璃一样透明——用指标量化性能、用追踪定位瓶颈、用日志记录细节。
第 23 章:Token 预算控制
Token 预算是 Agent 系统的成本防火墙——它能大幅降低成本失控的概率,但不保证每次都精准;真正的保护来自多层防线的组合。
第 24 章:策略治理(OPA)
OPA 让 Agent 系统的权限控制从硬编码走向声明式——策略更新无需重新部署代码,但它不是万能的;真正的安全来自分层防御。
第 25 章:安全执行(WASI 沙箱)
WASI 让工具执行具备真正的沙箱隔离——默认无权限,只给必要的能力;但隔离不是万能的,它需要配合输入验证和输出审核才能形成完整防线。
第 26 章:多租户设计
多租户隔离不是“加个 WHERE 条件“就完事——它要求每一层数据访问都经过租户验证,一个遗漏就是一次数据泄露。
第 27 章:Deep Research
Deep Research 把“搜一下“升级成“研究一下“——不是搜得更多,而是像专业研究员一样思考、规划、验证、整合。
第 28 章:Computer Use
Computer Use 让 Agent 获得“眼睛“和“手“,像人一样看屏幕、点鼠标、敲键盘。这是突破 API 边界的终极武器——但也是最容易失控的能力,生产环境必须加沙箱和人工确认点。
第 29 章:Agentic Coding
Agentic Coding 不是代码补全的升级版,而是让 Agent 像开发者一样理解代码库、规划实现、编写代码、运行测试、修复 bug。它需要理解整个代码库的结构,而不只是当前文件——这是真正的“自主编程“,也是对沙箱安全的极致考验。
第 30 章:Background Agents
Background Agent 让任务脱离用户会话独立运行——定时调度、持续监控、故障自动恢复。这是 Agent 从“工具“进化到“员工“的关键一步,但也意味着失去实时人工监督,必须在设计时预埋足够的安全和预算控制。
第 31 章:分层模型策略
“分层路由能节省 80% 成本“——但前提是你能正确判断任务复杂度,这比听起来难得多。
第 32 章:OpenClaw 时代
本地 Agent Harness 的核心不是工具有多强大——而是循环有多可靠。你能让 Agent 在本地机器上跑 100 步不崩溃,比让它跑 10 步但第 11 步幻觉来比,有用得多。
第 33 章:Building on the Harness — ShanClaw
一个只能跑一个 Agent、一个 Session 的 Harness 是原型。一个能运行多个 Agent、跨 Session 记忆、服务多渠道的,才是平台。
附录 A:术语表(Terminology Glossary)
本附录帮助你快速查找关键术语,理解中英对照和技术概念。按字母顺序组织,包含定义、相关章节和实际示例。
附录 B:模式选择指南(Pattern Selection Guide)
本附录帮助你快速决定「什么场景用什么模式」,避免过度设计或选错工具。
附录 C:常见问题 FAQ
本附录汇集了读者最常问的问题,帮你快速解惑。