斯坦福CS329A:从AI工具到自主智能体的完整路线图
斯坦福 CS329A:从 AI 工具到自主智能体的完整路线图
看完你会发现,你之前的理解可能要更新了。
斯坦福 CS329A 不是一门普通的 AI 课程。它的全名是 Self-Improving AI Agents(自我改进的 AI Agent),2025 年秋季学期开课,讲师是 Aakanksha Chowdhery 和 Azalia Mirhoseini——两位都是 Google DeepMind 的核心研究员。
课程描述只有一句:「AI agents that can continuously improve themselves through interaction with themselves and the environment.」(能通过与自身和环境的交互持续自我改进的 AI Agent。)
这句话翻译成大白话:当 AI 学会了自我改进、学会在推理时「多想一会儿」、学会从自己的错误中学习——我们离 AGI 的距离,可能比想象的更近。
好消息是:所有 lecture slides 和 reading list 都公开。 课程主页、YouTube、B站都有完整资源。
本文提纲
- 为什么这门课是 AGI 路线图
- 20 讲课表:从推理时计算到自我进化
- 六大主题模块拆解
- 6 位顶级 guest lecturer
- 核心论文清单:30+ 篇前沿研究
- 这门课和我们之前讨论的关系
- 怎么自学这门课
为什么这门课是 AGI 路线图
普通 AI 课程教你「AI 能做什么」。这门课教你「AI 怎么让自己变得更好」。
区别是根本性的。当前的 LLM 是静态的——训练完就不变了,能力锁死在训练截止的那一刻。自我改进的 Agent 是动态的——它能通过推理时多花时间想、通过验证自己的答案、通过从错误中学习来持续变强。
这两个能力——推理时扩展(test-time scaling)和训练时自我提升(train-time self-improvement)——是当前 AI 研究最前沿的两个方向。CS329A 把这两个方向串成了一条完整路径:
推理时多想 → 验证答案对不对 → 从错误中学习 → 强化学习训练 →
多步推理规划 → 开放式自我进化 → 更强的推理 → 循环这条路径的终点是:AI 能自己设计更好的 AI。这不是科幻——课程第 7 讲的标题就叫「Open-Ended Evolution of Self-Improving Agents」,阅读论文里有「The AI Scientist」(AI 科学家)和「AlphaEvolve」(Google 用 Gemini 自动设计算法)。
20 讲课表:从推理时计算到自我进化
| # | 日期 | 主题 | 核心论文 |
|---|---|---|---|
| 1 | 9/22 | 课程概览 | — |
| 2 | 9/26 | 推理时计算扩展 | Large Language Monkeys, Archon, Scaling Test-Time Compute |
| 3 | 9/29 | 鲁棒验证 | Weak Verifiers, Let's Verify Step by Step, Math-Shepherd |
| 4 | 10/3 | 从反馈中学习(工具/代码) | ReAct, RLEF, Constitutional AI |
| 5 | 10/6 | 多步推理与规划 | SWiRL, LATS, SPRINT, ADaPT |
| 6 | 10/10 | 训练时扩展/RL | STaR, DeepSeekMath, DAPO |
| 7 | 10/13 | 自我改进 Agent 的开放式进化 | Automated Agentic Design, AI Scientist, AlphaEvolve |
| 8 | 10/17 | 搜索与深度研究 Agent | AlphaCode, AlphaCode 2, Search-o1 |
| 9 | 10/20 | Guest: Melvin Johnson (Google DeepMind) | Post-training 从聊天到 Agent 的演化 |
| 10-12 | 10/24-31 | 期中项目展示 | — |
| 13 | 11/3 | 软件工程 Agent 框架 | CodeMonkeys, KernelBench, LLM Optimizers |
| 14 | 11/7 | Agent 记忆增强 | Cartridges, MemGPT, CacheBlend |
| 15 | 11/10 | Guest: Denny Zhou (Google DeepMind) | LLM 推理 |
| 16 | 11/14 | Guest: Thang Luong (Google DeepMind) | AlphaProof, AlphaGeometry, IMO 金牌 |
| 17 | 11/17 | Agent 评测与长时任务 | Measuring AI Ability, GDPVal, DeepScholar-Bench |
| 18 | 11/21 | Guest: Misha Laskin (Reflection AI) | 构建 Agent 自主系统 |
| 19 | 12/1 | Guest: Danny Driess (Physical Intelligence) | 机器人中的多模态 AI Agent |
| 20 | 12/5 | 未来研究方向 | — |
这 20 讲的排列顺序本身就是一条路线图:从「让 AI 在推理时多想一会儿」开始,经过验证、反馈、规划、RL 训练、自我进化,最后到「未来研究方向」。这不是随机排列——是按照技术依赖关系编排的:先有验证能力才能从错误中学习,先有推理能力才能做规划,先有规划能力才能做开放式进化。
六大主题模块拆解
模块一:推理时计算扩展(Lecture 2-3)
核心问题: 怎么让 AI 在不重新训练的情况下变聪明?
答案: 让它多想一会儿。
三篇论文三个角度:
- Large Language Monkeys:重复采样——同一个问题让 AI 回答 N 次,取最好的。暴力但有效。
- Scaling Test-Time Compute(Snell et al., 2024):关键发现——推理时多花计算量,效果可以等价于扩大模型参数 14 倍。也就是说:小模型 + 多推理 > 大模型 + 少推理。
- Archon:自动搜索最优的推理时技术组合——不是手动选一种,是自动搜索最优组合。
验证(Lecture 3): AI 想完了,怎么知道对不对?Let's Verify Step by Step(Lightman et al., 2023)的方法是:不验证最终答案,验证每一步推理过程。训练一个验证器逐步打分,哪步错了哪步重来。Math-Shepherd 做到了不需要人工标注——用模型自己生成验证信号。
模块二:从反馈中学习(Lecture 4-6)
核心问题: AI 怎么从自己的错误中学习?
ReAct(Lecture 4): 推理(Reason)+ 行动(Act)交替进行——想一步,做一步,看结果,再想下一步。这是 Agent 的基本循环(我们在上一篇 Agent 大白话文章里详细拆解过)。
Constitutional AI(Lecture 4): AI 用自己的反馈训练自己——不靠人类标注,AI 自己判断自己的输出好不好,用这个判断做 RLHF。这就是 Anthropic 的 Constitutional AI 方法。
训练时 RL(Lecture 6): STaR(Self-Taught Reasoner)——AI 先自己推理,推理对了就当作训练数据强化自己,错了就用正确答案修正后重新推理。DeepSeekMath 和 DAPO 把这个方法推到了大规模——DAPO 是开源的大规模 RL 系统。
模块三:多步推理与规划(Lecture 5)
核心问题: 复杂任务怎么拆步骤?
- LATS(Language Agent Tree Search):把树搜索和 LLM 推理结合——不是线性地一步一步走,是同时探索多条路径,选最优的。
- SPRINT:交错规划和并行执行——先规划,能并行的步骤同时跑。
- ADaPT:按需分解——不预先规划全部步骤,执行中发现某步太复杂再动态分解。
模块四:自我进化(Lecture 7-8)
这是整门课的高潮。
Lecture 7 - 开放式进化:
- Automated design of agentic systems:AI 自己设计 Agent 系统——不是人设计 Agent 架构,是 AI 搜索最优架构。
- The AI Scientist:AI 做科学研究——从提出假设、设计实验、写论文,全自动。
- AlphaEvolve:Google 用 Gemini 驱动的编码 Agent 自动设计先进算法——进化出了人类没发现过的排序算法优化。
Lecture 8 - 搜索与深度研究:
- AlphaCode / AlphaCode 2:竞赛级代码生成——不是写业务代码,是解算法竞赛题。
- Search-o1:把搜索能力嵌入推理模型——Agent 在推理过程中主动搜索外部信息。
模块五:Agent 工程实践(Lecture 13-14, 17)
软件工程 Agent(Lecture 13):
- CodeMonkeys:把推理时计算扩展应用到软件工程——不只是写代码,是反复试错优化代码。
- KernelBench:让 LLM 写 GPU Kernel——测试 AI 能不能写出高效的并行计算代码。
- LLM Optimizers:用 Agent-System 接口优化并行程序性能。
记忆(Lecture 14,Guest: Junchen Jiang, UChicago):
- MemGPT:把 LLM 当操作系统——内存管理、上下文分页、虚拟上下文。
- Cartridges:长上下文的轻量表示——不把所有历史塞进上下文窗口,压缩成「记忆胶囊」。
- CacheBlend:RAG + 缓存知识融合——已有缓存知识和新检索知识的智能融合。
评测(Lecture 17):
- Measuring AI Ability to Complete Long Tasks:AI 能完成多长的任务?从 30 秒任务到 8 小时任务的能力曲线。
- GDPVal:评估 AI 在真实有经济价值的任务上的表现。
- DeepScholar-Bench:学术研究综合评测——AI 能做文献综述吗?
模块六:Guest Lecture(Lecture 9, 15-16, 18-19)
6 位 guest lecturer 全部来自顶级实验室:
| 讲者 | 所属机构 | 主题 |
|---|---|---|
| Melvin Johnson | Google DeepMind | Post-training 从聊天到 Agent 的演化 |
| Denny Zhou | Google DeepMind | LLM 推理 |
| Thang Luong | Google DeepMind | AlphaProof, AlphaGeometry, IMO 金牌 |
| Junchen Jiang | UChicago / LMCache | Agent 记忆 |
| Misha Laskin | Reflection AI | 构建 Agent 自主系统 |
| Danny Driess | Physical Intelligence | 机器人中的多模态 AI Agent |
6 位里 3 位来自 Google DeepMind,1 位学术界,1 位创业公司(Reflection AI),1 位机器人公司(Physical Intelligence)。覆盖了从理论到产品到硬件的完整谱系。
核心论文清单:30+ 篇前沿研究
课程的 reading list 按主题排列,每讲 2-4 篇。我把最重要的论文按主题归类:
推理时扩展:
- Scaling LLM Test-Time Compute Optimally (Snell et al., 2024) — 小模型+多推理 > 大模型+少推理
- Large Language Monkeys — 重复采样暴力有效
- Let's Verify Step by Step (Lightman et al., 2023) — 逐步验证而非端到端
- Math-Shepherd — 无人工标注的逐步验证
Agent 基础:
- ReAct (Yao et al., 2022) — 推理+行动交替
- Constitutional AI — AI 自我反馈训练
- Language Agent Tree Search (Zhou et al., 2023) — 树搜索+LLM
自我改进与进化:
- STaR (Zelikman et al., 2022) — 自举推理
- Automated design of agentic systems — AI 设计 AI
- The AI Scientist (Lu et al., 2024) — 全自动科学发现
- AlphaEvolve — Gemini 驱动的算法进化
编码 Agent:
- AlphaCode / AlphaCode 2 — 竞赛级代码生成
- CodeMonkeys — SE 的推理时计算扩展
- KernelBench — GPU Kernel 生成
记忆与上下文:
- MemGPT — LLM 即操作系统
- Cartridges — 长上下文记忆胶囊
- CacheBlend — RAG 缓存融合
评测:
- Measuring AI Ability to Complete Long Tasks — 任务长度能力曲线
- GDPVal — 经济价值任务评测
- DeepScholar-Bench — 学术研究评测
这门课和我们之前讨论的关系
CS329A 的课表和我们这几个月写的文章有着惊人的呼应:
| CS329A 主题 | 我们的文章 | 关联 |
|---|---|---|
| ReAct Loop | Agent 大白话 | ReAct 是 Agent 的核心循环 |
| Constitutional AI | Anthropic 系列 | AI 自我反馈训练的起源 |
| Agent 评测 | HarnessEval-W | 评测本身变成 Agent 任务 |
| 软件工程 Agent | Codex 平台、Claude Code | Agent 从写代码到设计系统 |
| Agent 记忆 | Apache Maka | Log is the Runtime + 上下文压缩 |
| 多步推理规划 | DeepSeek Harness | Plan + ReAct Loop |
| 自我进化 | AI 时代程序员的未来 | 程序员角色变成 AI 训练师 |
| Test-time Compute | DeepSeek V4 Pro | 三档推理强度 = 推理时计算扩展 |
这不是巧合。CS329A 的课表是学术界对 Agent 技术全景的系统性梳理,我们的文章是工业实践的前沿观察。两者交叉验证了同一个趋势:AI 正在从「被动工具」变成「主动智能体」。
怎么自学这门课
资源全公开:
- 课程主页:https://cs329a.stanford.edu/ — 完整课表、论文清单、slides
- YouTube:https://www.youtube.com/playlist?list=PLangBM27OtEA — 完整视频
- B站:https://www.bilibili.com/video/BV1J9uA6KEZV — 中文搬运
自学路径建议:
- 先读 Lecture 1 slides 理解课程框架
- Lecture 2-3(推理时扩展+验证) 是入口——这两讲的技术已经可以立刻用
- Lecture 4-6(反馈学习+RL) 是核心——理解了这三讲,Agent 自我改进的原理就通了
- Lecture 7-8(自我进化) 是高潮——这是离 AGI 最近的公开研究
- Guest Lectures 按兴趣选看——Denny Zhou 讲 LLM 推理和 Thang Luong 讲 AlphaProof 最推荐
- 论文按需读——每讲选一篇精读,不用全读
课程评分标准也公开了:3 个 Homework(50%)+ 期末项目(35%)+ 期中展示(10%)+ Poster(5%)。Homework 10 月 3 日开始发布。虽然你不能提交作业拿学分,但题目本身是最好的学习材料。
参考文档与链接
- Stanford CS329A 课程主页 — 完整课表、论文清单、slides
- YouTube 视频列表 — 完整讲座视频
- B站视频地址 — 中文搬运
- Scaling Test-Time Compute (Snell et al., 2024) — 推理时扩展的核心论文
- Let's Verify Step by Step (Lightman et al., 2023) — 逐步验证
- ReAct (Yao et al., 2022) — Agent 基础循环
- The AI Scientist (Lu et al., 2024) — 全自动科学发现
- MemGPT (Packer et al., 2023) — LLM 即操作系统
你会自学这门课吗?最感兴趣哪个模块?评论区聊聊。觉得有用点个赞让更多人看到。
作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
本文首发于 AI人工智能时代,转载请注明出处。