返回博客列表

斯坦福CS329A:从AI工具到自主智能体的完整路线图

2026-08-15T06:00:00+08:00
StanfordCS329ASelf-Improving AIAgentAGIRLTest-time Compute

斯坦福 CS329A:从 AI 工具到自主智能体的完整路线图

看完你会发现,你之前的理解可能要更新了。

斯坦福 CS329A 不是一门普通的 AI 课程。它的全名是 Self-Improving AI Agents(自我改进的 AI Agent),2025 年秋季学期开课,讲师是 Aakanksha Chowdhery 和 Azalia Mirhoseini——两位都是 Google DeepMind 的核心研究员。

课程描述只有一句:「AI agents that can continuously improve themselves through interaction with themselves and the environment.」(能通过与自身和环境的交互持续自我改进的 AI Agent。)

这句话翻译成大白话:当 AI 学会了自我改进、学会在推理时「多想一会儿」、学会从自己的错误中学习——我们离 AGI 的距离,可能比想象的更近。

好消息是:所有 lecture slides 和 reading list 都公开。 课程主页、YouTube、B站都有完整资源。

本文提纲

  1. 为什么这门课是 AGI 路线图
  2. 20 讲课表:从推理时计算到自我进化
  3. 六大主题模块拆解
  4. 6 位顶级 guest lecturer
  5. 核心论文清单:30+ 篇前沿研究
  6. 这门课和我们之前讨论的关系
  7. 怎么自学这门课

为什么这门课是 AGI 路线图

普通 AI 课程教你「AI 能做什么」。这门课教你「AI 怎么让自己变得更好」。

区别是根本性的。当前的 LLM 是静态的——训练完就不变了,能力锁死在训练截止的那一刻。自我改进的 Agent 是动态的——它能通过推理时多花时间想、通过验证自己的答案、通过从错误中学习来持续变强。

这两个能力——推理时扩展(test-time scaling)训练时自我提升(train-time self-improvement)——是当前 AI 研究最前沿的两个方向。CS329A 把这两个方向串成了一条完整路径:

推理时多想 → 验证答案对不对 → 从错误中学习 → 强化学习训练 → 
多步推理规划 → 开放式自我进化 → 更强的推理 → 循环

这条路径的终点是:AI 能自己设计更好的 AI。这不是科幻——课程第 7 讲的标题就叫「Open-Ended Evolution of Self-Improving Agents」,阅读论文里有「The AI Scientist」(AI 科学家)和「AlphaEvolve」(Google 用 Gemini 自动设计算法)。

20 讲课表:从推理时计算到自我进化

# 日期 主题 核心论文
1 9/22 课程概览
2 9/26 推理时计算扩展 Large Language Monkeys, Archon, Scaling Test-Time Compute
3 9/29 鲁棒验证 Weak Verifiers, Let's Verify Step by Step, Math-Shepherd
4 10/3 从反馈中学习(工具/代码) ReAct, RLEF, Constitutional AI
5 10/6 多步推理与规划 SWiRL, LATS, SPRINT, ADaPT
6 10/10 训练时扩展/RL STaR, DeepSeekMath, DAPO
7 10/13 自我改进 Agent 的开放式进化 Automated Agentic Design, AI Scientist, AlphaEvolve
8 10/17 搜索与深度研究 Agent AlphaCode, AlphaCode 2, Search-o1
9 10/20 Guest: Melvin Johnson (Google DeepMind) Post-training 从聊天到 Agent 的演化
10-12 10/24-31 期中项目展示
13 11/3 软件工程 Agent 框架 CodeMonkeys, KernelBench, LLM Optimizers
14 11/7 Agent 记忆增强 Cartridges, MemGPT, CacheBlend
15 11/10 Guest: Denny Zhou (Google DeepMind) LLM 推理
16 11/14 Guest: Thang Luong (Google DeepMind) AlphaProof, AlphaGeometry, IMO 金牌
17 11/17 Agent 评测与长时任务 Measuring AI Ability, GDPVal, DeepScholar-Bench
18 11/21 Guest: Misha Laskin (Reflection AI) 构建 Agent 自主系统
19 12/1 Guest: Danny Driess (Physical Intelligence) 机器人中的多模态 AI Agent
20 12/5 未来研究方向

这 20 讲的排列顺序本身就是一条路线图:从「让 AI 在推理时多想一会儿」开始,经过验证、反馈、规划、RL 训练、自我进化,最后到「未来研究方向」。这不是随机排列——是按照技术依赖关系编排的:先有验证能力才能从错误中学习,先有推理能力才能做规划,先有规划能力才能做开放式进化。

六大主题模块拆解

模块一:推理时计算扩展(Lecture 2-3)

核心问题: 怎么让 AI 在不重新训练的情况下变聪明?

答案: 让它多想一会儿。

三篇论文三个角度:

  • Large Language Monkeys:重复采样——同一个问题让 AI 回答 N 次,取最好的。暴力但有效。
  • Scaling Test-Time Compute(Snell et al., 2024):关键发现——推理时多花计算量,效果可以等价于扩大模型参数 14 倍。也就是说:小模型 + 多推理 > 大模型 + 少推理。
  • Archon:自动搜索最优的推理时技术组合——不是手动选一种,是自动搜索最优组合。

验证(Lecture 3): AI 想完了,怎么知道对不对?Let's Verify Step by Step(Lightman et al., 2023)的方法是:不验证最终答案,验证每一步推理过程。训练一个验证器逐步打分,哪步错了哪步重来。Math-Shepherd 做到了不需要人工标注——用模型自己生成验证信号。

模块二:从反馈中学习(Lecture 4-6)

核心问题: AI 怎么从自己的错误中学习?

ReAct(Lecture 4): 推理(Reason)+ 行动(Act)交替进行——想一步,做一步,看结果,再想下一步。这是 Agent 的基本循环(我们在上一篇 Agent 大白话文章里详细拆解过)。

Constitutional AI(Lecture 4): AI 用自己的反馈训练自己——不靠人类标注,AI 自己判断自己的输出好不好,用这个判断做 RLHF。这就是 Anthropic 的 Constitutional AI 方法。

训练时 RL(Lecture 6): STaR(Self-Taught Reasoner)——AI 先自己推理,推理对了就当作训练数据强化自己,错了就用正确答案修正后重新推理。DeepSeekMath 和 DAPO 把这个方法推到了大规模——DAPO 是开源的大规模 RL 系统。

模块三:多步推理与规划(Lecture 5)

核心问题: 复杂任务怎么拆步骤?

  • LATS(Language Agent Tree Search):把树搜索和 LLM 推理结合——不是线性地一步一步走,是同时探索多条路径,选最优的。
  • SPRINT:交错规划和并行执行——先规划,能并行的步骤同时跑。
  • ADaPT:按需分解——不预先规划全部步骤,执行中发现某步太复杂再动态分解。

模块四:自我进化(Lecture 7-8)

这是整门课的高潮。

Lecture 7 - 开放式进化:

  • Automated design of agentic systems:AI 自己设计 Agent 系统——不是人设计 Agent 架构,是 AI 搜索最优架构。
  • The AI Scientist:AI 做科学研究——从提出假设、设计实验、写论文,全自动。
  • AlphaEvolve:Google 用 Gemini 驱动的编码 Agent 自动设计先进算法——进化出了人类没发现过的排序算法优化。

Lecture 8 - 搜索与深度研究:

  • AlphaCode / AlphaCode 2:竞赛级代码生成——不是写业务代码,是解算法竞赛题。
  • Search-o1:把搜索能力嵌入推理模型——Agent 在推理过程中主动搜索外部信息。

模块五:Agent 工程实践(Lecture 13-14, 17)

软件工程 Agent(Lecture 13):

  • CodeMonkeys:把推理时计算扩展应用到软件工程——不只是写代码,是反复试错优化代码。
  • KernelBench:让 LLM 写 GPU Kernel——测试 AI 能不能写出高效的并行计算代码。
  • LLM Optimizers:用 Agent-System 接口优化并行程序性能。

记忆(Lecture 14,Guest: Junchen Jiang, UChicago):

  • MemGPT:把 LLM 当操作系统——内存管理、上下文分页、虚拟上下文。
  • Cartridges:长上下文的轻量表示——不把所有历史塞进上下文窗口,压缩成「记忆胶囊」。
  • CacheBlend:RAG + 缓存知识融合——已有缓存知识和新检索知识的智能融合。

评测(Lecture 17):

  • Measuring AI Ability to Complete Long Tasks:AI 能完成多长的任务?从 30 秒任务到 8 小时任务的能力曲线。
  • GDPVal:评估 AI 在真实有经济价值的任务上的表现。
  • DeepScholar-Bench:学术研究综合评测——AI 能做文献综述吗?

模块六:Guest Lecture(Lecture 9, 15-16, 18-19)

6 位 guest lecturer 全部来自顶级实验室:

讲者 所属机构 主题
Melvin Johnson Google DeepMind Post-training 从聊天到 Agent 的演化
Denny Zhou Google DeepMind LLM 推理
Thang Luong Google DeepMind AlphaProof, AlphaGeometry, IMO 金牌
Junchen Jiang UChicago / LMCache Agent 记忆
Misha Laskin Reflection AI 构建 Agent 自主系统
Danny Driess Physical Intelligence 机器人中的多模态 AI Agent

6 位里 3 位来自 Google DeepMind,1 位学术界,1 位创业公司(Reflection AI),1 位机器人公司(Physical Intelligence)。覆盖了从理论到产品到硬件的完整谱系。

核心论文清单:30+ 篇前沿研究

课程的 reading list 按主题排列,每讲 2-4 篇。我把最重要的论文按主题归类:

推理时扩展:

  • Scaling LLM Test-Time Compute Optimally (Snell et al., 2024) — 小模型+多推理 > 大模型+少推理
  • Large Language Monkeys — 重复采样暴力有效
  • Let's Verify Step by Step (Lightman et al., 2023) — 逐步验证而非端到端
  • Math-Shepherd — 无人工标注的逐步验证

Agent 基础:

  • ReAct (Yao et al., 2022) — 推理+行动交替
  • Constitutional AI — AI 自我反馈训练
  • Language Agent Tree Search (Zhou et al., 2023) — 树搜索+LLM

自我改进与进化:

  • STaR (Zelikman et al., 2022) — 自举推理
  • Automated design of agentic systems — AI 设计 AI
  • The AI Scientist (Lu et al., 2024) — 全自动科学发现
  • AlphaEvolve — Gemini 驱动的算法进化

编码 Agent:

  • AlphaCode / AlphaCode 2 — 竞赛级代码生成
  • CodeMonkeys — SE 的推理时计算扩展
  • KernelBench — GPU Kernel 生成

记忆与上下文:

  • MemGPT — LLM 即操作系统
  • Cartridges — 长上下文记忆胶囊
  • CacheBlend — RAG 缓存融合

评测:

  • Measuring AI Ability to Complete Long Tasks — 任务长度能力曲线
  • GDPVal — 经济价值任务评测
  • DeepScholar-Bench — 学术研究评测

这门课和我们之前讨论的关系

CS329A 的课表和我们这几个月写的文章有着惊人的呼应:

CS329A 主题 我们的文章 关联
ReAct Loop Agent 大白话 ReAct 是 Agent 的核心循环
Constitutional AI Anthropic 系列 AI 自我反馈训练的起源
Agent 评测 HarnessEval-W 评测本身变成 Agent 任务
软件工程 Agent Codex 平台、Claude Code Agent 从写代码到设计系统
Agent 记忆 Apache Maka Log is the Runtime + 上下文压缩
多步推理规划 DeepSeek Harness Plan + ReAct Loop
自我进化 AI 时代程序员的未来 程序员角色变成 AI 训练师
Test-time Compute DeepSeek V4 Pro 三档推理强度 = 推理时计算扩展

这不是巧合。CS329A 的课表是学术界对 Agent 技术全景的系统性梳理,我们的文章是工业实践的前沿观察。两者交叉验证了同一个趋势:AI 正在从「被动工具」变成「主动智能体」。

怎么自学这门课

资源全公开:

自学路径建议:

  1. 先读 Lecture 1 slides 理解课程框架
  2. Lecture 2-3(推理时扩展+验证) 是入口——这两讲的技术已经可以立刻用
  3. Lecture 4-6(反馈学习+RL) 是核心——理解了这三讲,Agent 自我改进的原理就通了
  4. Lecture 7-8(自我进化) 是高潮——这是离 AGI 最近的公开研究
  5. Guest Lectures 按兴趣选看——Denny Zhou 讲 LLM 推理和 Thang Luong 讲 AlphaProof 最推荐
  6. 论文按需读——每讲选一篇精读,不用全读

课程评分标准也公开了:3 个 Homework(50%)+ 期末项目(35%)+ 期中展示(10%)+ Poster(5%)。Homework 10 月 3 日开始发布。虽然你不能提交作业拿学分,但题目本身是最好的学习材料。

参考文档与链接

你会自学这门课吗?最感兴趣哪个模块?评论区聊聊。觉得有用点个赞让更多人看到。


作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友