Agent RSI 火了:RSIAgent 让开源模型免训练超越 GPT-6,凭什么
Agent RSI 火了:RSIAgent 让开源模型免训练超越 GPT-6,凭什么
"递归自进化"这个词,最近密集出现,这次是真的有东西落地了。
9 月中,一个叫 RSIAgent 的项目同时冲上 Hugging Face Daily Papers 第 6 位、被机器之心头条报道(微信阅读 40K+)。它的卖点极其抓人:完全不动模型权重,靠一套"探索→验证→记忆"的循环,就让开源模型 Kimi-K3 和 GLM-5.3 在 OSWorld 2.0 和 Agents' Last Exam 上超过了 GPT-6 Astra 这样的闭源旗舰。
这意味着什么?"换更强的模型才能更强"这条铁律,至少在某些场景下可以被绕开——用便宜的模型 + 好的"经验积累机制",也能打赢贵模型。这篇文章把 RSI 这个概念讲清楚,再深挖 RSIAgent 具体怎么做到的,以及它有没有水分。
本文提纲
- RSI 是什么:Agent 的"递归自进化"火在哪
- RSI 的技术谱系:从 Self-Refine 到 AlphaEvolve
- RSIAgent 三智能体框架
- 广深两阶段探索:BRS 与 DRS
- 测试时冻结记忆复用
- 实验数据:开源模型如何超过闭源
- 水分与局限:RSI 的三种失败模式
RSI 是什么:Agent 的"递归自进化"火在哪
RSI(Recursive Self-Improvement,递归自我改进)不是一个新概念,但它在 2026 年突然变得格外热。原因在于:Agent 的"自进化"研究正在从早期的"改一次输出",快速转向真正的闭环系统——Agent 不仅修改一次性输出,还修改自身的记忆、上下文、工具调用策略、工作流、评估器,甚至代码化的 Agent 架构。
严格意义上的 RSI,指系统能够持续自我改进的能力。而它最核心、也最容易引发争议的点是:每个自改进循环,本质上都在声称"某种评估信号可以替代人类判断"。 引用一篇 2026 年 RSI 综述里的关键判断:
RSI 的技术瓶颈往往不是"能否生成修改",而是"能否可靠判断修改是否真正改进"。
这个观点是理解整个 RSI 领域的钥匙。后文 RSIAgent 的所有设计,本质都是在回答"如何可靠地判断改进"。
RSI 的技术谱系:从 Self-Refine 到 AlphaEvolve
要把 RSIAgent 放进坐标系,先看 RSI 的演进脉络(参考这篇详尽的博客园综述)。研究大致分五个层级,越往上"进化对象"越靠近系统结构,收益越大、风险也越高:
第一层:输出级自修正。 Self-Refine(2023)让同一 LLM 扮演生成者、反馈者、改写者,不训练地迭代优化输出,报告在 7 类任务上平均约 20% 绝对提升。Reflexion 把反馈固化成情景记忆,在 HumanEval 等任务显著提升。这一层的局限是改进只作用于当前输出,长期资产积累有限。
第二层:记忆与上下文自进化。 Voyager(2023)在 Minecraft 里用自动课程 + 可执行技能库做具身终身学习,把技能存成可执行代码,经验因此可组合、可迁移。ACE(2025)把上下文当作可演化的 playbook,报告在 Agent 与金融基准上分别提升 10.6% 和 8.6%。ALMA(2026)更进一步,让 Meta Agent 自动搜索记忆模块的 schema、检索和更新机制——"未来 Agent 的核心差异化可能不是记住什么,而是自动发现怎样记、何时忘、如何检索"。
第三层:工作流与脚手架自优化。 STOP(2023/2024)用一个语言模型驱动的 scaffolding 程序改进任意输入程序,再递归地改进自身。GPTSwarm 把 Agent 形式化为可优化计算图。AFlow 用 MCTS 搜索代码化工作流,报告六基准平均提升 5.7%。RHI(2026)把 harness 当作可迭代改进的 Agent loop 规范。
第四层:自奖励与自课程。 Self-Rewarding LM(2024)用 LLM-as-a-Judge 自我奖励 + Iterative DPO。Agent0(2025)构建课程 Agent 与执行 Agent 的共演化闭环——课程 Agent 生成更难任务,执行 Agent 学会求解,反过来倒逼更复杂任务,报告 Qwen3-8B-Base 数学推理提升 18%、通用推理提升 24%。
第五层:自动科研与算法发现。 最激进也最需要治理的一层。The AI Scientist 试图自动化整个 ML 研究生命周期。AlphaEvolve(2025,Google DeepMind)用进化式 coding agent 持续改进算法代码,优化了数据中心调度、芯片设计,还发现了新的可证明算法(包括 4x4 复数矩阵乘法改进)。DGM(Darwin Gödel Machine,2025)让系统维护生成的 coding agents archive,报告 SWE-bench 从 20.0% 提升到 50.0%。
几个贯穿全谱系的规律(综述的核心提炼):
- 进化对象在上移:从输出 → prompt → 记忆 → 工作流 → harness → Agent 代码 → 评估器。越靠近系统结构层,收益越大,验证成本越高。
- 反馈信号决定天花板:可执行测试、形式化验证器、真实环境 reward,比 LLM 自评可靠得多。
- 持久资产需要选择门控:长期积累不是无条件写入,RSEA(2026)证明未门控的上下文进化会崩塌。
RSIAgent 三智能体框架
现在看 RSIAgent 具体怎么做。它的定位是 training-free(免训练)多智能体框架,用于在新数字环境里做递归自我改进。核心思路一句话:让 Agent 自己探索环境是怎么工作的、用真实执行检验学到的东西、把可复用知识存进持久记忆——全程不更新模型参数。
三智能体各司其职:
- Curriculum Agent(课程 Agent):根据先前结果和积累的知识,选择有信息量的探索任务,并判断继续练习还有没有用。它是"下一步学什么"的决策者。
- Actor Agent(执行 Agent):通过可执行的 Python/Bash 程序和视觉观察与软件交互。验证通过后,由它自己提炼经验,并与已有记忆调和。
- Verifier Agent(验证 Agent):独立检查任务要求和最终环境状态。它的反馈是学习的 grounding(落地点)——但它读不到 Actor Agent 的私有推理和记忆。
这个分工有讲究:生成者(Actor)和验证者(Verifier)刻意分离——这正是综述里"反共谋设计"的体现,避免同源偏差自我强化。
广深两阶段探索:BRS 与 DRS
RSIAgent 的核心策略是 broad-then-deep exploration(先广后深探索),分两个阶段:
Stage-1:Broad Recursive Self-exploration(广谱递归自探索,BRS) Curriculum Agent 提出多样的项目。多个 Actor Agent 并行执行、多个 Verifier Agent 并行检查,共享同一个起点记忆。一整波完成后,Actor Agents 按顺序整合经验。这个阶段的目标是发现环境的多样结构——先广泛接触,攒下大量不同经验。
Stage-2:Deep Recursive Self-exploration(深度递归自探索,DRS) 目标尝试暴露出缺口和脆弱成功。Curriculum Agent 选择聚焦练习;每条验证过的经验在后续练习或下一次目标尝试前更新记忆。这个阶段的目标是挖掘难例、隐藏约束、边界条件、以及之前未知的因果依赖。
论文把它表述为"Agentic Causal Discovery"——不只是记住"怎么做",而是保留"动作-条件-后果"之间的可复用因果关系。
graph TB
subgraph "Phase 1: Broad RSI"
A1[Curriculum proposes diverse projects] --> B1[Actors execute in parallel]
B1 --> C1[Verifiers check in parallel]
C1 --> D1[Actors consolidate experiences]
end
subgraph "Phase 2: Deep RSI"
A2[Target attempts reveal gaps] --> B2[Curriculum selects focused practice]
B2 --> C2[Each verified experience updates memory]
C2 --> D2[Next practice or target attempt]
end
subgraph "Phase 3: Test-time reuse"
A3[Frozen memory guides execution] --> B3[Actor-Verifier action loop]
B3 --> C3[Sealed official evaluation]
end
D1 --> A2
D2 --> A3测试时冻结记忆复用
Phase 3 是最关键的设计:测试时记忆冻结,直接复用。
- RSI 和测试时执行用的是同一套 Agent 框架,模型参数全程固定。
- 测试时,Curriculum Agent 和记忆更新都被禁用,记忆以冻结状态被 Actor Agent 直接用来指导任务执行。
- Actor 通过和 RSI 阶段完全相同的"动作-验证"循环与 Verifier 交互,然后进行官方 sealed 评测。
这样设计的好处是:评估分数和"学习过程"严格隔离——官方 benchmark 分数被挡在学习循环之外,避免"考试时翻书"的作弊嫌疑。记忆是跨任务的持久学习状态,交互历史和任务环境在每次独立尝试之间重置,但 Agent 框架不变。成功的经验和失败的教训都能教东西——这正是"从失败中学习"被工程化的地方。
论文还给出一个关键约束:benchmark 的 setup 和 grading 都在学习过程之外,审计文件永远不进 Agent 的 prompt 或记忆。
实验数据:开源模型如何超过闭源
核心成果数据(论文报告的平均部分分,%):
| 基准 | RSIAgent 无 RSI | RSIAgent |
|---|---|---|
| OSWorld 2.0 · 0808 offline · 82 任务 | 71.97 | 78.98 |
| Agents' Last Exam · Near-term · 67 任务 | 83.75 | 84.82 |
机器之心头条的表述是:开源模型在挑战性 computer-use 基准上超越 GPT-6 Astra。具体来说,论文让 Kimi-K3 和 GLM-5.3 这两个强开源模型用上 RSIAgent 的探索记忆后,在 OSWorld 2.0(桌面/软件操作)和 Agents' Last Exam(近未来任务)上超过了 GPT-6 Astra 等闭源旗舰。
论文还报告了:
- 阶段消融:验证广/深两个阶段各自的贡献。
- 记忆增长:记忆如何随探索和整合不断积累。
- 游戏开发评估:在自主游戏开发场景的验证。
- 失败模式分析:找出改进的三个上限(见下节)。
需要注意的是 README 里关于聚合方式的诚实声明:RSI 列用了 41 条 OSWorld 记录和 19 条 ALE 记录,其他任务保留基线分数;包含部分重试和不同预算的 checkpoint,不是对匹配重复运行的平均。ALE 还包含合格的本地 regrade 和协议变体。这些说明分数对比不是严格受控的随机对照——但提升幅度仍然可观。
水分与局限:RSI 的三种失败模式
论文自己也做了失败模式分析,指出三个改进上限——这比结果本身更值得读:
- 练习可能错过相关弱点(Insufficiently Targeted Exploration)。探索练了一堆东西,但没练到真正拖后腿的那个能力。
- 验证可能接受不完整的工作(Incomplete Verification)。Verifier 说"通过",但其实任务只完成了一部分——验证器的判断力本身会成为瓶颈。
- 记忆可能保留错误的规则(Unreliable Memory Consolidation)。一条被验证过的"经验"其实是错的,却被写进记忆,之后持续误导。
这三点对应综述里反复强调的治理原则:探索质量、验证质量、记忆整合质量,和练习的量一样重要。 没有强验证的 RSI,很容易从"能力复利"变成"错误复利"。
另外几个现实约束:
- 基础设施门槛不低:要 Linux + Docker +
/dev/kvm+ 大块磁盘(ALE 的 Linux 镜像约 167GiB、Windows 约 157GiB)+ 模型 API(OpenRouter key)。VM 镜像和 benchmark 资产要单独下载。 - 这是研究性实现:README 明说 smoke 通过只验证运行时机制,复现 benchmark 分数需要完整实验。
- "超过 GPT-6"要看清前提:是在特定 computer-use 基准、特定任务子集、配合探索记忆后的结果,不是通用能力全面超越。闭源模型没有这套记忆机制去跑同一流程,这个对比本身不是完全公平的。
参考链接
- GitHub: AetherLabsAI/RSIAgent - 免训练多智能体 RSI 框架,Python,Apache-2.0,397 stars
- arXiv 论文 2609.15364 - RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
- RSI 综述:Agent 的 RSI 与 Self-Evolving Agents(博客园) - 从 Self-Refine 到 AlphaEvolve 的完整技术谱系与治理框架
- RSIAgent 官网 - 项目文档与框架图
- Hugging Face Daily Papers #6 (2026-09-15) - 论文上榜记录
- 机器之心头条报道 - 开源模型超越 GPT-6 Astra 的报道,微信阅读 40K+
- OSWorld-V2 - 桌面操作系统任务基准
- Agents' Last Exam - 近未来任务基准
"不动权重、靠经验积累打赢贵模型"这条路,你觉得是短期红利还是长期趋势?评论区聊聊你的判断,觉得有用点个赞让更多人看到 RSI 的门道。
作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
本文首发于 AI人工智能时代,转载请注明出处。