返回博客列表

Agent RSI 火了:RSIAgent 让开源模型免训练超越 GPT-6,凭什么

2026-09-22T16:30:00+08:00
RSIRSIAgent递归自进化AgentKimi-K3GLM-5.3开源模型

Agent RSI 火了:RSIAgent 让开源模型免训练超越 GPT-6,凭什么

"递归自进化"这个词,最近密集出现,这次是真的有东西落地了。

9 月中,一个叫 RSIAgent 的项目同时冲上 Hugging Face Daily Papers 第 6 位、被机器之心头条报道(微信阅读 40K+)。它的卖点极其抓人:完全不动模型权重,靠一套"探索→验证→记忆"的循环,就让开源模型 Kimi-K3 和 GLM-5.3 在 OSWorld 2.0 和 Agents' Last Exam 上超过了 GPT-6 Astra 这样的闭源旗舰。

这意味着什么?"换更强的模型才能更强"这条铁律,至少在某些场景下可以被绕开——用便宜的模型 + 好的"经验积累机制",也能打赢贵模型。这篇文章把 RSI 这个概念讲清楚,再深挖 RSIAgent 具体怎么做到的,以及它有没有水分。

本文提纲

  1. RSI 是什么:Agent 的"递归自进化"火在哪
  2. RSI 的技术谱系:从 Self-Refine 到 AlphaEvolve
  3. RSIAgent 三智能体框架
  4. 广深两阶段探索:BRS 与 DRS
  5. 测试时冻结记忆复用
  6. 实验数据:开源模型如何超过闭源
  7. 水分与局限:RSI 的三种失败模式

RSI 是什么:Agent 的"递归自进化"火在哪

RSI(Recursive Self-Improvement,递归自我改进)不是一个新概念,但它在 2026 年突然变得格外热。原因在于:Agent 的"自进化"研究正在从早期的"改一次输出",快速转向真正的闭环系统——Agent 不仅修改一次性输出,还修改自身的记忆、上下文、工具调用策略、工作流、评估器,甚至代码化的 Agent 架构。

严格意义上的 RSI,指系统能够持续自我改进的能力。而它最核心、也最容易引发争议的点是:每个自改进循环,本质上都在声称"某种评估信号可以替代人类判断"。 引用一篇 2026 年 RSI 综述里的关键判断:

RSI 的技术瓶颈往往不是"能否生成修改",而是"能否可靠判断修改是否真正改进"。

这个观点是理解整个 RSI 领域的钥匙。后文 RSIAgent 的所有设计,本质都是在回答"如何可靠地判断改进"。

RSI 的技术谱系:从 Self-Refine 到 AlphaEvolve

要把 RSIAgent 放进坐标系,先看 RSI 的演进脉络(参考这篇详尽的博客园综述)。研究大致分五个层级,越往上"进化对象"越靠近系统结构,收益越大、风险也越高:

第一层:输出级自修正。 Self-Refine(2023)让同一 LLM 扮演生成者、反馈者、改写者,不训练地迭代优化输出,报告在 7 类任务上平均约 20% 绝对提升。Reflexion 把反馈固化成情景记忆,在 HumanEval 等任务显著提升。这一层的局限是改进只作用于当前输出,长期资产积累有限。

第二层:记忆与上下文自进化。 Voyager(2023)在 Minecraft 里用自动课程 + 可执行技能库做具身终身学习,把技能存成可执行代码,经验因此可组合、可迁移。ACE(2025)把上下文当作可演化的 playbook,报告在 Agent 与金融基准上分别提升 10.6% 和 8.6%。ALMA(2026)更进一步,让 Meta Agent 自动搜索记忆模块的 schema、检索和更新机制——"未来 Agent 的核心差异化可能不是记住什么,而是自动发现怎样记、何时忘、如何检索"。

第三层:工作流与脚手架自优化。 STOP(2023/2024)用一个语言模型驱动的 scaffolding 程序改进任意输入程序,再递归地改进自身。GPTSwarm 把 Agent 形式化为可优化计算图。AFlow 用 MCTS 搜索代码化工作流,报告六基准平均提升 5.7%。RHI(2026)把 harness 当作可迭代改进的 Agent loop 规范。

第四层:自奖励与自课程。 Self-Rewarding LM(2024)用 LLM-as-a-Judge 自我奖励 + Iterative DPO。Agent0(2025)构建课程 Agent 与执行 Agent 的共演化闭环——课程 Agent 生成更难任务,执行 Agent 学会求解,反过来倒逼更复杂任务,报告 Qwen3-8B-Base 数学推理提升 18%、通用推理提升 24%。

第五层:自动科研与算法发现。 最激进也最需要治理的一层。The AI Scientist 试图自动化整个 ML 研究生命周期。AlphaEvolve(2025,Google DeepMind)用进化式 coding agent 持续改进算法代码,优化了数据中心调度、芯片设计,还发现了新的可证明算法(包括 4x4 复数矩阵乘法改进)。DGM(Darwin Gödel Machine,2025)让系统维护生成的 coding agents archive,报告 SWE-bench 从 20.0% 提升到 50.0%。

几个贯穿全谱系的规律(综述的核心提炼):

  • 进化对象在上移:从输出 → prompt → 记忆 → 工作流 → harness → Agent 代码 → 评估器。越靠近系统结构层,收益越大,验证成本越高。
  • 反馈信号决定天花板:可执行测试、形式化验证器、真实环境 reward,比 LLM 自评可靠得多。
  • 持久资产需要选择门控:长期积累不是无条件写入,RSEA(2026)证明未门控的上下文进化会崩塌。

RSIAgent 三智能体框架

现在看 RSIAgent 具体怎么做。它的定位是 training-free(免训练)多智能体框架,用于在新数字环境里做递归自我改进。核心思路一句话:让 Agent 自己探索环境是怎么工作的、用真实执行检验学到的东西、把可复用知识存进持久记忆——全程不更新模型参数。

三智能体各司其职:

  • Curriculum Agent(课程 Agent):根据先前结果和积累的知识,选择有信息量的探索任务,并判断继续练习还有没有用。它是"下一步学什么"的决策者。
  • Actor Agent(执行 Agent):通过可执行的 Python/Bash 程序和视觉观察与软件交互。验证通过后,由它自己提炼经验,并与已有记忆调和。
  • Verifier Agent(验证 Agent):独立检查任务要求和最终环境状态。它的反馈是学习的 grounding(落地点)——但它读不到 Actor Agent 的私有推理和记忆。

这个分工有讲究:生成者(Actor)和验证者(Verifier)刻意分离——这正是综述里"反共谋设计"的体现,避免同源偏差自我强化。

广深两阶段探索:BRS 与 DRS

RSIAgent 的核心策略是 broad-then-deep exploration(先广后深探索),分两个阶段:

Stage-1:Broad Recursive Self-exploration(广谱递归自探索,BRS) Curriculum Agent 提出多样的项目。多个 Actor Agent 并行执行、多个 Verifier Agent 并行检查,共享同一个起点记忆。一整波完成后,Actor Agents 按顺序整合经验。这个阶段的目标是发现环境的多样结构——先广泛接触,攒下大量不同经验。

Stage-2:Deep Recursive Self-exploration(深度递归自探索,DRS) 目标尝试暴露出缺口和脆弱成功。Curriculum Agent 选择聚焦练习;每条验证过的经验在后续练习或下一次目标尝试前更新记忆。这个阶段的目标是挖掘难例、隐藏约束、边界条件、以及之前未知的因果依赖

论文把它表述为"Agentic Causal Discovery"——不只是记住"怎么做",而是保留"动作-条件-后果"之间的可复用因果关系。

graph TB
    subgraph "Phase 1: Broad RSI"
        A1[Curriculum proposes diverse projects] --> B1[Actors execute in parallel]
        B1 --> C1[Verifiers check in parallel]
        C1 --> D1[Actors consolidate experiences]
    end
    subgraph "Phase 2: Deep RSI"
        A2[Target attempts reveal gaps] --> B2[Curriculum selects focused practice]
        B2 --> C2[Each verified experience updates memory]
        C2 --> D2[Next practice or target attempt]
    end
    subgraph "Phase 3: Test-time reuse"
        A3[Frozen memory guides execution] --> B3[Actor-Verifier action loop]
        B3 --> C3[Sealed official evaluation]
    end
    D1 --> A2
    D2 --> A3

测试时冻结记忆复用

Phase 3 是最关键的设计:测试时记忆冻结,直接复用。

  • RSI 和测试时执行用的是同一套 Agent 框架,模型参数全程固定。
  • 测试时,Curriculum Agent 和记忆更新都被禁用,记忆以冻结状态被 Actor Agent 直接用来指导任务执行。
  • Actor 通过和 RSI 阶段完全相同的"动作-验证"循环与 Verifier 交互,然后进行官方 sealed 评测。

这样设计的好处是:评估分数和"学习过程"严格隔离——官方 benchmark 分数被挡在学习循环之外,避免"考试时翻书"的作弊嫌疑。记忆是跨任务的持久学习状态,交互历史和任务环境在每次独立尝试之间重置,但 Agent 框架不变。成功的经验和失败的教训都能教东西——这正是"从失败中学习"被工程化的地方。

论文还给出一个关键约束:benchmark 的 setup 和 grading 都在学习过程之外,审计文件永远不进 Agent 的 prompt 或记忆。

实验数据:开源模型如何超过闭源

核心成果数据(论文报告的平均部分分,%):

基准 RSIAgent 无 RSI RSIAgent
OSWorld 2.0 · 0808 offline · 82 任务 71.97 78.98
Agents' Last Exam · Near-term · 67 任务 83.75 84.82

机器之心头条的表述是:开源模型在挑战性 computer-use 基准上超越 GPT-6 Astra。具体来说,论文让 Kimi-K3 和 GLM-5.3 这两个强开源模型用上 RSIAgent 的探索记忆后,在 OSWorld 2.0(桌面/软件操作)和 Agents' Last Exam(近未来任务)上超过了 GPT-6 Astra 等闭源旗舰。

论文还报告了:

  • 阶段消融:验证广/深两个阶段各自的贡献。
  • 记忆增长:记忆如何随探索和整合不断积累。
  • 游戏开发评估:在自主游戏开发场景的验证。
  • 失败模式分析:找出改进的三个上限(见下节)。

需要注意的是 README 里关于聚合方式的诚实声明:RSI 列用了 41 条 OSWorld 记录和 19 条 ALE 记录,其他任务保留基线分数;包含部分重试和不同预算的 checkpoint,不是对匹配重复运行的平均。ALE 还包含合格的本地 regrade 和协议变体。这些说明分数对比不是严格受控的随机对照——但提升幅度仍然可观。

水分与局限:RSI 的三种失败模式

论文自己也做了失败模式分析,指出三个改进上限——这比结果本身更值得读:

  1. 练习可能错过相关弱点(Insufficiently Targeted Exploration)。探索练了一堆东西,但没练到真正拖后腿的那个能力。
  2. 验证可能接受不完整的工作(Incomplete Verification)。Verifier 说"通过",但其实任务只完成了一部分——验证器的判断力本身会成为瓶颈。
  3. 记忆可能保留错误的规则(Unreliable Memory Consolidation)。一条被验证过的"经验"其实是错的,却被写进记忆,之后持续误导。

这三点对应综述里反复强调的治理原则:探索质量、验证质量、记忆整合质量,和练习的量一样重要。 没有强验证的 RSI,很容易从"能力复利"变成"错误复利"。

另外几个现实约束:

  • 基础设施门槛不低:要 Linux + Docker + /dev/kvm + 大块磁盘(ALE 的 Linux 镜像约 167GiB、Windows 约 157GiB)+ 模型 API(OpenRouter key)。VM 镜像和 benchmark 资产要单独下载。
  • 这是研究性实现:README 明说 smoke 通过只验证运行时机制,复现 benchmark 分数需要完整实验。
  • "超过 GPT-6"要看清前提:是在特定 computer-use 基准、特定任务子集、配合探索记忆后的结果,不是通用能力全面超越。闭源模型没有这套记忆机制去跑同一流程,这个对比本身不是完全公平的。

参考链接

"不动权重、靠经验积累打赢贵模型"这条路,你觉得是短期红利还是长期趋势?评论区聊聊你的判断,觉得有用点个赞让更多人看到 RSI 的门道。


作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友