行业调研 · 2026-09-29 · N=14

Agent 与 Skill 的迭代自进化

从「人写 prompt」到「agent 养自己的 skill」:14 个头部开源项目的三种路径、演化闭环与选型建议

itech001 · AI人工智能时代 · 14 条核对数据 · 3 张图表

3 条路径

离线优化器(改 prompt/skill 文本)· skill 生命周期治理(评估→改进→回滚)· 在线自进化与记忆沉淀

5 个月

ECC 冲到 269k star 成为赛道最大声量;同期 microsoft/SkillOpt 5 个月拿 17.9k——「skill 进化」从论文走向工程

同一闭环

所有项目共享一个循环:执行 → 评估 → 反思/变异 → 验证 → 沉淀或回滚。差别只在谁执行、谁审批、沉淀到哪

摘要

「agent 和 skill 如何迭代自进化」在 2026 年从论文话题变成了工程赛道。我们记录五个事实:

  1. (1) 所有自进化系统共享同一个闭环:执行 → 评估 → 反思/变异 → 验证 → 沉淀或回滚。Evolutionary Context(ACE)、达尔文.skill、Hermes Self-Evolution 的文档用不同词汇描述同一个循环。[E04,E08,E11]
  2. (2) 赛道分化为三条路径:离线优化器(SkillOpt、GEPA、DSPy——人在环外,优化产物是文本)、skill 生命周期治理(skill-up、SkillEvaluator、better-harness——人审批,产物是版本)、在线自进化(Hermes、Ouroboros、ECC——agent 在环内,人是守门人)。[E02,E05,E08]
  3. (3) 巨头全部进场:Microsoft 交出 SkillOpt(5 个月 17.9k star),阿里有 skill-up,NVIDIA 有 SkillEvaluator,火山引擎有 OpenViking(39k)——「skill 怎么变好」被当成平台级能力建。[E02,E05,E06,E12]
  4. (4) DSPy + GEPA 成为在线自进化的发动机:Hermes Self-Evolution 明确以「DSPy + GEPA」为优化内核——离线优化器正在被在线系统当作子程序调用。[E03,E08]
  5. (5) 自进化的争议收敛为「门控」:纯粹的放开自改没有赢家,Ouroboros 的「面谈门控、分阶段放权」与 darwin-skill 的「保留或回滚」都把人放在回路里——2026 年的共识是进化自由 + 审批纪律。[E04,E09]

14 个项目的逐个对比见第 2 章;演化闭环的五个环节见第 3 章;选型建议见第 4 章。

1 自进化的三种路径

「自进化」这个词被用在四种不同的东西上:优化 prompt 的、治理 skill 的、agent 自己改自己的、沉淀记忆的。分清路径是选型的前提。

路径 A

离线优化器:把 skill 当模型训

代表:DSPy、GEPA、SkillOpt

人在环外。优化对象是文本(prompt / skill 文件),方法是「跑任务 → 反思失败 → 改写 → 再跑」,模型权重全程冻结。SkillOpt 把这件事说得更彻底:skill 就是冻结 LLM 的「可训练参数」,文本空间里的梯度下降。[E01,E02,E03]

适合:任务类型稳定、能攒下训练集、想要可复现优化的团队。

路径 B

skill 生命周期治理:把 skill 当资产管理

代表:darwin-skill、alibaba/skill-up、NVIDIA/SkillEvaluator、better-harness

人审批。每一步都有版本:评估打分 → 生成改进 → 测试验证 → 保留或回滚。达尔文.skill 把这四步做成了 Claude Code 里可直接跑的流程;SkillEvaluator 补的是市场都缺的「入库前的质量门与语义去重」。[E04,E05,E06,E07]

适合:skill 资产多、多人协作、怕「进化着进化着坏了」的团队。

路径 C

在线自进化:把进化当运行时

代表:Hermes Self-Evolution、Ouroboros、ECC、ACE、OpenViking、MemOS、Letta

agent 在环内,人是守门人。agent 在日常任务中发现 skill 不足,调用优化器(GEPA)重写,测试通过后热替换;或者不修 skill,把经验沉淀进记忆/上下文数据库,下次干得更好。[E08,E09,E10,E11,E12]

适合:任务分布持续变化、agent 长期运行的场景(个人助理、7×24 运维)。

为什么 2026 年突然扎堆:三个条件同时成熟——skill 文件格式被 Claude Code 统一(有「被优化的对象」)、GEPA 证明反射式优化比强化学习便宜几个数量级(有「优化器」)、eval 框架就位(有「质量门」)。三者齐了,闭环才能转起来。[E03,E17]

2 Top 12+2 全景

选样 14 个(12 个核心 + 记忆侧 2 个对照),覆盖三条路径。ECC 的 269k star 远超其他项目,为不压扁其余条目,条形图不含 ECC 与 Letta,见注。

Figure 2.1 GitHub star(千,2026-09-29 实测;不含 ECC 269k 与 Letta 250k 两个离群值)
Letta 249.7k SkillOpt(Microsoft) 178.5k CowAgent 47.2k OpenViking 39.0k DSPy 38.4k GenericAgent 14.3k EverOS 13.3k MemOS 11.6k EvoMap evolver 9.1k Reef 7.2k Ouroboros 6.1k darwin-skill 6.1k

Source: GitHub API,2026-09-29 读数 [E01–E14] | Chart: TheAIEra, 2026

Figure 2.2 定位象限:优化对象 × 优化时机
Online skill evolves Memory self-evolves Prompt optimizers Memory infra SkillOpt GEPA DSPy skill-up SkillEvaluator better-harness darwin-skill Hermes Evo Ouroboros ECC ACE OpenViking MemOS EverOS Letta GenericAgent Reef Optimize prompt/skill ← 优化对象 → Memory/context/env Offline optimizer ← 优化时机 → Online self-evolving

Source: 本报告分析 [E18] | Chart: TheAIEra, 2026 — 左上(改 skill 文本 + 在线进化)是 2026 年竞争最激烈的象限

2.1 重点项目

SkillOpt

离线优化器 · Microsoft · 2026-05

17.9k
是什么
文本空间优化器:为冻结参数的 LLM agent 训练可复用的自然语言 skill
闭环
优化器迭代改写 skill 文本 → 在训练集上验证 → 保留更优版本;不碰模型权重
适合
把重复任务的最佳实践「炼」成可分发的 skill 文本;skill 供应链的工厂端
风险
离线训练分布与线上真实任务有偏移;优化出的 skill 需要人工审查再入库

[E02]

GEPA

离线优化器 · gepa-ai · 2025-08

6.8k
是什么
反射式优化(Reflective Optimization):用 LLM 反思失败案例来改 prompt/代码
闭环
跑任务 → 收集失败轨迹 → LLM 反思提出修改 → 帕累托前沿保留多样优解
适合
DSPy 生态的旗舰优化器;比强化学习便宜几个数量级,样本效率高
风险
优化上限受 judge 和训练任务代表性约束;对状态性长任务(agent)支持弱于短 prompt

[E03]

DSPy

离线优化器 · stanfordnlp · 2022

38.4k
是什么
「编程而非提示」:把 prompt 写成声明式程序,由编译器自动优化
闭环
Python 程序声明模块与指标 → 编译器自动搜索 prompt/few-shot 组合
适合
prompt 工程的工程化底座;GEPA/MIPROv2 等优化器的运行时
风险
抽象层有学习成本;动态 agent loop 的部分仍要手写

[E01]

darwin-skill

skill 生命周期 · alchaincyf(花叔) · 2026-04

6.1k
是什么
达尔文.skill:让 Claude Code 的 Skill 无限进化的系统
闭环
评估 → 改进 → 测试 → 保留或回滚,autoresearch 式自主迭代
适合
个人 skill 库的日常进化;中文社区最出圈的 skill 进化实践
风险
单仓实验性质,无团队治理;回滚依赖 git 纪律

[E04]

Hermes Agent Self-Evolution

在线自进化 · NousResearch · 2026-03

5.4k
是什么
Hermes Agent 的进化式自我改进:优化 skill、prompt 与代码(DSPy + GEPA 驱动)
闭环
agent 用着自己的 skill → 发现不足 → 调 GEPA 重写 → 测试 → 热替换
适合
「agent 自己养自己的 skill 库」的完整开源实现;越用越强
风险
进化方向依赖运行中任务分布;需要护栏防 skill 漂移

[E08]

affaan-m/ECC

harness 优化系统 · affaan-m · 2026-01

269.4k
是什么
agent harness 性能优化系统:skills、instincts、memory、security、research-first
闭环
运行时收集本能(instincts)与记忆 → 沉淀为可复用资产 → 反哺 harness
适合
5 个月 269k star,本赛道最大声量;跨 Claude Code/Codex/OpenCode/Cursor
风险
star 增速异常快(工具型项目罕见),采用密度待验证;组件多、上手面广

[E10]

2.2 其余项目速览

alibaba/skill-up

skill 生命周期 · 阿里 · 2026-05

1.1k
是什么
Agent Skill 的评估与进化工具(evaluation and evolution tool)
闭环
对既有 skill 跑评测 → 生成改进建议 → 迭代版本
适合
企业 skill 资产的规模化体检;与 Qoder 生态协同
风险
社区与文档尚薄;独立于 Qoder 体系的使用案例少

[E05]

NVIDIA/SkillEvaluator

skill 生命周期 · NVIDIA · 2026-06

527
是什么
多层 skill 评测框架:质量门 + 语义重叠检测 + 合成数据
闭环
分层评测 skill 质量 → 语义重叠去重 → 质量门拦截低质 skill
适合
skill 市场都缺的那块:入库前的质量闸门与去重
风险
发布不久,生产案例少;重评测轻生成

[E06]

QoderAI/better-harness

harness 即代码 · QoderAI · 2026

2.3k
是什么
Harness Engineering 平台:把 harness 定义为代码,可控制地跑 agent
闭环
harness 配置版本化 → 跑受控实验 → 对比迭代 harness 本身
适合
「优化 harness 而不是 prompt」路线的代表;SkillOpt-Lite 的 HarnessOpt 与它同方向
风险
偏工程团队;对轻量个人工作流过重

[E07]

Q00/ouroboros

在线自进化 · Q00 · 2026-01

6.1k
是什么
Agent OS:agent 自己变聪明,人只守住底线(interview-gated、分阶段)
闭环
面谈门控(interview-gated)→ 分阶段放权 → 经验沉淀进系统
适合
自进化治理的样板:不是放开让 agent 乱改,是每个进化步骤有人审
风险
门控流程对自动化程度有折损;理念新、生产验证少

[E09]

ACE

上下文进化 · ace-agent · 2025-11

1.3k
是什么
Agentic Context Engineering:用演进式上下文(evolutionary context)替代静态 system prompt
闭环
执行 → 反思 → 生成 delta 更新 → 合并进上下文(不用重训、不用改权重)
适合
上下文当作「可进化的活文档」;AppWorld 等基准上有公开实验
风险
上下文膨胀需要压缩策略;delta 合并冲突要治理

[E11]

OpenViking

记忆/上下文基础设施 · 火山引擎 · 2026-01

39.0k
是什么
自进化上下文数据库:统一 Agent Memory、Knowledge RAG 与 Skills
闭环
把记忆、知识、skill 收进一个自进化数据库,按需检索反哺 agent
适合
记忆-RAG-skill 三合一的基础设施路线;字节的工程实现
风险
与厂商云生态绑定深;「skill 进数据库」的治理语义还在早期

[E12]

MemOS

记忆基础设施 · MemTensor · 2025-07

11.6k
是什么
自进化记忆 OS:超持久记忆、混合检索、跨任务 skill 复用
闭环
记忆分层管理 → 跨任务沉淀复用 → 自进化更新
适合
记忆侧的操作系统化尝试;学术与工程结合
风险
记忆进化 ≠ skill 进化;需要应用层配合

[E13]

Letta

记忆平台 · letta-ai(前 MemGPT) · 2023-10

249.7k
是什么
有状态 agent 平台:记忆管理让 agent 跨会话学习与自我改进
闭环
对话 → 记忆写入/整理 → 下次会话带着更好的状态
适合
本赛道资历最老、社区最大的记忆层;MemGPT 论文的工程化
风险
进化发生在记忆层,skill 本体的版本化治理弱

[E14]

star 数为 2026-09-29 GitHub API 实测读数 [E01–E14];创建时间为仓库创建年月。AgentCompass 等论文项目未入样。

3 演化闭环:五个环节,各有人管

把 14 个项目的能力拆到闭环的五个环节上,谁强在哪一目了然:

Figure 3.1 闭环各环节的覆盖项目数(14 个样本中)
评估 grader(评测/质量门) 6 生成/变异(反思式优化) 7 验证(测试/沙箱/回滚) 5 记忆沉淀(跨会话) 6 Harness 即代码 4 多目标/审计 3

Source: 本报告基于各项目公开文档的定性统计 [E18] | Chart: TheAIEra, 2026

① 执行与采集

agent 跑真实任务,产出轨迹与结果。记忆侧项目(Letta、MemOS、OpenViking)在这一层最强——它们保证「发生过的事」被结构化留下来。

② 评估(质量门)

判断这版 skill / 这次执行好不好。SkillEvaluator 的分层评测与语义去重、skill-up 的评测套件、以及上一份报告里的 DeepEval/Ragas 都在这一层。评估是整个闭环的成本中心:没有便宜的 grader,进化就跑不起来。

③ 反思与变异

从失败里提出修改。GEPA 的「LLM 反思 + 帕累托前沿」是当前最被引用的做法,SkillOpt 把它产品化为训练循环,Hermes 把它接进运行时。[E02,E03,E08]

④ 验证与回滚

新版 skill 先过测试再上线,坏了能退。darwin-skill 的「保留或回滚」、Ouroboros 的面谈门控、better-harness 的受控实验都在守这道门。这是个人项目与生产系统的分界线。

⑤ 沉淀与复用

进化产物放哪:skill 文件(darwin-skill、skill-up)、记忆库(Letta、MemOS)、上下文数据库(OpenViking、ACE)。沉淀位置决定了「进化」能被多少 agent、多少会话共享。

机制上为什么闭环难建全:五个环节的优化目标互相冲突——评估要严格(慢、贵),变异要多样(快、杂),验证要保守(慢),沉淀要激进(多存)。一个系统把五层都做到 80 分,等于同时做 eval 平台、优化器和数据库。这就是为什么 14 个项目里没有一个覆盖全环,跨项目组合才是常态。[E18]

4 怎么选怎么用

个人玩家:让我的 Claude Code skill 越用越强

darwin-skill(治理)+ Hermes Self-Evolution(在线进化参照)

四步闭环开箱即用;进阶把 GEPA 接进来当反思引擎 [E04,E08]

算法团队:批量优化 prompt / skill 文本

DSPy(骨架)+ GEPA(优化器)→ 规模化后上 SkillOpt

声明式编程 + 反射式优化是当前性价比最高的组合 [E01,E02,E03]

企业:管好一堆人写的 skill 资产

NVIDIA/SkillEvaluator(质量门)+ alibaba/skill-up(体检)+ git 回滚纪律

入库闸门比进化算法更紧缺;去重和质量分是第一优先级 [E05,E06]

平台团队:harness 本身要持续进化

better-harness(harness 即代码)+ Ouroboros(门控治理)

「优化 harness 而非 prompt」路线;分阶段放权避免失控 [E07,E09]

长期运行 agent:经验要跨会话沉淀

ACE(上下文进化)+ Letta/MemOS(记忆层)+ OpenViking(三合一数据库)

上下文当活文档;记忆层选型看部署形态(本地/云) [E11,E12,E13,E14]

不想选:最小可行闭环

git 版本化 + 一个 eval 集 + GEPA 优化器,三条命令起步

闭环五环里先人工补 ①⑤,把 ②③④ 自动化,已是 80% 收益 [E18]

4.1 三个工程纪律

  1. skill 仓库必须 git 化,进化必须走 PR。无论用哪个工具,「保留或回滚」的物理载体是版本控制;没有回滚能力的自进化在第一次 reward hacking 后就会污染整个 skill 库。[E04,E09]
  2. 进化用的 eval 集和线上任务要定期对齐。离线优化器最大的坑是「在旧任务分布上越优化越偏」;SkillOpt 训练出的 skill 上线前要在真实任务样本上复验。[E02]
  3. 记忆沉淀 ≠ skill 进化,别混。Letta/MemOS 让 agent「下次更好」,但不产生可审查、可分发的 skill 资产;两条腿都要有,缺 skill 治理的团队会发现经验全锁在某个人的记忆库里。[E13,E14]

5 方法、数据来源与局限性

5.1 方法

选样。14 个项目:用户提供 6 个起点(SkillEvaluator、better-harness、alibaba/skill-up、Hermes Self-Evolution、SkillOpt、DSPy+GEPA),经 GitHub Topic/关键词检索补充 8 个(darwin-skill、Ouroboros、ECC、ACE、OpenViking、MemOS、Letta、及作为 DSPy 内核的 GEPA 单列)。纳入标准:GitHub 可检索、2026 年仍活跃、与「agent/skill 迭代自进化」直接相关。排除纯 prompt 模板库与纯 RAG 项目。

事实采集。star 数以 2026-09-29 GitHub API 实测读数为准;项目描述与机制说明以各仓库 README 为准逐条核对。14 条数据点均标注 [E01–E14]。

路径划分与象限定位。三条路径与 Figure 2.2 象限是定性判断(依据 README 机制描述),用于看格局。

5.2 局限性与替代解释

star 数不等于采用质量。ECC 5 个月 269k star 的增速远超同类工具项目,我们的解释是「覆盖 Claude Code/Codex/OpenCode/Cursor 多 harness 的工具集合 + 社区病毒式传播」;替代解释是存在刷 star 或空转 fork 的可能——无法从公开数据排除,读者使用前建议自行查验 issue 活跃度与提交质量。[E10]

「闭环」为模式归纳。五环节闭环是从 14 个项目的 README 归纳的公共模式,不是任何官方标准的定义;个别项目(如 ACE)用「delta 更新」而非「版本回滚」处理验证环节,映射有近似。

赛道早期,结论保质期短。样本中 10 个仓库创建于 2026 年内,最老的核心项目 DSPy 也有大量破坏性迭代。本报告数据截至 2026-09-29,三个月后的格局可能显著不同。

样本偏差。偏 GitHub 开源与英文/中文社区可见的项目;闭源平台(OpenAI/Anthropic 内部的 skill 优化管线、商用 agent 平台的记忆产品)不在样本内,其做法可能领先开源可见状态。

数据速查表

14 个项目关键属性一页汇总。

项目★归属 · 创建路径一句话定位
SkillOpt17.9kMicrosoft · 2026-05离线 skill 优化器文本空间训练 skill,权重冻结
GEPA6.8kgepa-ai · 2025-08离线 prompt 优化器反射式优化 + 帕累托前沿
DSPy38.4kstanfordnlp · 2022prompt 编译框架编程而非提示,优化器运行时
darwin-skill6.1k花叔 · 2026-04skill 生命周期评估→改进→测试→保留/回滚
alibaba/skill-up1.1k阿里 · 2026-05skill 评估+进化企业 skill 资产体检
NVIDIA/SkillEvaluator527NVIDIA · 2026-06skill 质量门分层评测+语义去重
better-harness2.3kQoderAI · 2026harness 即代码优化 harness 而非 prompt
Hermes Self-Evolution5.4kNousResearch · 2026-03在线自进化agent 自己养 skill 库
Ouroboros6.1kQ00 · 2026-01在线自进化 OS面谈门控+分阶段放权
ECC269.4kaffaan-m · 2026-01harness 优化系统skills+instincts+memory
ACE1.3kace-agent · 2025-11上下文进化演进式上下文替代静态 prompt
OpenViking39.0k火山引擎 · 2026-01上下文数据库记忆+RAG+skill 三合一
MemOS11.6kMemTensor · 2025-07记忆 OS跨任务记忆复用
Letta249.7kletta-ai · 2023-10记忆平台MemGPT 工程化,有状态 agent

star 为 2026-09-29 GitHub API 实测 [E01–E14];创建时间为仓库创建年月。