SkillOpt
离线优化器 · Microsoft · 2026-05
- 是什么
- 文本空间优化器:为冻结参数的 LLM agent 训练可复用的自然语言 skill
- 闭环
- 优化器迭代改写 skill 文本 → 在训练集上验证 → 保留更优版本;不碰模型权重
- 适合
- 把重复任务的最佳实践「炼」成可分发的 skill 文本;skill 供应链的工厂端
- 风险
- 离线训练分布与线上真实任务有偏移;优化出的 skill 需要人工审查再入库
[E02]
从「人写 prompt」到「agent 养自己的 skill」:14 个头部开源项目的三种路径、演化闭环与选型建议
itech001 · AI人工智能时代 · 14 条核对数据 · 3 张图表
离线优化器(改 prompt/skill 文本)· skill 生命周期治理(评估→改进→回滚)· 在线自进化与记忆沉淀
ECC 冲到 269k star 成为赛道最大声量;同期 microsoft/SkillOpt 5 个月拿 17.9k——「skill 进化」从论文走向工程
所有项目共享一个循环:执行 → 评估 → 反思/变异 → 验证 → 沉淀或回滚。差别只在谁执行、谁审批、沉淀到哪
「agent 和 skill 如何迭代自进化」在 2026 年从论文话题变成了工程赛道。我们记录五个事实:
14 个项目的逐个对比见第 2 章;演化闭环的五个环节见第 3 章;选型建议见第 4 章。
「自进化」这个词被用在四种不同的东西上:优化 prompt 的、治理 skill 的、agent 自己改自己的、沉淀记忆的。分清路径是选型的前提。
代表:DSPy、GEPA、SkillOpt
人在环外。优化对象是文本(prompt / skill 文件),方法是「跑任务 → 反思失败 → 改写 → 再跑」,模型权重全程冻结。SkillOpt 把这件事说得更彻底:skill 就是冻结 LLM 的「可训练参数」,文本空间里的梯度下降。[E01,E02,E03]
适合:任务类型稳定、能攒下训练集、想要可复现优化的团队。
代表:darwin-skill、alibaba/skill-up、NVIDIA/SkillEvaluator、better-harness
人审批。每一步都有版本:评估打分 → 生成改进 → 测试验证 → 保留或回滚。达尔文.skill 把这四步做成了 Claude Code 里可直接跑的流程;SkillEvaluator 补的是市场都缺的「入库前的质量门与语义去重」。[E04,E05,E06,E07]
适合:skill 资产多、多人协作、怕「进化着进化着坏了」的团队。
代表:Hermes Self-Evolution、Ouroboros、ECC、ACE、OpenViking、MemOS、Letta
agent 在环内,人是守门人。agent 在日常任务中发现 skill 不足,调用优化器(GEPA)重写,测试通过后热替换;或者不修 skill,把经验沉淀进记忆/上下文数据库,下次干得更好。[E08,E09,E10,E11,E12]
适合:任务分布持续变化、agent 长期运行的场景(个人助理、7×24 运维)。
为什么 2026 年突然扎堆:三个条件同时成熟——skill 文件格式被 Claude Code 统一(有「被优化的对象」)、GEPA 证明反射式优化比强化学习便宜几个数量级(有「优化器」)、eval 框架就位(有「质量门」)。三者齐了,闭环才能转起来。[E03,E17]
选样 14 个(12 个核心 + 记忆侧 2 个对照),覆盖三条路径。ECC 的 269k star 远超其他项目,为不压扁其余条目,条形图不含 ECC 与 Letta,见注。
Source: GitHub API,2026-09-29 读数 [E01–E14] | Chart: TheAIEra, 2026
Source: 本报告分析 [E18] | Chart: TheAIEra, 2026 — 左上(改 skill 文本 + 在线进化)是 2026 年竞争最激烈的象限
离线优化器 · Microsoft · 2026-05
[E02]
离线优化器 · gepa-ai · 2025-08
[E03]
离线优化器 · stanfordnlp · 2022
[E01]
skill 生命周期 · alchaincyf(花叔) · 2026-04
[E04]
在线自进化 · NousResearch · 2026-03
[E08]
harness 优化系统 · affaan-m · 2026-01
[E10]
skill 生命周期 · 阿里 · 2026-05
[E05]
skill 生命周期 · NVIDIA · 2026-06
[E06]
harness 即代码 · QoderAI · 2026
[E07]
在线自进化 · Q00 · 2026-01
[E09]
上下文进化 · ace-agent · 2025-11
[E11]
记忆/上下文基础设施 · 火山引擎 · 2026-01
[E12]
记忆基础设施 · MemTensor · 2025-07
[E13]
记忆平台 · letta-ai(前 MemGPT) · 2023-10
[E14]
star 数为 2026-09-29 GitHub API 实测读数 [E01–E14];创建时间为仓库创建年月。AgentCompass 等论文项目未入样。
把 14 个项目的能力拆到闭环的五个环节上,谁强在哪一目了然:
Source: 本报告基于各项目公开文档的定性统计 [E18] | Chart: TheAIEra, 2026
agent 跑真实任务,产出轨迹与结果。记忆侧项目(Letta、MemOS、OpenViking)在这一层最强——它们保证「发生过的事」被结构化留下来。
判断这版 skill / 这次执行好不好。SkillEvaluator 的分层评测与语义去重、skill-up 的评测套件、以及上一份报告里的 DeepEval/Ragas 都在这一层。评估是整个闭环的成本中心:没有便宜的 grader,进化就跑不起来。
从失败里提出修改。GEPA 的「LLM 反思 + 帕累托前沿」是当前最被引用的做法,SkillOpt 把它产品化为训练循环,Hermes 把它接进运行时。[E02,E03,E08]
新版 skill 先过测试再上线,坏了能退。darwin-skill 的「保留或回滚」、Ouroboros 的面谈门控、better-harness 的受控实验都在守这道门。这是个人项目与生产系统的分界线。
进化产物放哪:skill 文件(darwin-skill、skill-up)、记忆库(Letta、MemOS)、上下文数据库(OpenViking、ACE)。沉淀位置决定了「进化」能被多少 agent、多少会话共享。
机制上为什么闭环难建全:五个环节的优化目标互相冲突——评估要严格(慢、贵),变异要多样(快、杂),验证要保守(慢),沉淀要激进(多存)。一个系统把五层都做到 80 分,等于同时做 eval 平台、优化器和数据库。这就是为什么 14 个项目里没有一个覆盖全环,跨项目组合才是常态。[E18]
个人玩家:让我的 Claude Code skill 越用越强
darwin-skill(治理)+ Hermes Self-Evolution(在线进化参照)
四步闭环开箱即用;进阶把 GEPA 接进来当反思引擎 [E04,E08]
算法团队:批量优化 prompt / skill 文本
DSPy(骨架)+ GEPA(优化器)→ 规模化后上 SkillOpt
声明式编程 + 反射式优化是当前性价比最高的组合 [E01,E02,E03]
企业:管好一堆人写的 skill 资产
NVIDIA/SkillEvaluator(质量门)+ alibaba/skill-up(体检)+ git 回滚纪律
入库闸门比进化算法更紧缺;去重和质量分是第一优先级 [E05,E06]
平台团队:harness 本身要持续进化
better-harness(harness 即代码)+ Ouroboros(门控治理)
「优化 harness 而非 prompt」路线;分阶段放权避免失控 [E07,E09]
长期运行 agent:经验要跨会话沉淀
ACE(上下文进化)+ Letta/MemOS(记忆层)+ OpenViking(三合一数据库)
上下文当活文档;记忆层选型看部署形态(本地/云) [E11,E12,E13,E14]
不想选:最小可行闭环
git 版本化 + 一个 eval 集 + GEPA 优化器,三条命令起步
闭环五环里先人工补 ①⑤,把 ②③④ 自动化,已是 80% 收益 [E18]
选样。14 个项目:用户提供 6 个起点(SkillEvaluator、better-harness、alibaba/skill-up、Hermes Self-Evolution、SkillOpt、DSPy+GEPA),经 GitHub Topic/关键词检索补充 8 个(darwin-skill、Ouroboros、ECC、ACE、OpenViking、MemOS、Letta、及作为 DSPy 内核的 GEPA 单列)。纳入标准:GitHub 可检索、2026 年仍活跃、与「agent/skill 迭代自进化」直接相关。排除纯 prompt 模板库与纯 RAG 项目。
事实采集。star 数以 2026-09-29 GitHub API 实测读数为准;项目描述与机制说明以各仓库 README 为准逐条核对。14 条数据点均标注 [E01–E14]。
路径划分与象限定位。三条路径与 Figure 2.2 象限是定性判断(依据 README 机制描述),用于看格局。
star 数不等于采用质量。ECC 5 个月 269k star 的增速远超同类工具项目,我们的解释是「覆盖 Claude Code/Codex/OpenCode/Cursor 多 harness 的工具集合 + 社区病毒式传播」;替代解释是存在刷 star 或空转 fork 的可能——无法从公开数据排除,读者使用前建议自行查验 issue 活跃度与提交质量。[E10]
「闭环」为模式归纳。五环节闭环是从 14 个项目的 README 归纳的公共模式,不是任何官方标准的定义;个别项目(如 ACE)用「delta 更新」而非「版本回滚」处理验证环节,映射有近似。
赛道早期,结论保质期短。样本中 10 个仓库创建于 2026 年内,最老的核心项目 DSPy 也有大量破坏性迭代。本报告数据截至 2026-09-29,三个月后的格局可能显著不同。
样本偏差。偏 GitHub 开源与英文/中文社区可见的项目;闭源平台(OpenAI/Anthropic 内部的 skill 优化管线、商用 agent 平台的记忆产品)不在样本内,其做法可能领先开源可见状态。
14 个项目关键属性一页汇总。
| 项目 | ★ | 归属 · 创建 | 路径 | 一句话定位 |
|---|---|---|---|---|
| SkillOpt | 17.9k | Microsoft · 2026-05 | 离线 skill 优化器 | 文本空间训练 skill,权重冻结 |
| GEPA | 6.8k | gepa-ai · 2025-08 | 离线 prompt 优化器 | 反射式优化 + 帕累托前沿 |
| DSPy | 38.4k | stanfordnlp · 2022 | prompt 编译框架 | 编程而非提示,优化器运行时 |
| darwin-skill | 6.1k | 花叔 · 2026-04 | skill 生命周期 | 评估→改进→测试→保留/回滚 |
| alibaba/skill-up | 1.1k | 阿里 · 2026-05 | skill 评估+进化 | 企业 skill 资产体检 |
| NVIDIA/SkillEvaluator | 527 | NVIDIA · 2026-06 | skill 质量门 | 分层评测+语义去重 |
| better-harness | 2.3k | QoderAI · 2026 | harness 即代码 | 优化 harness 而非 prompt |
| Hermes Self-Evolution | 5.4k | NousResearch · 2026-03 | 在线自进化 | agent 自己养 skill 库 |
| Ouroboros | 6.1k | Q00 · 2026-01 | 在线自进化 OS | 面谈门控+分阶段放权 |
| ECC | 269.4k | affaan-m · 2026-01 | harness 优化系统 | skills+instincts+memory |
| ACE | 1.3k | ace-agent · 2025-11 | 上下文进化 | 演进式上下文替代静态 prompt |
| OpenViking | 39.0k | 火山引擎 · 2026-01 | 上下文数据库 | 记忆+RAG+skill 三合一 |
| MemOS | 11.6k | MemTensor · 2025-07 | 记忆 OS | 跨任务记忆复用 |
| Letta | 249.7k | letta-ai · 2023-10 | 记忆平台 | MemGPT 工程化,有状态 agent |
star 为 2026-09-29 GitHub API 实测 [E01–E14];创建时间为仓库创建年月。