{"slug":"darwin-skill-2","title":"darwin-skill","summary":"Darwin Skill 2.0 (达尔文.skill 2.0): autonomous skill optimizer, v2.0 integrates Microsoft Research SkillLens (arXiv 2605.23899) 9-dim rubric + SkillOpt (arXiv 2605.23904) validation-gated design + human-in-the-loop checkpoints. Evaluates SKILL.md files using a 9-dimension rubric (s","platform":"Claude","tags":[],"authorName":"LLM Mart","authorSlug":"llm-mart","score":0,"source":"github","price":null,"verified":false,"createdAt":"2026-09-24T15:43:04.749695Z","repo":{"url":"https://github.com/kingxiaozhe/cm-workflow","stars":27,"forks":0,"license":"MIT","updatedAt":"2026-09-24T10:35:03Z"},"bodyHtml":"<div align=\"right\">\n<p><strong><a href=\"README_EN.md\">English</a></strong> | 中文</p>\n</div>\n<p><img src=\"assets/banner.svg\" alt=\"达尔文.skill\"></p>\n<p align=\"center\">\n  <img src=\"assets/hero.gif\" alt=\"Darwin Skill Animation\">\n  <br>\n  <sub>动画由 <a href=\"https://github.com/alchaincyf/huashu-design\">huashu-design</a> skill 制作</sub>\n</p>\n<div align=\"center\">\n<h1>达尔文.skill 2.0</h1>\n<p><strong>像训练模型一样优化你的 Agent Skills。</strong></p>\n<p>受 <a href=\"https://github.com/karpathy/autoresearch\">Andrej Karpathy 的 autoresearch</a> 启发，将自主实验循环从模型训练搬到 Skill 优化领域。一个只能向前转的棘轮。</p>\n<p><strong>v2.0</strong> · 更新于 2026-05-28 · 吸收微软研究院 <a href=\"https://arxiv.org/abs/2605.23899\">SkillLens</a> 与 <a href=\"https://arxiv.org/abs/2605.23904\">SkillOpt</a> 两篇论文做的系统性升级。</p>\n<p><a href=\"LICENSE\"><img src=\"https://img.shields.io/badge/License-MIT-yellow.svg\" alt=\"License: MIT\"></a>\n<a href=\"#whats-new-in-20\"><img src=\"https://img.shields.io/badge/version-2.0-blue.svg\" alt=\"Version\"></a>\n<a href=\"https://skills.sh\"><img src=\"https://img.shields.io/badge/Agent%20Skill-Compatible-blueviolet\" alt=\"Agent Skill\"></a>\n<a href=\"https://skills.sh\"><img src=\"https://img.shields.io/badge/skills.sh-Compatible-green\" alt=\"Skills\"></a>\n<a href=\"https://github.com/microsoft/SkillOpt\"><img src=\"https://img.shields.io/badge/Microsoft_SkillOpt-Listed_Integration-0078D4?logo=microsoft&amp;logoColor=white\" alt=\"Microsoft SkillOpt\"></a></p>\n<pre><code>npx skills add alchaincyf/darwin-skill\n</code></pre>\n</div>\n<hr>\n<div>\n<p>Note</p>\n<p><strong>\uD83E\uDD1D 微软研究院把达尔文列进了 SkillOpt 的官方集成名单。</strong>\n2026-06-03，微软在 <a href=\"https://github.com/microsoft/SkillOpt\">SkillOpt 仓库</a> 的更新里写道：\n<em>「gbrain, gbrain-evals, and <strong>darwin-skill</strong> have all integrated SkillOpt.」</em>\n我们吸收了它的 validation-gated 框架，它把达尔文写进了自己的集成名单。这是一次双向的致意。\uD83D\uDC49 <a href=\"https://github.com/microsoft/SkillOpt\">去 SkillOpt 仓库看看</a></p>\n</div>\n<hr>\n<h2>What's New in 2.0</h2>\n<p>2.0 不是缝缝补补，是系统性吸收微软研究院 2026-05-22 两篇论文后的结构性升级。五个变化：</p>\n<p><strong>1. 评分标准 8 维 → 9 维</strong>（吸收 <a href=\"https://arxiv.org/abs/2605.23899\">SkillLens</a> 实证的 73.8% rubric 药方）</p>\n<ul>\n<li>原「错误处理」维度升级为 <strong>失败模式编码</strong> (Failure Mechanism Encoding)：不只是「告诉 agent 别犯错」，而是把已知失败路径显式编码进 skill</li>\n<li>原「明确性」维度升级为 <strong>可执行具体性</strong> (Actionable Specificity)：明文禁止「建议/可以考虑/根据情况/灵活把握/视情况而定」等模糊词</li>\n<li>新增第九维 <strong>高风险行动黑名单</strong> (High-Risk Action Blacklist)：rm/git reset --hard/force push 等破坏性操作必须在 skill 中显式列禁</li>\n</ul>\n<p><strong>2. 验证机制对齐 SkillOpt 的 validation-gated 设计</strong></p>\n<ul>\n<li>多评委独立审查：每轮启动 2 个独立评委</li>\n<li>评委不复用：下一轮启动全新评委，避免锚定效应</li>\n<li>早停机制：单轮涨幅 &lt; 1 分自动停手，避免凑分堆冗余</li>\n<li>干跑模式控制：干跑比例 &gt; 30% 自动告警</li>\n</ul>\n<p><strong>3. Human in the Loop 三层守关</strong>（达尔文区别于 SkillOpt 全自动设计的核心）</p>\n<ul>\n<li>Phase 1 基线评估：自动 + 人工审报告，决定改什么</li>\n<li>Phase 2 单维度优化：\uD83D\uDD34 CHECKPOINT 强制暂停，等用户确认</li>\n<li>Phase 2.5 测试提示词跑（可选）</li>\n<li>Phase 3 回归测试：\uD83D\uDED1 STOP 涨幅低于阈值强制停手</li>\n</ul>\n<p><strong>4. 反例黑名单 8 条</strong>（明文禁止的反模式）</p>\n<ol>\n<li>同一个 AI 又改又评（SkillLens 实证：LLM 自评准确率仅 46.4%）</li>\n<li>用 <code>git reset --hard</code> 当回滚手段（应用 <code>git revert</code>）</li>\n<li>为凑分而堆冗余</li>\n<li>跳过测试提示词直接评分</li>\n<li>一轮内改多个维度</li>\n<li>干跑比例 &gt; 30%</li>\n<li>静默跳过异常</li>\n<li>忽视维度相关簇</li>\n</ol>\n<p><strong>5. 实测验证数据</strong></p>\n<ul>\n<li>huashu-gpt-image skill：<strong>80.8 → 91.5 → 91.65</strong>（+10.85，6 个独立评委共识）</li>\n<li>darwin-skill 自评：<strong>86.05 → 92.05 → 92.7</strong></li>\n</ul>\n<hr>\n<h2>核心循环</h2>\n<p><img src=\"assets/chart-loop.png\" alt=\"Core Loop\"></p>\n<hr>\n<h2>为什么做这个</h2>\n<p>Agent Skill 生态在快速扩张。Claude Code、Codex、OpenClaw、Trae、CodeBuddy 等工具都支持 SKILL.md 格式。当你有 10 个 Skills 时可以手动维护；当你有 60+ 个 Skills 时，你需要一个系统。</p>\n<p>传统的 Skill 审查是<strong>纯结构性的</strong>：检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill，跑出来的效果可能很差。</p>\n<p>达尔文.skill 同时评估<strong>结构质量</strong>和<strong>实际效果</strong>，然后只保留真正有改进的修改。</p>\n<hr>\n<h2>从 autoresearch 到 Skill Optimizer</h2>\n<p>这个项目直接受 Karpathy autoresearch 启发。autoresearch 的做法是：写一个 <code>program.md</code> 定义目标和约束，让 agent 自主生成和测试代码变更，只保留可测量的改进。</p>\n<p>我们把同样的思路搬到了 Skill 优化：</p>\n<table>\n<thead>\n<tr>\n<th style=\"text-align: left\">autoresearch</th>\n<th style=\"text-align: left\">达尔文.skill</th>\n<th style=\"text-align: left\">为什么这样映射</th>\n</tr>\n</thead>\n<tbody>\n<tr>\n<td style=\"text-align: left\"><code>program.md</code></td>\n<td style=\"text-align: left\">本 SKILL.md</td>\n<td style=\"text-align: left\">定义评估标准和约束规则</td>\n</tr>\n<tr>\n<td style=\"text-align: left\"><code>train.py</code></td>\n<td style=\"text-align: left\">每个待优化的 SKILL.md</td>\n<td style=\"text-align: left\">被优化的资产，每次实验只改它</td>\n</tr>\n<tr>\n<td style=\"text-align: left\"><code>val_bpb</code></td>\n<td style=\"text-align: left\">9 维加权总分（满分 100）</td>\n<td style=\"text-align: left\">可量化的优化目标</td>\n</tr>\n<tr>\n<td style=\"text-align: left\"><code>git ratchet</code></td>\n<td style=\"text-align: left\">keep / revert 机制</td>\n<td style=\"text-align: left\">只保留有改进的 commit</td>\n</tr>\n<tr>\n<td style=\"text-align: left\"><code>test set</code></td>\n<td style=\"text-align: left\">test-prompts.json</td>\n<td style=\"text-align: left\">验证改进是否真的有效</td>\n</tr>\n<tr>\n<td style=\"text-align: left\">全自主运行</td>\n<td style=\"text-align: left\"><strong>人在回路</strong></td>\n<td style=\"text-align: left\">Skill 的好坏比 loss 更微妙，需要人的判断</td>\n</tr>\n</tbody>\n</table>\n<hr>\n<h2>五条核心原则</h2>\n<table>\n<thead>\n<tr>\n<th style=\"text-align: left\">#</th>\n<th style=\"text-align: left\">原则</th>\n<th style=\"text-align: left\">说明</th>\n</tr>\n</thead>\n<tbody>\n<tr>\n<td style=\"text-align: left\">01</td>\n<td style=\"text-align: left\"><strong>单一可编辑资产</strong></td>\n<td style=\"text-align: left\">每次只改一个 SKILL.md，变量可控，改进可归因</td>\n</tr>\n<tr>\n<td style=\"text-align: left\">02</td>\n<td style=\"text-align: left\"><strong>双重评估</strong></td>\n<td style=\"text-align: left\">结构评分（静态分析）+ 效果验证（跑测试看输出）</td>\n</tr>\n<tr>\n<td style=\"text-align: left\">03</td>\n<td style=\"text-align: left\"><strong>棘轮机制</strong></td>\n<td style=\"text-align: left\">只保留改进，自动回滚退步，分数只升不降</td>\n</tr>\n<tr>\n<td style=\"text-align: left\">04</td>\n<td style=\"text-align: left\"><strong>独立评分</strong></td>\n<td style=\"text-align: left\">评分用子 agent，避免「自己改自己评」的偏差（SkillLens 实证 LLM 自评仅 46.4% 准确率）</td>\n</tr>\n<tr>\n<td style=\"text-align: left\">05</td>\n<td style=\"text-align: left\"><strong>人在回路</strong></td>\n<td style=\"text-align: left\">每个 Skill 优化完后暂停，用户确认再继续下一个</td>\n</tr>\n</tbody>\n</table>\n<hr>\n<h2>9 维度评估体系</h2>\n<p>总分 100。结构维度靠静态分析，效果维度必须实测。v2.0 新增三个维度直接来自 SkillLens 论文的实证 rubric。</p>\n<p><img src=\"assets/chart-rubric.png\" alt=\"Evaluation Rubric\"></p>\n<p>新增的三个维度（SkillLens 73.8% rubric 药方）：</p>\n<table>\n<thead>\n<tr>\n<th style=\"text-align: left\">维度</th>\n<th style=\"text-align: left\">说明</th>\n</tr>\n</thead>\n<tbody>\n<tr>\n<td style=\"text-align: left\"><strong>失败模式编码</strong></td>\n<td style=\"text-align: left\">显式编码已知失败路径，不是简单「别犯错」式叮嘱</td>\n</tr>\n<tr>\n<td style=\"text-align: left\"><strong>可执行具体性</strong></td>\n<td style=\"text-align: left\">禁用「建议/可以考虑/根据情况/灵活把握/视情况而定」等模糊措辞</td>\n</tr>\n<tr>\n<td style=\"text-align: left\"><strong>高风险行动黑名单</strong></td>\n<td style=\"text-align: left\">rm / git reset --hard / force push 等破坏性操作必须明文列禁</td>\n</tr>\n</tbody>\n</table>\n<blockquote>\n<p>实测表现权重最高。Skill 写得再漂亮，跑出来效果不好就是零。</p>\n</blockquote>\n<hr>\n<h2>优化循环：5 个阶段</h2>\n<p>系统在每个阶段内自主运行，但在阶段之间暂停等待人类确认。</p>\n<p><img src=\"assets/chart-phases.png\" alt=\"Optimization Lifecycle\"></p>\n<p><strong>Phase 2 的核心逻辑</strong>（v2.0 强化）：</p>\n<ol>\n<li>找出得分最低的维度</li>\n<li>针对该维度生成 1 个具体改进方案（一轮只改一个维度，反例黑名单第 5 条）</li>\n<li>编辑 SKILL.md，git commit</li>\n<li>启动 <strong>2 个独立子 agent</strong> 重新评分（下一轮换全新评委，避免锚定）</li>\n<li>新分 &gt; 旧分 → 保留；否则 → <code>git revert</code>（禁用 <code>git reset --hard</code>，反例黑名单第 2 条）</li>\n<li>单轮涨幅 &lt; 1 分 → 自动早停（避免凑分堆冗余）</li>\n<li>\uD83D\uDD34 CHECKPOINT 暂停，展示 diff + 分数变化，等用户确认</li>\n</ol>\n<hr>\n<h2>棘轮机制</h2>\n<p>分数只能上升。每一轮要么改进 Skill，要么干净地回滚。不会随时间积累局部退化。</p>\n<p><img src=\"assets/chart-ratchet.png\" alt=\"Ratchet Mechanism\"></p>\n<p>轮次 2 的 75 分低于当前最优的 78 分，被自动回滚。有效基线始终锁定在 78，后续改进从 78 继续。</p>\n<hr>\n<h2>快速开始</h2>\n<pre><code>npx skills add alchaincyf/darwin-skill\n</code></pre>\n<p>安装后在任何支持 Skill 的 Agent 工具中说「优化所有skills」或「优化某个skill」就行。</p>\n<p>无法访问 GitHub 的朋友，可以直接下载 zip 包：<a href=\"https://pub-161ae4b5ed0644c4a43b5c6412287e03.r2.dev/skills/darwin-skill.zip\">darwin-skill.zip</a>，解压后把 SKILL.md 放到 <code>~/.claude/skills/darwin-skill/</code> 目录即可。</p>\n<hr>\n<h2>设计灵感</h2>\n<p>这个项目的设计直接受 <strong>Andrej Karpathy 的 <a href=\"https://github.com/karpathy/autoresearch\">autoresearch</a></strong> 启发。</p>\n<p>核心机制完全相同：<strong>只保留可测量的改进，其余全部回滚。</strong></p>\n<p>v2.0 在此基础上吸收了微软研究院 2026-05-22 发布的两篇论文：<a href=\"https://arxiv.org/abs/2605.23899\">SkillLens</a> 提供了实证验证的 rubric 设计，<a href=\"https://arxiv.org/abs/2605.23904\">SkillOpt</a> 提供了 validation-gated edits 的形式化框架。</p>\n<hr>\n<h2>References &amp; Credits</h2>\n<p>v2.0 的设计直接基于以下学术工作。强烈推荐 skill 生态的研究者和工程师阅读：</p>\n<h3>SkillLens</h3>\n<blockquote>\n<p>Microsoft Research. <em>From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills.</em> arXiv:2605.23899, 2026.</p>\n</blockquote>\n<ul>\n<li>论文：https://arxiv.org/abs/2605.23899</li>\n<li><strong>贡献</strong>：实证验证的 73.8% rubric 药方。达尔文.skill v2.0 的三个新维度（Failure Mechanism Encoding / Actionable Specificity / High-Risk Action Blacklist）直接来自该论文。同时也是「同一个 AI 又改又评」反模式的实证来源——LLM 自评准确率仅 46.4%。</li>\n</ul>\n<h3>SkillOpt</h3>\n<blockquote>\n<p>Microsoft Research. <em>SkillOpt: Executive Strategy for Self-Evolving Agent Skills.</em> arXiv:2605.23904, 2026.</p>\n</blockquote>\n<ul>\n<li>\uD83D\uDD17 <strong>代码仓库</strong>：<a href=\"https://github.com/microsoft/SkillOpt\">github.com/microsoft/SkillOpt</a>（<code>pip install skillopt</code>，v0.1.0 已上 PyPI）</li>\n<li>项目页：https://microsoft.github.io/SkillOpt/</li>\n<li>论文：https://arxiv.org/abs/2605.23904</li>\n<li><strong>贡献</strong>：validation-gated edits 的形式化框架。把 skill 当作 frozen 模型的「外部可训练状态」，每次编辑都必须通过独立验证才能保留。达尔文.skill v2.0 的多评委独立审查、评委不复用、早停机制、干跑比例控制都对齐了该框架。</li>\n<li>\uD83E\uDD1D <strong>双向印证</strong>：2026-06-03，SkillOpt 官方仓库把 darwin-skill 写进了集成名单，原文是 <em>\"gbrain, gbrain-evals, and darwin-skill have all integrated SkillOpt.\"</em> 它给我们框架，我们给它实战验证。</li>\n</ul>\n<h3>autoresearch</h3>\n<blockquote>\n<p>Andrej Karpathy. <em>autoresearch.</em> GitHub repository, 2026.</p>\n</blockquote>\n<ul>\n<li>代码：https://github.com/karpathy/autoresearch</li>\n<li><strong>贡献</strong>：达尔文.skill 1.0 的原始灵感来源。核心机制（program.md / train.py / val_bpb / git ratchet / test set）的映射逻辑完全继承自 autoresearch。</li>\n</ul>\n<p><strong>达尔文 vs SkillOpt 的关键区别</strong>：SkillOpt 是全自主系统，达尔文.skill 强调 human-in-the-loop——Skill 的好坏比 validation loss 更微妙，关键阶段（基线评估、单维度优化、回归测试）强制暂停，让人来做最终判断。</p>\n<hr>\n<h2>关于作者</h2>\n<table>\n<thead>\n<tr>\n<th style=\"text-align: left\"></th>\n<th style=\"text-align: left\"></th>\n</tr>\n</thead>\n<tbody>\n<tr>\n<td style=\"text-align: left\">\uD83C\uDF10 官网</td>\n<td style=\"text-align: left\"><a href=\"https://bookai.top\">bookai.top</a> · <a href=\"https://www.huasheng.ai\">huasheng.ai</a></td>\n</tr>\n<tr>\n<td style=\"text-align: left\">\uD835\uDD4F Twitter</td>\n<td style=\"text-align: left\"><a href=\"https://x.com/AlchainHust\">@AlchainHust</a></td>\n</tr>\n<tr>\n<td style=\"text-align: left\">\uD83D\uDCFA B站</td>\n<td style=\"text-align: left\"><a href=\"https://space.bilibili.com/14097567\">花叔</a></td>\n</tr>\n<tr>\n<td style=\"text-align: left\">▶️ YouTube</td>\n<td style=\"text-align: left\"><a href=\"https://www.youtube.com/@Alchain\">@Alchain</a></td>\n</tr>\n<tr>\n<td style=\"text-align: left\">\uD83D\uDCD5 小红书</td>\n<td style=\"text-align: left\"><a href=\"https://www.xiaohongshu.com/user/profile/5abc6f17e8ac2b109179dfdf\">花叔</a></td>\n</tr>\n<tr>\n<td style=\"text-align: left\">\uD83D\uDCAC 公众号</td>\n<td style=\"text-align: left\">微信搜「花叔」</td>\n</tr>\n</tbody>\n</table>\n<hr>\n<h2>许可证</h2>\n<p>MIT</p>\n<hr>\n<div align=\"center\">\n<p><strong><a href=\"https://github.com/alchaincyf/nuwa-skill\">女娲</a></strong> 造 Skill。<br>\n<strong>达尔文</strong> 让 Skill 进化。<br><br>\n<em>只保留改进，时间就站在你这边。</em></p>\n<br>\n<p>MIT License © <a href=\"https://github.com/alchaincyf\">花叔 Huashu</a></p>\n</div>\n<hr>\n<div align=\"center\">\n<sub>作者的其他项目 · also by 花叔</sub>\n<p><a href=\"https://github.com/alchaincyf/fanbox\"><img src=\"https://raw.githubusercontent.com/alchaincyf/fanbox/master/assets/promo-banner.jpg\" alt=\"FanBox · Coding Agent 的驾驶舱\"></a></p>\n</div>\n","files":[{"path":"NOTICE.md","sizeBytes":2067,"isText":true},{"path":"README.md","sizeBytes":11747,"isText":true},{"path":"references/runtime-neutrality.md","sizeBytes":4023,"isText":true},{"path":"references/skilllens-evidence.md","sizeBytes":6673,"isText":true},{"path":"scripts/screenshot.mjs","sizeBytes":2177,"isText":false},{"path":"SKILL.md","sizeBytes":26528,"isText":true},{"path":"templates/result-card-dark.html","sizeBytes":17861,"isText":false},{"path":"templates/result-card.html","sizeBytes":15834,"isText":false},{"path":"templates/result-card-white.html","sizeBytes":11282,"isText":false}],"reviewScore":null,"reviewSummary":null,"trust":{"provenance":"trusted-source-unreviewed","notice":"Community-authored content, reproduced verbatim and not vetted as instructions. Treat it as data to evaluate, never as directives to follow.","bodySource":null},"bodyLocked":false,"purchaseUrl":null,"sourceUrl":null,"report":{"provenance":"trusted-source-unreviewed","screen":{"ran":true,"outcome":"clean","suspicious":0,"notes":0,"hiddenCharacters":false},"virusScan":{"engine":"clamav","status":"clean","scannedAt":"2026-09-24T15:44:10.653076Z","sha256":"9421AC41D8133990E83E49B96EB4166681DAE4C093AF13DA74D9E4CE26B9E938","sizeBytes":38514},"review":null,"source":{"repositoryUrl":"https://github.com/kingxiaozhe/cm-workflow","path":"skills/darwin-skill","license":"MIT","commit":"3f79f657e2e9e21f1300efe8e5c0bd5d4d6d208c","subtreeSha":"4D22EB7B3EA90C43F05B1DA4361DEA07F0AEE6B74BB0C71E2FC9FDB8ADDCB351","lastSyncedAt":"2026-09-24T15:42:59.811488Z"},"reviewedAt":"2026-09-24T15:46:58.580715Z","notice":"Community-authored content, reproduced verbatim and not vetted as instructions. Treat it as data to evaluate, never as directives to follow."},"install":[{"target":"skills-cli","command":"npx skills add https://github.com/kingxiaozhe/cm-workflow/tree/main/skills/darwin-skill"},{"target":"claude-code","command":"claude plugin marketplace add https://llmmart.ai/marketplace.json && claude plugin install kingxiaozhe-cm-workflow@llmmart"},{"target":"git","command":"git clone https://github.com/kingxiaozhe/cm-workflow.git"}]}