
前言上次我们分享了女娲Skill输入一个名字就能把任何人的思维方式提取成一套可调用的AI Skill。女娲负责“造人”但造出来的 Skill 质量参差不齐质量好坏还得靠人工逐个判断。达尔文Skill 解决的就是这个问题让 Skill 自己进化。当你有 10 个 Skill 时手动维护还勉强可以当你有 60 个 Skill 时你就需要一个系统。传统的 Skill审查只看格式对不对、步骤有没有编号但格式完美不代表效果好。达尔文 Skill 同时评估结构质量和它的实际效果只保留真正有改进的修改。项目地址https://github.com/alchaincyf/darwin-skill像训练模型一样优化 Skill达尔文的灵感来自 Andrej Karpathy 的 autoresearch 项目让 AI 自主生成和测试代码变更只保留可测量的改进。达尔文把同样的思路搬到了 Skill 优化上。它的核心机制是一个“只能向前转的棘轮”每一轮优化要么改进 Skill要么干净地回滚。分数只升不降不会随时间积累局部退化。以下是 autoresearch 与达尔文 Skill 的对比autoresearch达尔文 Skill核心目标优化代码优化 Skill被优化的资产train.py每个待优化的SKILL.md优化目标val_bpb可量化指标9 维加权总分满分 100保留机制git ratchetkeep / revert 机制验证方式test settest-prompts.json运行方式全自主人在回路关键阶段暂停确认“人在回路Human-in-the-LoopHITL”指的是让人类参与到一个自动化系统或 AI Agent 的执行流程中在关键环节由人进行确认、决策、纠正或干预。Skill 的好坏比代码的 loss 值更微妙所以达尔文在关键阶段会停下来等人确认这是它和全自动系统的核心区别。五条核心原则原则说明单一可编辑资产每次只改一个SKILL.md改进可归因双重评估结构评分静态分析加效果验证跑测试看输出棘轮机制只保留改进自动回滚退步分数只升不降独立评分用子 agent 评分避免“自己改自己评”的偏差LLM 自评准确率仅 46.4%人在回路每个 Skill 优化完后暂停等你确认再继续九维度评估体系总分 100 分结构维度靠静态分析效果维度必须实测。以下三个维度来自微软研究院 SkillLens 论文的实证验证73.8% 的优化效果来自这套评估标准维度说明失败模式编码显式编码已知失败路径不是简单“别犯错”式叮嘱可执行具体性禁用“建议”“可以考虑”“根据情况”“灵活把握”等模糊措辞高风险行动黑名单rm、git reset --hard、force push等破坏性操作必须明文列禁优化循环五个阶段Phase 1基线评估自动扫描目标 Skill给出 9 个维度的初始分数和诊断报告。你需要审核报告决定优先优化哪个维度。Phase 2单维度优化系统找出加权短板最大的维度针对该维度生成 1 个具体改进方案编辑 SKILL.md提交 git commit然后启动 2 个独立子 agent 重新评分。新分高于旧分则保留否则 git revert 回滚。单轮涨幅低于 1 分自动早停。 CHECKPOINT 强制暂停展示 diff 和分数变化等用户确认。Phase 2.5测试提示词跑可选你可以手动跑几个测试用例验证优化后的效果。Phase 3回归测试多评委独立审查涨幅低于阈值强制停手。反例黑名单明文禁止的反模式同一个 AI 又改又评自评准确率仅 46.4%用 git reset --hard 当回滚手段应用 git revert为凑分堆冗余跳过测试提示词直接评分一轮内改多个维度干跑比例超过 30%静默跳过异常忽视维度相关簇实操体验下面以 Codex 为例走一遍从安装到优化的流程。安装达尔文 Skill如果你的服务器上已经安装了 Codex直接在对话框里执行npx skills add alchaincyf/darwin-skill执行前会询问确认确认后安装完成就可以正常调用了。安装完成后告诉 Codex 你想优化哪个 Skill比如优化 wang-yangming-perspective 这个skill优化流程展示Phase 1基线评估达尔文先检查环境并读取目标Skill给出初步诊断结果。Phase 2单维度优化达尔文针对“失败模式编码”短板在 SKILL.md 中补充了显式 CHECKPOINT、事实边界检查、失败分支与兜底表格。补丁通过所有检查备份已完成达尔文请求确认将优化后的 SKILL.md 和 test-prompts.json 正式写入目标目录。Phase 3回归测试本轮单轮优化未触发当多轮优化累积后达尔文会进入回归测试阶段由多评委独立审查涨幅低于阈值强制停手。结语达尔文 Skill 的功能不止于此本篇简单分享了 Skill 优化的过程和方式。当你的 Skill 数量越来越多手动维护越来越吃力时达尔文能帮你自动评估、改进、验证只保留有效的优化。