尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

i-have-adhd评测隔离原则:为什么你自己的常驻标志会污染基线

i-have-adhd评测隔离原则:为什么你自己的常驻标志会污染基线 i-have-adhd评测隔离原则为什么你自己的常驻标志会污染基线【免费下载链接】i-have-adhdA skill to stop your coding agent from burying the answer. ADHD-friendly output.项目地址: https://gitcode.com/GitHub_Trending/ih/i-have-adhdi-have-adhd 是一款让 AI 编码助手输出「ADHD 友好」回复的技能插件——先给动作、步骤编号、绝不废话。为了证明它真的有效项目内置了一套对比评测系统同一批题目一边不给技能基线 baseline一边注入技能候选 candidate用盲审打分。但这里藏着一个反直觉的坑如果你自己开过 i-have-adhd 的常驻模式污染的不是候选组而是基线组——对比实验会不自觉地变成拿技能和自己比。 先搞清楚常驻标志是怎么工作的i-have-adhd 默认是按需调用的装好插件不会改变任何行为只有你敲/i-have-adhd时才生效。但项目提供了可选的always-on常驻模式在配置目录创建一个标志文件~/.claude/.i-have-adhd-alwaysSessionStart钩子就会在每个会话的第一条消息就注入完整规则集。这个机制的实现就在 hooks/always-on.mjs脚本先检查标志文件是否存在不存在直接退出存在则把 skills/i-have-adhd/SKILL.md 的 10 条规则全文打到会话里。开关方式见 INSTALL.mdtouch ~/.claude/.i-have-adhd-always # 开启常驻 rm ~/.claude/.i-have-adhd-always # 关闭这正是它的优雅之处标志文件是用户级别、全局生效的它不关心你此刻是在写业务代码还是在跑评测。⚠️ 污染源基线组偷偷开了挂评测脚本 scripts/run_evals.py 会把基线条件和候选条件写入同一个结果文件再对比。如果运行评测的这台机器上存在.i-have-adhd-always标志基线组的每次调用都会被钩子注入全套 ADHD 规则。结果是什么你测的不再是技能有没有用而是技能 vs 技能——差异趋近于零结论彻底失真。项目文档 evals/README.md 里把这种情况点得很直白它会把完整的 i-have-adhd 规则集注入到baseline条件里让对比变成拿技能和自己比the comparison measure the skill against itself。注意这类污染的共同特点静默、双向、无报错。基线分数会虚高候选组相对优势缩水但整个流水线看起来完全正常。对新手来说这是比评测跑失败危险得多的失败模式。️ 隔离措施让评测调用看不见你项目的解法是让评测用的 runner 与操作者本人的 Agent 配置彻底断开。两个示例 runner 的完整命令见 evals/runners.example.jsonRunner关键隔离参数作用Claude--setting-sources 不加载用户级 settings、插件、钩子~/.claude下的常驻标志就此失效Codex--ignore-user-config --ephemeral忽略用户配置并临时隔离运行效果等价文档明确要求新增 runner 时必须保持这种隔离——否则用户级的插件、钩子、记忆、输出风格会泄漏进每一个条件悄悄重塑被评判的回复。一句话记忆隔离不是防作弊而是防你自己。 第二道隔离钉住模型版本隔离用户配置还顺带丢弃了操作者保存的默认模型。所以 runner 会用--model claude-opus-4-8显式钉住模型见 evals/runners.example.json原因有两个跨操作者一致不同人、不同时期的 CLI 默认模型可能不同不钉住模型两次评测就不可比成本可比按 token 计费随模型变化钉住模型才能把预算上限--budget-usd和实际花费对应起来。发布评测数字时必须连同 CLI 与模型版本一起记录这是 evals/README.md 的硬性要求。 盲审与发布闸门分数怎么才算数隔离保证了输入干净打分侧还有一层防偏差设计评分契约在 evals/rubric.md盲审评判时把condition字段遮蔽回复只标记 A/B/C避免知道这是候选组就偏向它五维加权正确性 35%、自主性 25%、可执行性 20%、安全性 10%、简洁性 10%发布闸门候选组必须无阻断项、正确性与安全性不劣于基线、加权总分高于基线且对外宣称对比时使用同一批用例、同一模型、同一 trial 数、同一评分标准。测试用例目录 evals/cases.jsonl 覆盖了直接问答、危险操作确认、医疗边界等 14 类场景闸门逻辑本身也有单元测试守护见 tests/test_run_evals.py——连两个条件不是在同一批题上判分这种情形都会被直接拒收。 新手清单跑任何 Agent 对比实验前自查查标志文件确认本机不存在.i-have-adhd-always之类的常驻标志或让 runner 明确绕过用户配置查全局钩子/插件任何 SessionStart 类钩子都可能改写基线钉住模型显式--model并在结果中记录版本号盲审判分评判前先遮蔽条件字段同题同参对比的两个条件必须来自相同用例、相同 trial 数、相同 rubric。评测隔离的本质就一句话你环境里的每一个顺手开着的配置都是实验变量。i-have-adhd 的评测系统把这一点做成了硬性约定——而它最讽刺也最精彩的细节恰恰是污染基线的元凶正是它自己。更多细节可阅读 evals/README.md 与 CONTRIBUTING.md。【免费下载链接】i-have-adhdA skill to stop your coding agent from burying the answer. ADHD-friendly output.项目地址: https://gitcode.com/GitHub_Trending/ih/i-have-adhd创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表