SKILL-KD面向LLM智能体的对比式技能蒸馏论文重点SKILL-KD提出了一种全新的对比式技能蒸馏框架将技能视为显式的蒸馏媒介通过在强弱智能体之间进行轨迹对比将教师与学生的行为差异蒸馏为文本形式的“技能补丁”并通过迭代验证和漂移感知合并来构建稳定、可复用的技能库。该方法在五个主流智能体基准测试中显著超越了现有的技能学习基线。核心研究内容问题定义大型语言模型LLM智能体在执行多步推理、工具调用和环境交互等任务时其成功与否不仅依赖于参数化知识更取决于可复用的程序化模式。现有的技能获取方法通常将技能视为经验总结、记忆条目或成功轨迹的直接摘要。这就产生了一个根本性的能力鸿沟问题当一个较弱的“学生”智能体因缺乏任务知识或操作策略而失败时其失败轨迹中往往不包含足够的信息来推断缺失的行为与此同时教师智能体的成功轨迹又可能过于隐式难以被学生内化为可复用的指导。传统的知识蒸馏方法依赖于参数更新但现实中很多学生模型是冻结的frozen无法进行微调。如何在不更新模型权重的前提下将教师的能力有效地转移给冻结的学生智能体是本文要解决的核心挑战。创新方法SKILL-KD的核心创新在于将技能蒸馏重构为一个迭代搜索与验证的过程而非一次性的摘要生成。其技术框架包含三个关键机制1. 对比式技能蒸馏Contrastive Skill Distillation给定同一个任务实例先让学生智能体在当前技能库下尝试执行。如果失败再让教师智能体执行同一任务。系统将学生的失败轨迹与教师的成功轨迹进行对比由“合并智能体”Consolidation Agent将两者之间的可操作差异蒸馏为一个文本形式的“技能补丁”skill patch。每个技能补丁在内部被表示为p (title, content, why, trace)其中title和content构成学生可见的可执行指令why记录更新理由trace链接到源轨迹。2. 自适应技能蒸馏Adaptive Skill Distillation与一次性生成技能不同SKILL-KD将技能提取视为文本技能空间中的迭代搜索。每生成一个候选补丁后系统会重新运行学生智能体来验证该补丁的实际效果。如果学生仍然失败合并智能体基于新的失败轨迹提出修正后的补丁如此迭代直到学生成功或达到最大轮次。这一机制的核心洞见在于直接总结对比差异并不保证规则能在学生策略下生效——学生可能以不同的方式解释指令或者需要更具体的表述才能改变行为。3. 漂移感知技能合并Drift-Aware Skill Consolidation反复的局部补丁更新可能导致技能漂移——补丁过度拟合狭隘场景、添加冗余规则或覆盖之前技能编码的知识。为此SKILL-KD维护了一个轨迹链接的编辑历史trace-linked edit history记录每次修改的原因和来源轨迹。合并智能体通过两个工具操作轨迹链接工具检索历史编辑背后的完整轨迹补丁工具执行添加、修改、删除或跳过操作。基于这些历史证据合并智能体决定每个补丁是应该添加新规则、删除/修改现有规则还是跳过。研究成果论文在五个智能体基准测试上进行了全面评估SearchQA搜索式问答SpreadsheetBench电子表格操作DocVQA多模态文档问答LiveMath数学推理ALFWorld具身环境交互实验采用两组师生配置配置学生模型教师模型类型Group 1Qwen3.5-4BQwen3.7-plus同构同系列Group 2Qwen3.6-35B-A3BChatGPT-5.5异构跨系列主要结果方法SearchQASpreadsheetBenchDocVQALiveMathALFWorld平均Group 1 (Qwen3.5-4B → Qwen3.7-plus)No Skill68.19.386.922.430.643.5EvoSkill68.617.979.723.467.951.5Trace2Skill68.519.388.027.264.953.6SkillGen69.213.288.821.070.152.5SkillOpt71.223.989.052.081.363.5SKILL-KD79.224.389.354.886.666.8Group 2 (Qwen3.6-35B-A3B → ChatGPT-5.5)No Skill72.738.287.631.259.757.9EvoSkill75.632.989.832.379.161.9Trace2Skill75.433.290.429.670.959.9SkillGen75.240.090.136.363.461.0SkillOpt80.347.591.441.682.168.6SKILL-KD80.649.392.254.896.374.6关键发现跨任务泛化在ALFWorld的未知环境测试中SKILL-KD将Qwen3.5-4B从30.6提升至86.656.0证明技能捕捉的是可复用的交互策略而非记忆训练轨迹。跨系列迁移在异构配置Qwen学生 ChatGPT教师下SKILL-KD依然取得一致提升证明自然语言技能载体不依赖模型架构相似性。效率优势SKILL-KD仅用38条规则3,010词就达到66.8的平均分而Student-only需要96条规则6,821词却只达到60.1分。实际落地应用的可能性SKILL-KD的实际应用价值体现在以下几个维度低成本智能体能力增强无需微调或重新训练仅通过外部技能库即可提升冻结模型的任务表现大幅降低部署成本。跨模型知识迁移由于技能以自然语言形式存在可以在不同厂商、不同系列的模型之间进行知识迁移打破模型生态壁垒。可解释的技能库每个技能都包含标题、内容和来源追溯形成可审计、可维护的知识资产。持续学习与技能演化技能库可以随着新任务不断积累和优化而漂移感知合并机制保证了库的紧凑性和稳定性。技术细节核心算法流程SKILL-KD的蒸馏过程可形式化描述如下输入训练实例集 D_train当前技能库 K学生 S教师 T合并智能体 C对于每个训练实例 x学生初始尝试τ₀^S S(x; K)评估得分 r₀^S r(x, τ₀^S)若 r₀^S 1跳过进入下一实例若学生失败运行教师 τ_T T(x; K)得 r_T r(x, τ_T)迭代补丁生成与验证i 1 到 n合并智能体基于对比证据生成补丁 p_i C(K, H, (τ₀^S, r₀^S), (τ_T, r_T), E_i)应用补丁后重新运行学生τ_i^S S(x; Apply(p_i, K))若 r(x, τ_i^S) 1接受补丁更新 K跳出循环否则记录失败证据继续下一轮若所有轮次均失败不产生技能更新技能表示与编辑历史技能库 K 是一个结构化的 Markdown 文档。每个技能条目包含title技能名称content可执行的操作指令对学生可见why更新理由仅合并智能体可见trace源轨迹索引仅合并智能体可见编辑历史 H 是层次化记录h_j (op_j, p_j)其中 op_j ∈ {add, modify, delete, skip}。自适应轮次的边际收益实验表明第一轮自适应是提升的主要来源将平均训练成功率从58.9%提升至67.7%。后续轮次仍有提升但边际递减第二轮至70.8%第三轮至72.7%。这些额外增益集中在SpreadsheetBench、LiveMath和ALFWorld等需要多步工具使用的复杂任务上。研究设定硬件与模型配置学生模型Qwen3.5-4BGroup 1和 Qwen3.6-35B-A3BGroup 2教师模型Qwen3.7-plusGroup 1和 ChatGPT-5.5Group 2合并智能体使用与教师相同的模型数据划分对于有官方划分的基准保留原生训练/验证/测试分割对于无官方划分的基准按 2:1:7 的比例确定性划分随机种子42技能库仅从训练实例构建验证集仅用于基线方法的选择评估指标采用各基准原生的硬成功率hard-success或精确匹配exact-match分数。综合分析方法论贡献SKILL-KD的核心洞察在于重新定义了“技能”的本质——不是经验的被动记录而是智能体之间能力差距的主动桥接。传统方法从成功中学习而SKILL-KD从对比中学习学生的失败揭示了“它缺什么”教师的成功揭示了“它应该有什么”两者的差距才是最有价值的训练信号。这种思路与人类学习中的对比案例教学法有异曲同工之妙——展示一个错误案例和一个正确案例让学习者自己比对差异往往比单独展示正确做法更有效。与现有工作的对比论文将SKILL-KD与四类基线方法进行了系统对比EvoSkill从执行失败中迭代分析并编辑技能Trace2Skill通过归纳推理将轨迹合并为技能目录SkillGen从成功/失败轨迹中归纳可复用模式SkillOpt将技能文档视为可优化状态通过验证集反馈进行编辑SKILL-KD在五个基准上的平均分均显著优于所有基线在Group 1中领先第二名3.3个百分点在Group 2中领先6.0个百分点。这得益于其两个独特设计以师生对比为核心学习信号以及将技能蒸馏视为自适应搜索过程。消融实验的启示自适应蒸馏的价值变体平均分规则数词数No Skill43.500Student-only60.1966,821Teacher-only58.3805,683Batch59.4463,849Pairwise59.0856,966SKILL-KD66.8383,010消融实验揭示了两个关键发现教师轨迹本身不足Teacher-only仅用教师轨迹是最弱的变体说明仅有强者的轨迹并不能保证产生学生可用的指导。自适应验证至关重要SKILL-KD用38条规则达到66.8分而Student-only用96条规则仅达到60.1分——更少的规则更好的效果证明“验证-迭代”机制能够筛选出真正有效的技能。漂移感知合并的价值无合并机制时SKILL-KD在SpreadsheetBench上从24.3降至14.6在LiveMath上从54.8降至27.4——性能几乎腰斩。这证明如果没有历史轨迹的追溯能力局部有效的补丁会相互干扰、覆盖导致技能库的整体效用急剧下降。案例研究进一步揭示了三种漂移模式案例特定漂移规则被反复用局部证据修订边界不断漂移技能膨胀漂移大量验证通过的补丁各自正确但编码了过多 incidental 细节如单元格坐标 P6:Q6破坏性更新漂移新补丁覆盖了之前有用的规则局限性与未来方向依赖教师质量虽然教师失败时仍能贡献38.5%的接受补丁但教师成功时的补丁接受率45.3%显著更高。计算开销每轮自适应都需要重新运行学生模型虽然论文显示第一轮即贡献主要增益但多轮迭代仍有额外成本。技能表达上限并非所有程序化知识都能用自然语言规则充分表达复杂策略可能需要更结构化的表示。实践应用适用场景模型即服务MaaS场景当使用第三方API模型且无法微调时SKILL-KD提供了一种通过外部技能库增强模型能力的途径。多智能体协作系统在包含强弱不同智能体的系统中可以让强智能体“指导”弱智能体通过技能蒸馏实现知识传递。领域知识沉淀将专家教师的解题策略转化为可复用的技能库供新手学生智能体调用形成组织级的智能体知识资产。跨版本模型迁移当升级到新版本模型时可以将旧版本积累的技能库迁移至新模型避免从零开始。实施建议从单轮自适应开始论文表明第一轮贡献了大部分增益建议先实现单轮验证再根据需求扩展至多轮。重视编辑历史的维护漂移感知合并是长期稳定性的关键务必维护完整的轨迹链接和编辑日志。合理设置迭代轮次上限论文建议3轮即可覆盖大部分收益更多轮次边际递减明显。技能库定期审计即使有自动合并机制仍建议定期人工审查技能库确保规则的质量和可解释性。参考资料原始论文SKILL-KD: Contrastive Skill Distillation for LLM AgentsPDF下载arXiv PDF