尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

字节:拓扑感知自蒸馏优化智能体

字节:拓扑感知自蒸馏优化智能体 标题DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents来源arXiv, 2608.18524v1️文章简介研究问题如何解决多轮工具调用中因强制线性轨迹模仿导致的拓扑坍塌及有效探索被惩罚的问题主要贡献论文提出DART-SD框架通过拓扑感知的局部校正取代全局强制模仿显著提升智能体性能。重点思路构建交互状态转移图ISTG将执行过程建模为图结构节点定义为累积交互状态而非瞬时动作捕捉顺序无关子目标形成的菱形拓扑区分获取信息的主节点和无用探索的辅节点。定义关键拓扑断点CTB通过将学生状态投影到经验成功可达区域识别学生首次偏离教师支持区域的转折点以此界定能力边界并确定需要校正的起始位置。实施CTB引导的局部监督检索ISTG中成功的恢复参考仅对CTB之后的恢复步骤计算训练损失严格保护CTB之前的有效推理前缀免受破坏性梯度更新。采用渐进式自蒸馏范式迭代运行学生模型动态识别其 evolving 能力边界逐步将监督重点推向更复杂的恢复行为使模型循序渐进地掌握长程工具使用策略。分析总结DART-SD在五个基准测试中均优于传统的SFT和RL基线且在Qwen3-4B和8B不同规模模型上表现稳健证明了其泛化能力。该方法能有效缩短成功轨迹的工具调用长度最终生成的轨迹甚至比黄金参考更短表明模型学会了更高效的策略而非盲目记忆。随着训练迭代失败轨迹中的CTB位置逐渐后移证明模型的有效交互前缀不断延长能够正确处理更复杂的多步任务。消融实验证实ISTG结构、CTB定位、局部监督及渐进式蒸馏各组件均对性能提升有显著贡献缺一不可。在保留通用能力方面DART-SD在数学推理和知识问答等标准基准上也优于基线说明局部监督未损害模型的基础推理能力。个人观点论文洞察了多轮工具调用的图结构本质打破了传统线性轨迹模仿的局限。将全局优化转化为局部精准修正既避免了无效探索对模型的干扰又保留了有价值的推理路径。
返回列表