Attractive Metadata Attack诱导LLM智能体调用恶意工具度分析论文重点研究揭示了一个此前未被充分探索的LLM智能体安全威胁面——攻击者无需进行提示注入prompt injection也无需访问模型内部结构仅通过操纵恶意工具的元数据名称、描述、参数模式等即可诱导LLM智能体在正常任务执行过程中优先调用攻击者控制的工具。论文提出的Attractive Metadata AttackAMA是一种黑盒情境学习框架通过迭代优化生成极具吸引力但语法和语义均有效的工具元数据实验显示攻击成功率达81%–95%。核心研究内容问题定义随着LLM智能体通过调用外部工具来完成复杂推理和决策的能力不断增强工具调用的安全性问题日益凸显。现有的攻击方案主要依赖于对提示词或工具调用链的直接修改——例如通过提示注入篡改指令、操纵工具输出、构造异常执行路径等。然而作者发现了一个更加微妙且强大的攻击面操纵工具元数据。具体而言当前LLM智能体在选择调用哪个工具时通常会综合考虑用户的查询、任务上下文以及每个可用工具的元数据名称、描述、参数模式等。攻击者可以合法地构造恶意工具的元数据使其在智能体的选择机制中显得“ disproportionately attractive” disproportionately具有吸引力从而增加其被优先于良性工具调用的概率。这种攻击既不需要修改提示模板也不需要访问模型内部却能对智能体的行为进行长期且隐蔽的控制。攻击者的威胁模型设定为能够将恶意工具发布到第三方API平台如Rapid API Hub或重新打包一个普通工具使其看起来更受欢迎。攻击者无法访问智能体的架构、训练数据、参数或系统提示仅通过公共API进行交互。攻击目标则是诱使LLM智能体在任务执行期间调用指定的恶意工具造成潜在危害如隐私泄露的同时保持攻击的隐蔽性。创新方法AMA的核心创新在于将恶意工具元数据的生成问题形式化为一个状态-动作-值state-action-value优化任务由基于LLM的情境学习引导通过与智能体选择行为的迭代交互实现对高诱导性元数据的有效搜索。具体工作流程如下环境设定假设一个静态环境有固定的查询集合Q和一组正常的工具NT均从现有的开源工具学习系统如ToolBench中收集得到。状态State由当前生成的恶意工具及其相关的效用概率组成概率是相对于Q和NT定义的——即每个查询过一遍统计选择构造的恶意工具占总体的比例。动作Action通过情境学习生成新的恶意工具基于条件元组(Q, NT, S)由显式设计用于最大化智能体选择可能性的生成提示Pg驱动。这包括设计工具的名称、描述、参数模式以及其他与工具选择相关的元数据字段。值函数Value Function用于评估新生成的工具t在诱导智能体调用方面的有效性。为了支持高效且可扩展的元数据生成论文引入了三个关键机制生成可追溯性generation traceability加权值评估weighted value evaluation批量生成batch generation。这种设计使AMA能够无缝集成到标准工具生态系统中且无需修改智能体的执行框架。值得注意的是AMA与注入攻击是正交的可以与之结合以实现更强的攻击效果。研究成果论文在十个真实的模拟工具使用场景中进行了广泛实验覆盖了四个开源和一个商业LLM智能体。核心发现包括攻击成功率AMA在不同攻击设置下均取得了一致的高攻击成功率范围在81%至95%之间。隐私泄露攻击导致了显著的隐私泄露同时对主任务的执行影响微乎其微。防御绕过能力攻击即使在提示级防御、审计器auditor-based检测以及结构化工具选择协议如Model Context Protocol, MCP下仍然有效。系统性漏洞揭示这些发现揭示了当前智能体架构中存在的系统性安全漏洞。实际落地应用的可能性AMA揭示的安全威胁具有高度的现实紧迫性第三方工具平台的供应链风险攻击者可以在Rapid API Hub等第三方API平台上发布看似合法实则恶意的工具。由于元数据本身是合法的JSON格式平台很难通过自动化手段识别恶意意图。现有防御体系的失效传统的提示过滤和指令清洗在面对AMA时基本无效因为攻击并不涉及任何“恶意”的提示内容。这要求安全社区重新思考LLM智能体的防御架构。与现有攻击的叠加效应AMA与注入攻击正交可以组合使用以实现更强的攻击效果。这意味着即使防御者堵住了提示注入的漏洞攻击者仍可能通过元数据操纵达成目的。技术细节AMA的数学形式化论文将智能体对工具的偏好建模为一个潜在的打分函数t∗arg⁡max⁡t∈TS(q,O,Psys,Meta(t))t^* \arg\max_{t \in \mathcal{T}} \mathcal{S}(q, \mathcal{O}, P_{\text{sys}}, \text{Meta}(t))t∗argt∈Tmax​S(q,O,Psys​,Meta(t))其中qqq为用户查询O\mathcal{O}O为任务上下文PsysP_{\text{sys}}Psys​为系统提示Meta(t)\text{Meta}(t)Meta(t)为工具ttt的元数据攻击者的优化目标是最大化恶意工具tmt_mtm​被选中的概率max⁡Meta(tm)P(tm is selected ∣q,O,Psys,{Meta(t)}t∈T)\max_{\text{Meta}(t_m)} P(t_m \text{ is selected } | q, \mathcal{O}, P_{\text{sys}}, \{\text{Meta}(t)\}_{t \in \mathcal{T}})Meta(tm​)max​P(tm​is selected∣q,O,Psys​,{Meta(t)}t∈T​)迭代优化流程AMA的迭代优化流程可概括为初始化收集常见查询集合Q及其对应的正常工具NT生成基于LLM的上下文学习生成候选恶意工具的元数据评估在模拟环境中测试候选工具被智能体选中的概率更新根据评估结果利用值函数指导下一轮生成终止选择在攻击阶段具有最强诱导能力的工具攻击者只需构造符合标准JSON元数据模式的恶意工具描述即可使攻击融入正常的工具生态。攻击的隐蔽性特征AMA的隐蔽性体现在多个层面无提示干扰不修改任何提示模板或系统指令无模型访问不需要白盒访问模型内部无执行框架修改攻击工具符合标准API规范任务无感知主任务执行几乎不受影响研究设定实验配置实验场景10个真实的模拟工具使用场景测试智能体4个代表性的开源LLM智能体 1个商业LLM智能体工具数量405个工具覆盖10个领域攻击实例2,000个攻击实例评估指标攻击成功率ASR、任务完成质量、隐私泄露程度攻击者能力假设能够将工具发布到第三方API平台如Rapid API Hub能够重新打包普通工具使其看起来更受欢迎无法访问智能体的架构、训练数据、参数或系统提示仅通过公共API与智能体交互恶意工具符合标准的JSON元数据模式防御评估论文评估了以下防御机制的有效性提示级清理和指令过滤审计器auditor-based检测Model Context ProtocolMCP等结构化工具选择协议综合分析为什么AMA如此有效AMA的有效性根植于当前LLM智能体工具选择机制的一个结构性缺陷智能体在选择工具时对元数据的“信任”是没有边界的。元数据本质上是工具作者提供的“自我介绍”而LLM智能体缺乏验证这些信息真实性的能力。当一个恶意工具的描述声称自己“能够高效完成某项任务”时智能体倾向于相信这一描述并优先调用该工具——这正是AMA所利用的心理机制。这与现实世界中的“包装”问题如出一辙——一个精心包装的产品往往比一个功能相同但包装简陋的产品更容易获得消费者的青睐。在LLM智能体的语境中这种“包装效应”被放大了因为智能体缺乏人类消费者所具有的 skepticism怀疑精神和背景知识。对安全社区的启示AMA的研究结果对LLM智能体安全社区提出了几个深刻的挑战第一防御需要从“内容层面”扩展到“执行层面”。仅仅过滤提示中的恶意内容已经不够了——攻击者可以通过完全“干净”的元数据实现攻击目标。这要求我们重新思考防御的边界在哪里。第二工具注册和审核机制需要根本性改革。当前第三方工具平台的审核主要关注代码层面的安全性是否有恶意代码、是否窃取数据等但AMA表明即使工具代码本身是“干净”的仅仅通过元数据的操纵就足以造成危害。平台需要考虑对工具元数据进行更加严格的审查和验证。第三智能体的工具选择逻辑需要引入“信任度”概念。就像人类不会盲目相信每一个广告一样LLM智能体也应该对新接入的工具保持一定的 skepticism尤其是在工具来自不可信来源的情况下。研究的局限性从学术角度看这项研究也有其局限性。攻击场景假设攻击者能够将工具发布到第三方平台或重新打包现有工具——这在现实世界中确实可行但并非在所有场景下都可行。此外论文主要关注的是工具“选择”阶段的攻击对于工具“执行”阶段和“结果处理”阶段的安全问题探讨相对有限。实践应用对开发者的建议工具来源管理对智能体可调用的工具实施严格的来源管理限制仅从可信平台获取工具。对于来自不可信来源的工具应进行额外的安全审查。元数据异常检测部署元数据异常检测机制识别那些“过于完美”或“过度承诺”的工具描述。例如如果一个工具的描述中包含了大量与核心功能无关的吸引性词汇应触发警报。执行级沙箱即使智能体调用了恶意工具也应通过沙箱机制限制工具的执行权限防止敏感数据泄露或系统破坏。工具调用的审计日志建立详细的工具调用审计日志包括工具被调用的原因、上下文以及调用的结果便于事后分析和攻击溯源。对平台运营者的建议元数据审核在工具上架前不仅审核代码本身还应审核元数据是否存在过度诱导性描述。工具分级制度根据工具的来源和审核程度对工具进行分级标注帮助智能体和用户识别可信度较高的工具。社区举报机制建立快速响应的社区举报机制允许用户和开发者报告可疑的工具元数据。参考资料来源原始论文NeurIPS 2025: https://neurips.cc/virtual/2025/loc/san-diego/poster/116046arXiv预印本: https://arxiv.org/abs/2508.02110论文代码: https://github.com/SEAIC-M/AMANeurIPS Proceedings: https://proceedings.neurips.cc/paper_files/paper/2025/hash/ee46288ab2aaf5c6e53aebebe719712c-Abstract-Conference.html