尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

[论文学习]多模态智能体对抗攻击研究深度分析

[论文学习]多模态智能体对抗攻击研究深度分析 Adversarial Attacks on Multimodal Agents (ICLR 2025)论文重点本文系统性地研究了多模态语言模型智能体在真实Web环境中的对抗鲁棒性问题。作者提出了智能体鲁棒性评估框架ARE将智能体视为组件间的信息流图通过200个手动标注的对抗任务揭示了即便使用最先进的黑盒模型如GPT-4o攻击者仅需对单个图像施加不到5%像素的微小扰动即可实现最高67%的定向攻击成功率。核心研究内容问题定义随着语言模型从聊天机器人向自主智能体演进安全评估的范式需要根本性转变。聊天机器人的安全评估主要关注模型直接输出有害内容而智能体是由多个组件构成的复合系统需要感知环境、规划行动并与外部世界交互。攻击者可以通过操纵环境中的部分输入如图片让攻击信息在多个组件间传播最终“劫持”智能体执行攻击者预设的恶意目标。现有的LM安全评估方法无法充分应对这种复合系统的攻击面。创新方法论文的核心创新在于提出了智能体鲁棒性评估ARE框架。ARE将智能体抽象为一个有向图节点代表组件如策略模型、评估器、字幕生成器等边代表中间输出在组件间的流动。ARE框架的关键设计包括边权重Edge Weightλ(e)定义为上游组件输出中包含对抗信息的最大概率即该中间输出被下游“完美遵循”时所能达到的最髙攻击成功率。这使得边权重只需计算一次可复用于不同的下游配置。对抗影响度量Adversarial Influence, AdvIn针对不同类型的中间输出观测、动作、字幕、反思等定义其是否包含对抗信息。鲁棒性分解通过比较组件入边权重和出边权重的变化判断该组件是“鲁棒化”权重下降还是“脆弱化”权重上升。研究成果实验基于VisualWebArenaVWA环境构建了VWA-Adv对抗任务集包含200个手动标注的定向对抗任务。主要发现如下攻击成功率在图像访问场景中攻击者仅需修改页面总像素不到5%的单个图像即可实现最高67%的定向攻击成功率。推理时计算的“双刃剑”效应通常用于提升良性性能的推理时计算如反思机制和树搜索反而可能引入新的漏洞。攻击者可以攻破反思智能体的评估器或树搜索智能体的价值函数使攻击成功率相对提升15%和20%。鲁棒性-效用权衡不同模型在良性成功率和对抗鲁棒性之间表现出不同的权衡曲线GPT-4o在二者之间取得了相对较好的平衡。基础防御效果有限基于安全提示和一致性检查的基线防御措施仅能提供有限的防护。实际落地应用的可能性安全评估工具ARE框架可作为智能体系统上线前的标准化安全评估工具帮助企业量化智能体的对抗鲁棒性风险。红队测试VWA-Adv任务集和攻击方法可用于红队测试在部署前发现智能体的潜在安全漏洞。鲁棒性设计指导框架提供的组件级鲁棒性分析可指导开发者识别系统中的脆弱环节进行针对性加固。多模态输入审核研究发现图像攻击比文本攻击更具隐蔽性提示多模态系统需要对视觉输入建立更严格的审核机制。技术细节威胁模型设定论文假设攻击者只能操纵环境中的部分输入一个图像且修改幅度极小∞-范数约束下≤ϵ。攻击目标是让智能体执行预设的恶意行为如导航到钓鱼网站而非仅仅让模型输出有害内容。攻击方法1. 黑盒提示注入攻击文本访问场景攻击者直接在触发文本中注入对抗性文本z该文本与原始文本和截图一同传入语言模型。2. 白盒图像攻击图像访问场景当智能体系统中存在白盒组件如客户端运行的输入处理器时使用投影梯度下降PGD优化扰动δmax⁡∥δ∥∞≤ϵlog⁡πcomp(z∣xδ)(1)\max_{\|\delta\|_\infty \leq \epsilon} \log \pi_{\text{comp}}(z | x \delta) \tag{1}∥δ∥∞​≤ϵmax​logπcomp​(z∣xδ)(1)3. 黑盒图像攻击CLIP攻击图像访问场景当所有组件均为黑盒时通过攻击多个CLIP模型编码器ViT-B/32、ViT-B/16、ViT-L/14、ViT-L/14336px作为替代模型利用迁移性实现攻击max⁡∥δ∥∞≤ϵ∑i1N[cos⁡(Ex(i)(xδ),Ey(i)(z))−cos⁡(Ex(i)(xδ),Ey(i)(z−))](2)\max_{\|\delta\|_\infty \leq \epsilon} \sum_{i1}^{N} \left[ \cos(E_x^{(i)}(x\delta), E_y^{(i)}(z)) - \cos(E_x^{(i)}(x\delta), E_y^{(i)}(z^-)) \right] \tag{2}∥δ∥∞​≤ϵmax​i1∑N​[cos(Ex(i)​(xδ),Ey(i)​(z))−cos(Ex(i)​(xδ),Ey(i)​(z−))](2)其中z为对抗文本z⁻为负面文本攻击者希望抑制的内容。关键技巧是在180像素的低分辨率下优化扰动这对攻击的可迁移性至关重要。研究设定环境配置基础环境VisualWebArenaVWA一个用于多模态Web智能体的真实环境对抗任务VWA-Adv200个手动标注的定向对抗任务攻击面智能体截图中的单个图像约占总像素的5%智能体配置研究的智能体系统包括组件类型说明策略模型Policy ModelGPT-4V、GPT-4o等黑盒前沿语言模型字幕生成器Captioner将图像转换为文本描述评估器Evaluator判断轨迹是否达成目标反思智能体价值函数Value Function评估状态价值树搜索智能体硬件/软件要求API依赖需要访问GPT-4V、GPT-4o等商业API开源模型CLIP系列编码器ViT-B/32、ViT-B/16、ViT-L/14等代码与数据官方已开源所有攻击、防御和评估代码综合分析理论贡献这篇论文在ICLR 2025上以Oral形式发表并在NeurIPS 2024 Open-World Agents Workshop上展示体现了学术界对该工作的高度认可。其核心理论贡献在于从“模型安全”到“系统安全”的范式跃迁。以往对抗攻击研究主要关注单一模型图像分类器或语言模型的鲁棒性而本文首次系统性地将复合智能体系统作为研究对象揭示了“局部鲁棒 ≠ 全局鲁棒”的深刻洞见——即使每个组件本身是鲁棒的组合起来可能产生意想不到的脆弱性。方法论的独特性ARE框架的创新之处在于将复杂的智能体行为抽象为可量化的信息流图。这种抽象使得研究者能够定位脆弱环节通过比较边权重的变化精确识别哪个组件是攻击传播的“放大器”预测新组件的影响在添加新组件之前可评估其对整体鲁棒性的潜在影响跨架构比较不同智能体架构可在统一的框架下进行鲁棒性对比反直觉的发现论文最令人警醒的发现是推理时计算的双刃剑效应。增加反思机制或树搜索通常能提升智能体的任务成功率但这些额外的推理步骤也为攻击者提供了更多的攻击注入点。攻击者不需要直接攻破策略模型只需攻破评估器或价值函数就能间接操纵整个智能体的行为。这说明**“更强的智能”未必意味着“更安全的安全”** ——能力的提升可能同时扩大攻击面。对防御研究的启示论文发现基础防御安全提示、一致性检查效果有限这提示我们防御需要系统性思考不能仅依赖单点防护需要在整个信息流图中设置多层防御输入可信度分离将可信输入系统指令与不可信输入用户提供的图像/文本明确区分输出一致性验证对关键决策进行多路径交叉验证实践应用对智能体开发者的建议上线前进行ARE评估在部署任何多模态智能体之前使用ARE框架进行系统性的对抗鲁棒性评估关注图像输入安全研究发现图像攻击比文本攻击更难检测且更具隐蔽性应建立专门的图像输入审核管道谨慎添加推理组件反思、搜索等推理增强组件虽然提升性能但也扩大了攻击面需要权衡安全与效用的取舍实施输入隔离将来自不可信源的输入用户上传的图像与可信输入系统提示严格分离处理对安全研究者的建议红队测试标准化将VWA-Adv作为多模态智能体红队测试的基准探索新型防御基于ARE框架的洞察开发针对信息流层面的防御机制而非仅依赖单模型鲁棒性关注迁移攻击CLIP攻击的成功表明黑盒场景下的攻击是现实威胁需要开发针对迁移攻击的防御对企业的建议风险评估在将多模态智能体部署到面向用户的实际场景前评估对抗攻击可能造成的业务风险监控与检测建立运行时监控机制检测智能体行为是否出现异常偏离分级部署对于高安全要求的场景限制智能体对不可信输入的访问权限参考资料来源原始论文Wu, C. H., Shah, R., Koh, J. Y., Salakhutdinov, R., Fried, D., Raghunathan, A. (2025). Dissecting Adversarial Robustness of Multimodal LM Agents.ICLR 2025. https://arxiv.org/abs/2406.12814
返回列表