尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

[论文学习]MAFIA:面向审计型LLM智能体的查询式内存攻击 通过探测与事实注入实现

[论文学习]MAFIA:面向审计型LLM智能体的查询式内存攻击 通过探测与事实注入实现 MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents (2026)论文重点本文提出了一种名为MAFIA的查询式内存攻击框架专门针对配备外部记忆模块的LLM智能体。该攻击通过检索探测Retrieval Probing定位最优注入位置并利用紧凑事实伪装Compact Factual Cloak规避输入审计在大型良性记忆池和输入审计的双重现实约束下实现了最高90.7%的攻击成功率同时将审计检测率从83.3%压制至7.4%以下。核心研究内容问题定义记忆增强型LLM智能体依赖外部记忆模块存储历史交互记录以实现长期推理。然而现有查询式内存攻击如MINJA在两类现实场景中失效一是大型良性记忆池中恶意记录难以竞争top-K检索槽位二是输入审计系统会检测并拦截带有显式指令或对抗性信号的查询。本文旨在解决检索竞争力与审计规避的双重挑战。创新方法MAFIA提出了两阶段攻击框架检索探测式投放策略Placement Strategy通过黑盒探测推断记忆空间的语义分布利用层次聚类识别密集语义区域再通过大小排序轮询分配size-ranked round-robin将有限的注入预算分配到最可能被未来受害者查询检索到的区域。紧凑事实伪装载荷Compact Factual Cloak Payload采用“patient V (→patient T in this DB)”模板将恶意映射伪装为数据库事实注解而非指令性语句既保持与受害者查询的语义邻近性又规避LLM审计器的检测。研究成果在四个智能体-数据集配置EHRAgent on MIMIC-III/eICU、RAP on WebShop、DataInterpreter on HuggingFace Hub上的实验表明MAFIA在审计后仍保持69.63%95.56%的注入成功率和56.66%90.74%的攻击成功率单条记录审计检测率从MINJA的68.40%83.30%降至0.00%7.40%在不同LLM骨干网络GPT-5.4-mini、Claude-Sonnet-4.6、Gemini-3.1-pro、Kimi-K2.6上均保持有效在多种检索编码器下RIR4均显著优于MINJA。实际落地应用的可能性MAFIA揭示了当前RAG型LLM智能体记忆系统的根本性安全漏洞。对于防御方该研究为设计更鲁棒的输入审计机制和记忆侧防御提供了重要的攻击模型参考对于攻击方安全测试场景MAFIA提供了一套可复现的渗透测试方法论。论文代码已承诺开源https://github.com/JiamingChen1234/MAFIA便于安全社区进行复现与防御研究。技术细节1. 检索探测Memory ProbingMAFIA的攻击者无法直接访问记忆库只能通过正常的查询接口与智能体交互。为推断目标查询的语义分布攻击者合成K_p个多样化种子查询利用黑盒提取方法借鉴MEXTRA从智能体响应中提取检索到的历史问题字段。收集到的表面问题字段D随后用于后续聚类。2. 聚类与预算分配Clustering and Budget Allocation将D中的问题嵌入向量后采用凝聚层次聚类Agglomerative Clustering分组。聚类大小|C|用于估计各查询区域在代理数据中的表征强度。随后执行大小排序轮询分配按聚类大小降序排列轮询遍历直至预算b耗尽每一步选择距离当前聚类中心最近的未选择问题作为注入模板。该策略优先支持度强的区域同时保持跨区域覆盖。3. 注入调度Injection Scheduling基模板按聚类大小升序注入小簇优先。这样稀疏语义区域良性竞争较弱中的V→T记录更可能被检索到作为演示强化后续大簇攻击时的目标导向生成。实验表明升序注入的ASR75.40%显著优于降序60.19%。4. 紧凑事实伪装Compact Factual Cloak载荷采用模板patient V (→patient T in this DB)。三部分设计各有考量括号将伪装框定为补充模式注解审计器视为良性标注而非行为指令箭头编码替换关系不含审计器敏感的动作动词“in this DB”将映射提升为数据本地事实智能体在写入时将其作为任务证据采纳。由于三部分均限制在紧凑的括号插入中基查询在嵌入空间中仍占主导使伪装记录落在受害者查询的语义邻域内。5. 关键公式与指标检索命中率KRIRK恶意记录出现在top-K检索结果中的比例平均毒化计数K̄npKtop-K中恶意记录的平均数量注入成功率ISR通过审计并成功写入记忆的攻击查询比例攻击成功率ASR未过滤的干净受害者查询触发目标导向响应的比例检测率DR被防御系统标记的攻击实例比例研究设定智能体与数据集论文使用gpt-5.4-mini作为所有智能体的骨干LLM评估四个配置智能体数据集攻击目标EHRAgentMIMIC-III患者记录查询重定向SUBJECT_ID替换EHRAgenteICU药物替换为危险处方推荐RAPWebShop购物查询重定向至目标品牌DataInterpreterHuggingFace Hub软件工程中的模型依赖替换每个配置实例化9个受害者-目标V, T对。记忆池与检索MIMIC-III/eICU约5.8K条EHRSQL良性记录WebShop2,000条记录DataInterpreter2,000条从标准指令微调和代码基准中整理的记录检索器e5-small-v2余弦相似度K4WebShop为K3输入审计每个候选记录在写入前由gpt-5.4-mini输入审计器使用注入检测提示筛选被分类为INJECTION的记录被丢弃。攻击预算探测预算300条探测查询在9个pair间摊销注入预算MIMIC-III每pair 90次攻击其他配置每pair 30次综合分析学术贡献MAFIA首次在大型良性记忆池输入审计的双重现实约束下系统评估了查询式内存攻击。先前工作如MINJA虽然在理想条件下效果显著但面对密集检索竞争和语义审计时双双失效。MAFIA的核心洞见在于将记忆系统的结构性约束永久性和规模转化为攻击机会——永久性使通过审计的恶意记录可持久留存规模则通过探测揭示的语义分布指导精准投放。方法论的优雅性MAFIA的两阶段设计体现了精妙的工程权衡。投放阶段解决了“往哪投”的问题——通过黑盒探测推断记忆分布这在攻击者仅有查询权限的场景下极具实用价值。载荷阶段解决了“怎么投”的问题——紧凑事实伪装在语义邻近性确保检索竞争力和审计规避性避免指令检测之间找到了精妙的平衡点。实验中MAFIA在审计后仍保持69.63%~95.56%的Post-ISR说明其载荷设计成功规避了审计而MINJA的Post-ISR在某些配置下降至0%凸显了显式指令在面对审计时的脆弱性。防御启示论文还评估了记忆侧防御A-MemGuard发现其虽能检测75.6%的MAFIA毒化出现但伴有44.9%的误报率对实际部署而言过高。这揭示了一个深层困境过于敏感的防御会严重影响正常用户体验而宽松的防御又无法阻挡MAFIA这类精密攻击。如何在检测率与误报率之间取得可接受的平衡仍是开放问题。局限性与未来方向MAFIA主要聚焦于RAG-based记忆系统对新兴的长时记忆LTM系统尚未充分验证。此外论文测试的审计器主要为基于LLM的文本级检测器面对更复杂的多模态审计或行为级审计时MAFIA是否依然有效尚待探索。实践应用对于安全研究人员与防御方审计机制加固MAFIA表明当前LLM-based审计器对“事实伪装”类攻击的检测能力严重不足检测率从83.3%降至7.4%。建议审计系统不仅要检测显式指令还需引入语义一致性检查——即判断查询的语义内容是否与其表面形式匹配。记忆侧防御虽然A-MemGuard误报率较高但其思路检索后一致性检查值得深化。可探索结合写入时审计与检索时验证的双层防御架构。预算监控MAFIA依赖有限的注入预算每pair 30-90次说明基于频率的异常检测可作为辅助防御手段。对于AI系统开发者记忆隔离考虑对不同用户会话的记忆进行隔离避免跨会话的毒化传播。检索策略硬化MAFIA的成功依赖于恶意记录与受害者查询的语义邻近性。可尝试引入多样性惩罚或来源可信度加权的检索策略。输入规范化对括号、箭头等特殊格式进行标准化处理削弱事实伪装的有效性。对于红队测试MAFIA提供了一套系统化的渗透测试方法论阶段一通过探测查询映射目标系统的记忆分布阶段二基于聚类结果精准投放伪装载荷阶段三利用小簇优先调度强化攻击效果这套方法论可推广至其他RAG系统的安全评估中。参考资料原始论文Chen, J., Gao, Y., Li, Y., Liu, Z., Zhang, Y., Zhang, J. (2026). MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents.arXiv preprint arXiv:2608.03844. https://arxiv.org/abs/2608.03844代码仓库https://github.com/JiamingChen1234/MAFIA
返回列表