![[论文学习]潜伏通道与来源门控:常驻自主AI代理中的持久性提示注入攻击](http://pic.xiahunao.cn/yaotu/[论文学习]潜伏通道与来源门控:常驻自主AI代理中的持久性提示注入攻击)
Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents论文重点本文首次系统性地定义了“潜伏通道”Sleeper Channels这一威胁类别——攻击者通过一次不可信输入使其持久化存留于记忆、技能、定时任务或文件系统中并在数小时甚至数周后通过完全不同的交互界面触发恶意行为期间攻击者无需任何进一步交互。论文提出了基于来源追踪与动作实例摘要的三层防御体系核心是一个位于模型循环之外的执行门控机制D2并配套了完备性定理证明与可执行参考实现。核心研究内容问题定义常驻AI代理如OpenClaw、Hermes Agent以单一持久进程运行集成了消息收发、长期记忆、自主编写技能、定时调度和Shell执行等能力于同一个权威边界内。这种架构产生了“潜伏通道”一个来自不可信输入的内容持久化为记忆、技能、定时任务或文件系统补丁随后在攻击者不在场的情况下通过另一个交互界面被触发执行。具体而言论文识别出五个持久化维度上下文窗口、长期记忆、自编写技能、文件系统状态、定时/外部触发器和四个触发分离维度会话、通道、执行者、执行上下文构成一个5×5的威胁矩阵。现有文献分别研究单轮间接注入、单会话Web工具代理、仅内存持久化等问题但没有一个将多个持久化基底与跨界面触发作为统一威胁类别处理。创新方法三层防御架构D0/D1/D2/D3D0为无防护基线D1在模型上下文内嵌入来源标签并要求模型依据标签拒绝D2在模型循环之外设置强制门控基于动作实例摘要和一次性所有者认证进行裁决D3在D2基础上增加按技能声明的能力清单。动作实例摘要Action-Instance Digest对每个有副作用的动作计算规范化的SHA-256摘要涵盖动作类型、因果输入集、参数、目标和执行者设备。认证绑定到该摘要而非工具类型从根本上防止了意译洗白、多输入授权复用和重放攻击。来源追踪与因果闭包为每个工件维护来源标签τ和累积来源状态Π传播规则满足单调性任何不可信输入严格扩大Π。门控判据为允许执行当且仅当所有因果贡献者的来源都在信任集内或存在匹配的一次性认证。完整中介的十个钩子分为更新钩子H1-H5填充τ和传播Π和门控钩子H6-H10裁决前执行裁决。任何未列出的动作类型默认拒绝体现默认拒绝原则。研究成果形式化威胁模型与分类法给出了潜伏通道攻击的严格数学定义——一个五元组 (T₀, u, σ₀, S, T₁, θ, σ₁, κ₁, α)并完整填充了5×5威胁矩阵明确标注了哪些单元已被前人工作覆盖、哪些是本论文的说明性场景、哪些在该基底上不适用。端到端攻击走查以A4场景M5×C4定时任务通过混淆代理触发为主线完整追溯了从攻击者邮件进入邮件网关、被记忆管道摘要存储、数天后所有者在良性请求中触发、代理检索被投毒的笔记并合成指向攻击者WebHook的cron任务的全链条。论文在OpenClaw的固定commit上逐一确认了每个载荷承载的源代码锚点。实证探针使用前沿推理模型进行n20单次试验模型收到OpenClaw的安全警告原文和包裹在唯一ID标记中的被投毒记忆笔记后19/20次输出了指向攻击者URL的合法cron.add调用两阶段变体n10仍有7/10次输出攻击者结果。这一结果有力支持了“仅靠上下文内安全信号不足以防御”的核心论点。完备性定理在七条运行时不变式I-Mediation、I-Tag、I-Causal、I-Channel、I-GrantAuth、I-Nonce、I-Hash的假设下证明了D2门控的可靠性——任何被D2分发的动作要么其所有因果贡献者都来自可信来源要么存在一个由可信主体签发、绑定到该精确动作实例的一次性认证。实际落地应用的可行性论文提供了完整的可执行参考实现包括对固定OpenClaw commit的静态审计src-audit/audit.ts13个测试用例和实现了H1、H2、H3、H6、H9五个中介钩子的运行时适配器42个测试Node ≥20代码开源在github.com/maloyan/sleeper-channels。该架构可直接集成到现有常驻AI代理中尤其适用于企业级自主代理部署、个人AI助手以及任何涉及多数据源、多交互界面的LLM驱动系统。技术细节1. 潜伏通道的形式化定义论文将潜伏通道攻击定义为以下元组在T₀时刻不可信但被允许的内容u通过界面σ₀进入系统并持久化在基底S中直到T₁ T₀时刻在(T₀, T₁]区间内无攻击者交互。在T₁时刻触发器θ良性用户请求、内部代理循环或外部事件如cron导致该影响表现为有后果的动作α在界面σ₁和执行上下文κ₁中执行。持久化基底M1-M5M1同一会话的上下文窗口M2长期记忆M3自编写的技能M4文件系统状态被动由其他进程读取M5定时任务或外部触发器主动定时器无需代理即可触发触发分离维度C0-C4C0同一界面、同一会话C1同一界面、后续会话C2跨界面C3跨执行者向所有者的联系人外发C4跨执行上下文2. 来源追踪与动作实例摘要来源标签与累积来源状态τ : A → 2^S // 每个工件的来源标签集合 Π : A → 2^S // 累积来源状态 // 传播规则对于派生工件 Π(f(b₁, ..., bₙ)) ⋃ᵢ ( τ(bᵢ) ∪ Π(bᵢ) ) // 单调性任何不可信输入严格扩大Π动作实例摘要δ(α) H( kind, sort(causal), cjson(args), target, ownerDevice )其中H为SHA-256cjson为确定性规范JSON编码器。摘要计算在运行时规范化之后进行因此语义等价但语法不同的两个动作产生相同的δ。门控判据Allow(α) ⇔ α.kind ∈ C ∧ wf(α) ∧ ( Πα ⊆ T ∨ attest(α) )其中wf(α)要求causal(α) ≠ ⊥且每个因果贡献者都有非空的Π或τ无来源不明的贡献者。3. D2的十个中介钩子更新钩子H1-H5——填充τ和传播ΠH1 入站适配器从网关的已认证来源设置τ(b)H2 记忆写入在因果来源上封闭ΠH3 记忆检索将召回的记忆注册为下一个门控的因果贡献者H4 技能/插件/MCP创建或修改传播Π设置τ ∅H5 技能/插件/MCP加载将清单和主体注册为独立工件门控钩子H6-H10——在任何有副作用的派发之前裁决H6 工具调用构造注册模型发出的工具调用文本并提交给门控H7 主机Shell命令派发H8 暂存区外的文件系统写入H9 定时任务条目创建/修改/删除H10 出站网络或消息发送4. A4攻击的因果链以OpenClaw为例以A4场景M5×C4为例攻击的完整因果链为T₀攻击者邮件到达配置的邮件网关正文嵌入指向atk-sink.example的WebHook URL持久化代理的记忆管道将邮件摘要为存储笔记包含该URLT₁数天后所有者询问“设置一下我们收到的那封邮件里提到的每日健康检查”检索代理检索被投毒的笔记合成代理合成cron.add调用WebHook URL指向攻击者执行运行时将调用视为所有者发出的cron守护进程在C4上下文中执行载荷承载的源代码锚点均在固定commit上确认分发枚举cron-tool.ts第37行CronDeliverySchema接受任意URL第180-202行normalizeHttpWebhookUrl接受任意http(s) URL第670-675行ownerOnly接线第525行5. D2完备性定理简述定理D2可靠性在七条运行时不变式完整中介、标签来源可信、因果闭包可枚举、认证通道隔离、认证不可伪造、一次性随机数防重放、哈希抗碰撞成立的前提下D2分发的每个动作α必然满足要么Πα ⊆ T所有因果贡献者可信要么存在一个由可信主体签发、绑定到α的精确动作实例字节的一次性认证且该认证在分发时尚未被消费并在分发前已被原子性地消耗。证明思路由中介不变式和因果不变式causal(α)要么为⊥拒绝要么为有限集合其来源标签在H1入站时设置或通过受控传播继承。单调传播将所有贡献的τ(bᵢ)纳入Πα门控规则仅在Πα ⊆ T或attest(α)时分发。在认证分支中哈希不变式强制δ₉ δ(α)绑定到确切的规范化后字节。通道不变式限制认证只能通过Σ到达。认证权威不变式强制q₉来自已验证的认证器而非模型可影响的数据。一次性随机数不变式通过持久且唯一的账本防止重放。研究设定目标系统论文以OpenClawMIT许可本地优先和Hermes Agent为典型研究对象。OpenClaw在固定commit3120401f...1829b1b62026-04-27上进行分析配套工件打包了所有引用的文件以便审查者验证每个“从源码确认”的声明。配置锚定论文锚定三个文档化的配置配置文件P0仅网关禁用技能、Shell和文件系统P1默认授权基线启用主会话的主机访问、ClawHub工作区技能、记忆、按工具首次使用确认以及workspaceAccessnoneP2添加调度器、出站网络、第三方ClawHub技能和workspaceAccessrw实验设置模型探针使用前沿推理模型温度T1.0模型身份在审稿阶段匿名化单次试验n20模型收到OpenClaw安全警告原文external-content.ts第81-82行和包裹在唯一ID标记中的被投毒记忆笔记两阶段变体n10模拟更自然的交互流程配套代码42个测试Node ≥20开源在github.com/maloyan/sleeper-channels攻击成功度量攻击成功度量已预注册为后续工作。论文中的探针数据用于支撑“上下文内警告本身无法防止A4”的叙事性主张定量D1声明依赖预注册评估。综合分析1. 威胁模型的现实意义这篇论文揭示的问题并非理论推演。常驻AI代理正在从实验品走向日常工具——个人助手、企业自动化、开发环境集成——而它们“常驻”的本质意味着攻击窗口从“每次对话”变成了“持续数月”。论文中Alice的故事虽然被标注为“ plausible-but-fictional”但其中的每一个技术环节都在OpenClaw的实际代码中得到了确认。这种“一次投毒永久潜伏”的攻击模式与传统网络安全中“攻击者必须持续在场”的假设形成了根本性断裂。2. 为什么上下文内防御注定失败D1方案在模型上下文内显示来源标签并要求模型拒绝的失败有两个深层原因。其一自适应攻击文献已经证明针对上下文内防御的对抗性攻击可以达到≥90%的攻击成功率。其二更重要的是架构层面的根本缺陷模型本质上是统计推理引擎不是强制执行器。让模型“自愿”遵守安全策略等同于让应用层协议自行校验自己的合法性——这在安全工程中早已被证明是不可靠的。论文将执行边界移到模型循环之外是对这一根本问题的正确回应。3. 动作实例摘要的设计精妙之处D2最巧妙的设计是动作实例摘要。传统方案按工具类型授权如“允许cron工具”攻击者只需让模型调用该工具即可。而D2的摘要包含完整的因果输入集、规范化的参数和目标意味着认证绑定到“这个具体的动作、由这些具体的输入促成、发往这个具体的目标”。意译洗白paraphrase laundering——攻击者让模型用自己的话重写恶意指令以绕过检测——在这里失效了因为无论模型如何重写最终的工具调用参数和因果链都会被摘要捕获。一次性随机数机制则防止了重放攻击——同一个认证不能重复使用。4. 完整中介的工程挑战论文坦率地承认了D2的局限性。十个钩子中当前实现只覆盖了H1、H2、H3、H6、H9五个。完整中介要求每一个对A中工件的读写都经过钩子——这是一个极其严格的工程要求。任何绕过中介的FFI调用、侧信道存储、未受监控的环境变量或浏览器插件状态都是残余的攻击面。论文的处理方式是任何τ未设置的工件其Π被视为“普遍不可信”因此Πα ⊈ T必然成立门控会拒绝。这是一种“默认不安全、显式才能可信”的防御哲学在安全工程中是正确的方向但对运行时插桩的覆盖度要求极高。5. 与现有工作的关系论文在相关工作中梳理了多条线索间接注入的早期工作、记忆投毒、训练时后门、能力安全与混淆代理、污点追踪、工作流自动化治理。潜伏通道的独特之处在于它将“多基底持久化”与“跨界面延迟触发”作为统一威胁类来处理——这是前人工作未曾覆盖的。论文也明确区分了与“Sleeper Agents”的同名但不同机制——后者是训练时植入的后门而本文处理的是推理时持久化。6. 局限性与后续方向论文定位为“position and design paper”攻击成功度量已预注册为后续工作。这是一个诚实的定位——论文贡献了威胁分类、形式化防御和可执行参考但大规模实证评估尚未完成。此外D3的每个技能能力清单虽然方向正确但其实际效果取决于清单本身的正确性和完整性——这是一个有待验证的假设。论文也列出了攻击者的潜在绕过路线H1处的标签伪造被I-TAG阻止、认证UX混淆通过显示完整原像缓解、认证通道投毒需要硬件攻破、中介逃逸残余攻击面——这些都需要后续的对抗性评估来检验。实践应用1. 对常驻AI代理开发者的建议立即采纳来源追踪架构即使不立即部署完整的D2门控建立工件的来源标签τ和累积来源状态Π是后续所有安全工作的基础。入站适配器H1是最高优先级的实现点——没有正确的标签后续所有追踪都无从谈起。将执行边界移到模型循环之外不要在模型提示中嵌入安全策略并期望模型遵守。所有有副作用的动作文件写入、网络出站、调度器修改、Shell执行都必须在模型循环之外由强制执行器裁决。按动作实例而非工具类型授权避免“允许cron工具”这类粗粒度授权。认证应该绑定到具体的动作实例摘要包含完整的因果输入和规范化参数。实施默认拒绝任何未在门控钩子中明确列出的动作类型都应默认拒绝。这看似严格但对安全关键的常驻代理而言是必要的。2. 对个人AI助手用户的建议了解你的代理的配置检查代理的workspaceAccess设置——rw意味着群组会话沙箱可以向主机工作区路径写入主会话会从中加载技能。如果不需要保持none。警惕“一次设置长期有效”的模式如果你让代理安装了一个技能、设置了一个定时任务或修改了一个配置文件而这些操作的来源是一个群聊消息或一封邮件那么你已经暴露在潜伏通道的风险中。定期审计持久化工件定期检查代理的记忆存储、已安装技能、定时任务和配置文件变更。攻击者不需要持续在场——他们只需要在某个时刻留下一个持久化工件。3. 对企业部署的参考架构分层防御D0无防护不可接受D1仅上下文提示不足以对抗自适应攻击建议以D2为最低基线在关键路径上逐步推进到D3的能力清单机制。硬件认证通道D2的认证通道Σ要求模型没有向其中发射的基元。在企业环境中这可以通过硬件安全模块或可信执行环境中的安全通道来实现。预注册红队评估论文的攻击成功度量已预注册。企业在部署前应进行类似的预注册评估明确攻击场景、度量标准和成功判据避免事后调整带来的偏差。参考资料原始论文Maloyan, N., Namiot, D. (2026).Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents. arXiv:2605.13471. https://arxiv.org/pdf/2605.13471