尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models

Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models 文章主要内容总结本文聚焦大型语言模型(LLMs)的激活空间攻击风险,提出一种名为敏感度缩放导向(SSS)的白盒攻击方法。核心发现是解码器-only LLMs的中间激活层存在“注意力汇”(BOS令牌主导)和“压缩谷”(中层表示坍缩到低秩子空间),两者共同构成高增益区域,使微小扰动能通过自回归生成过程因果放大(因果放大效应CAE),实现行为渐变操控。SSS通过两阶段攻击实现高效操控:一是BOS锚定,在压缩谷层注入语义对齐的种子扰动;二是自适应强化,根据模型局部敏感度动态调整后续令牌的微扰强度。实验验证,SSS能在保持输出连贯性和通用任务性能的前提下,显著改变模型在恶意性、幻觉、谄媚和情感倾向四大行为维度的表现,且比现有激活导向方法(如ActAdd、CAA)更隐蔽、高效,对开源和供应链部署的LLMs构成切实安全威胁。核心创新点揭示攻击面机制:首次将注意力汇和压缩谷现象与激活空间高增益操控前沿关联,形式化定义因果放大效应(CAE),解释自回归生成中扰动逐步放大的内在逻辑。提出渐进式敏感度感知攻击:SSS结合BOS锚定与自适应强化,突破传统方法静态扰动的局限,将有限扰动预算集中于模型最敏感且语义错位的区域,平衡操控效果与输出连贯性。系统安全评估:在4个主流LLM(7B-20B参数)和4个行为维度上验证攻击有效性,分析白盒访问、供应链妥协等威胁模型,为激活空间监控、内省式防御等后续安全方案提供依据。
返回列表