![[论文学习]Prεεmpt:大语言模型敏感提示词清洗系统](http://pic.xiahunao.cn/yaotu/[论文学习]Prεεmpt:大语言模型敏感提示词清洗系统)
Prϵϵmpt: Sanitizing Sensitive Prompts for LLMs (2025)论文重点本文提出了一种名为Prεεmpt的提示词清洗系统用于在用户将提示词提交给不可信的大语言模型LLMAPI之前对其中包含的敏感信息进行形式化的隐私保护。该系统将敏感词元分为两类——格式依赖型如SSN、信用卡号采用格式保持加密FPE数值依赖型如年龄、薪资采用度量本地差分隐私mLDP——在提供严格隐私保证的同时保持高响应质量并在翻译、RAG、长文本问答和多轮金融问答等任务中验证了其实用性。核心研究内容问题定义LLM推理阶段存在严重的隐私风险用户可能在提示词中不经意地泄露个人身份信息如SSN、信用卡号、健康信息或财务信息。与训练数据记忆化风险不同推理阶段的威胁主要来自模型所有者即托管LLM的组织而非其他API用户。现有的解决方案要么计算成本过高如同态加密和安全多方计算单次BERT推理超过16分钟要么缺乏形式化的隐私保证。此外训练阶段的隐私保护机制无法覆盖推理时提示词中携带的数据。创新方法Prεεmpt的核心创新在于提出了**提示词清洗器Prompt Sanitizer**的密码学形式化概念并基于敏感词元的两种类型设计了差异化的保护策略第一类Category I——格式依赖型LLM的响应仅依赖于词元的格式而非具体值如SSN、信用卡号、电话号码、IP地址等。采用格式保持加密FPE确保密文与明文具有相同的格式如16位信用卡号加密后仍为16位数字使系统能够像处理明文一样处理密文。第二类Category II——数值依赖型LLM的响应依赖于具体的数值本身如年龄、薪资等。采用度量本地差分隐私mLDP根据数值之间的距离提供差异化的隐私保护——相近的数值更难区分而相距较远的数值则更容易区分。研究成果论文通过四项任务的实证评估验证了Prεεmpt的有效性翻译任务德语→英语GPT-4o清洗后提示词的BLEU分数与未清洗提示词几乎相同。RAG任务所有任务均达到100%的准确率。长文本问答基于清洗后参考文本的响应与未清洗文本的相似度达到0.934优于同期方法PAPILLON。多轮金融问答在多轮对话场景中也表现出色。实际落地应用的可能性Prεεmpt的设计具有高度的实用性和落地潜力本地部署运行在用户的可信本地设备上无需依赖云端服务。无状态设计不保留任何会话间的状态信息符合GDPR和CCPA等法规的“被遗忘权”要求。即插即用可作为组织层面的应用程序供所有员工使用与现有LLM API无缝集成。适用场景广泛适用于金融机构、医疗机构、政府机构等对数据隐私有严格要求的场景。技术细节1. 提示词清洗器的形式化定义论文将提示词清洗器PS定义为四元组PS ⟨S, Mτ, E, D⟩SetupS生成密钥 KType AnnotatorMτ类型标注器识别敏感词元及其类型SanitizationE清洗算法对敏感词元进行加密或扰动DesanitizationD去清洗算法恢复响应中的敏感信息工作流程为类型标注 → 清洗 → 提交给LLM → 去清洗响应。2. 格式保持加密FPEFPE确保密文与明文具有相同的格式包括长度、字符集和格式等属性。例如SSN055-46-6168→569-83-4469IP地址76.217.83.75→97.381.64.35FPE方案定义为三元组E ⟨GF, EF, DF⟩其中加密和解密均为确定性多项式时间算法。3. 度量本地差分隐私mLDP对于数值型敏感词元Prεεmpt采用mLDP机制。定义如下Pr [ M ( x ) ∈ O ] ≤ e ϵ ⋅ d ( x , x ′ ) ⋅ Pr [ M ( x ′ ) ∈ O ] \Pr[M(x) \in O] \leq e^{\epsilon \cdot d(x, x)} \cdot \Pr[M(x) \in O]Pr[M(x)∈O]≤eϵ⋅d(x,x′)⋅Pr[M(x′)∈O]其中 d(·) 为距离度量论文采用 ℓ₁ 距离ϵ 为隐私预算。该机制保证输入值最可能映射到与其接近的值距离越近的值被映射的概率越高4. 清洗算法伪代码Algorithm 1: Prεεmpt 清洗输入: ρ - 原始提示词; KU - 用户密钥; ε - 总隐私预算 输出: ˆρ - 清洗后的提示词 1: ρ′ ⟨⟩ 2: ρτ ← Mτ(ρ) // 使用NER进行类型标注 3: (ψ, t) ← MPre(ρ, ρτ) // 计算第二类词元数量t和辅助信息ψ 4: for (σ, τ) ∈ ρτ do 5: if (τ ≠ ⊥) then 6: if (τ τI) then 7: ˆσ EF(KU, Nτ, σ) // FPE加密 8: else 9: ˆσ Mε(σ, ε/t, kτ) // mLDP扰动 10: end if 11: else 12: ˆσ σ // 非敏感词元保持不变 13: end if 14: ρ′.append(ˆσ) 15: end for 16: ˆρ ← MPost(ρ′, ψ) // 后处理强制执行功能依赖 17: return ˆρAlgorithm 2: Prεεmpt 去清洗输入: ˆυ - 清洗后的响应; KU - 用户密钥 输出: υ - 去清洗后的响应 1: υ ⟨⟩ 2: ˆυτ ← Mτ(ˆυ) // 使用NER进行类型标注 3: for (σ, τ) ∈ ˆυτ do 4: if (τ τI) then 5: σ DF(KU, Nτ, σ) // FPE解密 6: else 7: σ ˆσ // mLDP扰动无法完全恢复 8: end if 9: υ.append(σ) 10: end for 11: return υ5. 隐私保证的形式化定义论文设计了隐私博弈G^PS,L_pp来形式化刻画隐私保证。 adversary 被限制选择具有相同泄露函数 L 的两个提示词然后尝试区分它们的清洗后版本。adversary 的优势定义为Adv p p P S , L ( A ) 2 Pr [ G p p P S , L ( A ) 1 ] − 1 \text{Adv}^{PS,L}_{pp}(A) 2\Pr[G^{PS,L}_{pp}(A) 1] - 1AdvppPS,L(A)2Pr[GppPS,L(A)1]−1泄露函数 L 捕获了清洗后提示词中泄露的所有信息其具体定义依赖于底层的清洗算法。研究设定威胁模型信任边界Prεεmpt运行在用户的可信本地设备上** adversary**LLM是不可信的第三方应用代表潜在的 adversary敏感词元范围仅保护可从单个词元中独立推导的敏感信息如SSN、信用卡号、年龄、薪资等不涉及需要上下文语义才能判断的隐私风险会话模型每次交互构成独立会话Prεεmpt不保留任何跨会话的状态设计目标形式化隐私保证提供可量化的隐私保障高实用性清洗后提示词的响应应与原始提示词接近无状态不保留任何会话间状态信息符合GDPR/CCPA等法规配置参数密钥 KU用户在注册时通过安全参数 κ 生成隐私预算 ε用户指定作为每次清洗会话的隐私预算数据域为每种敏感词元类型初始化数据域FPE的格式综合分析Prεεmpt在隐私保护LLM推理领域做出了重要贡献其核心价值体现在以下几个方面第一填补了形式化隐私保证的空白。据论文所述Prεεmpt是首个具有形式化隐私保证的提示词清洗器。它将密码学中成熟的游戏定义引入了提示词隐私保护领域为后续研究提供了可参考的形式化框架。第二差异化的保护策略体现了对LLM特性的深刻理解。论文敏锐地观察到不同类型的敏感信息对LLM响应的影响机制不同格式信息如SSN的结构和数值信息如年龄的大小在语义上扮演着完全不同的角色。FPE和mLDP的分别使用既保证了隐私又最大限度地保留了实用性——这是“一刀切”方案如完全删除或同态加密无法实现的。第三实用性导向的设计理念。无状态设计、本地部署、无需修改LLM API等特点使Prεεmpt具备了真正的落地可能性。论文明确指出Prεεmpt不是学术象牙塔中的构想而是可以在组织层面直接部署的实用工具。第四坦诚的局限性声明。论文明确将“需要上下文语义才能判断的隐私风险”留作未来工作。这种诚实的边界界定反而增强了研究的可信度。当然Prεεmpt也存在一些值得关注的局限mLDP扰动的第二类词元无法完全去清洗论文默认将其保留为扰动后的值类型标注器NER的准确性直接影响系统效果对于依赖上下文语义的隐私风险如通过整段提示词推断用户心理健康状态尚无法覆盖。实践应用适用场景金融领域处理包含账号、交易金额、薪资等敏感信息的查询医疗健康保护患者年龄、医疗记录编号等标识信息企业内部员工使用LLM时防止泄露客户信息、商业机密个人用户在使用公共LLM服务时保护个人身份信息部署建议注册阶段为每个用户生成唯一的FPE密钥并让用户根据隐私需求设定 ε 值类型配置根据业务场景预先定义敏感词元类型及其数据域格式功能依赖对于存在关联的敏感词元如“年龄”和“出生年份”通过辅助信息 Ψ 强制执行功能依赖以保持实用性隐私预算管理建议从较大的 ε 值开始根据实际效果逐步调低注意事项第二类词元如年龄、薪资经mLDP扰动后无法完全恢复适用于对精确值要求不高的场景类型标注的准确性直接影响系统效果建议针对特定领域微调NER模型当前版本不适用于需要依赖上下文语义才能判断的隐私风险场景对于需要精确数值的场景如“我的年龄是25岁请推荐适合的保险产品”建议评估mLDP扰动对响应质量的实际影响参考资料原始论文Prεεmpt: Sanitizing Sensitive Prompts for LLMs (arXiv:2504.05147)PDF版本https://arxiv.org/pdf/2504.05147HTML版本https://arxiv.org/html/2504.05147v2