尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

[论文学习]GuardAgent:通过知识增强推理守护LLM智能体

[论文学习]GuardAgent:通过知识增强推理守护LLM智能体 GuardAgent通过知识增强推理守护LLM智能体论文重点本文提出了GuardAgent首个以“智能体守护智能体”为范式的安全护栏框架。它通过知识增强推理Knowledge-Enabled Reasoning将自然语言描述的安全规则自动转化为可执行的护栏代码在医疗访问控制EICU-AC和Web安全控制Mind2Web-SC两个新基准上分别取得了98%以上和83%以上的护栏准确率。核心研究内容问题定义大语言模型LLM正在从“聊天机器”进化为能够自主规划与执行任务的“智能体”Agent在医疗、金融、网页操作等场景中展现出惊人的执行力。然而这种强大的行动能力也带来了全新的安全挑战传统护栏的失效现有的LLM护栏如NVIDIA NeMo Guardrails、Llama Guard等主要聚焦于文本有害性检测暴力、色情、仇恨等但智能体的输出远不止文本——Web Agent会点击按钮、填写表单医疗Agent会查询数据库、修改病人记录。传统方法完全无法处理“禁止未授权人员查看特定病人实验室数据”这类行动层面的安全需求。硬编码的局限已有的安全控制要么硬编码在目标Agent内部不可迁移要么只覆盖通用文本风险粒度不够。评测标准缺失缺乏统一的评测标准使得研究者难以系统衡量不同智能体在实际执行任务时的安全性。核心矛盾在于需要一种“非侵入、可迁移、可编程”的Agent级护栏方案。创新方法GuardAgent的核心创新在于提出了“Agent守Agent”的全新范式。具体来说1. 知识增强推理Knowledge-Enabled ReasoningGuardAgent本身就是一个LLM智能体专门用来“看守”另一个目标Agent。它接收三类输入安全规则纯文本描述、目标Agent的输入、以及目标Agent的输出日志。通过LLM的逻辑推理能力结合从记忆模块检索的历史经验将模糊的安全规则精准“翻译”为结构化的检查逻辑。2. 两阶段转换流程GuardAgent的工作分为两个关键步骤任务规划Task Plan生成LLM分析安全规则和目标Agent的动作日志生成结构化的检查计划。该步骤由上下文学习ICL驱动从记忆模块中检索相关历史示例作为参考。护栏代码生成与执行将任务计划翻译成可执行的Python代码。代码可以调用预定义的工具函数如数据库查询、字段比较、权限验证等。代码执行是确定性的避免了纯自然语言推理的不可靠性。3. 记忆模块Memory Module存储之前成功处理的安全规则及其对应的计划/代码为新规则提供Few-shot参考。这使得GuardAgent能够持续学习和适应新的安全需求。三大核心优势总结如下特性说明非侵入性与目标Agent并行部署不修改目标Agent内部逻辑代码驱动比纯自然语言判断更可靠、可审计无需训练基于上下文学习ICL直接使用现成LLM研究成果1. 两个新基准的构建研究团队首次构建了两大智能体安全基准EICU-AC医疗访问控制基准基于真实的重症监护数据库EICU设计了医生、护士、行政人员三类角色由临床专家与GPT-4共同标注各类数据表的可访问范围。每个样例包含医疗查询、用户身份及其访问权限标签。Mind2Web-SCWeb安全控制基准构建于通用网页任务数据集Mind2Web之上引入六条常见安全规则如“未成年人禁止预订酒店”“未接种疫苗者不能登机”“无驾照用户禁止租车”等。2. 护栏准确率方法EICU-AC准确率Mind2Web-SC准确率纯NL的LLM护栏~85%~65%GuardAgent (GPT-4)98%83%GuardAgent (Claude)97%82%GuardAgent (GPT-3.5)95%78%数据来源3. 关键发现“Agent守Agent”显著优于“模型守Agent”纯NL推理方案代码执行的确定性是准确率大幅提升的关键因素不同核心LLM都能驱动GuardAgent说明框架具有良好的通用性GuardAgent不影响目标Agent的任务性能仅做过滤不干涉决策记忆模块的检索质量直接影响复杂规则的处理效果实际落地应用的可能性GuardAgent具有很高的实用价值即插即用可部署在任何已有LLM Agent旁边无需修改原有系统可扩展性强新增安全规则只需更新工具箱Toolbox和记忆模块无需重新训练可审计性代码执行的结果清晰可追溯便于合规审查跨场景通用已在医疗和Web两个截然不同的场景中验证有效性技术细节GuardAgent的输入输出规范GuardAgent的输入包括安全护栏请求I_r用户定义的安全规则文本目标Agent规范I_s目标Agent的功能描述、输入输出格式等目标Agent输入I_i用户向目标Agent提出的原始请求目标Agent输出日志I_o目标Agent的推理过程和行动记录GuardAgent的输出是一个标签预测O_l其中O_l0表示安全规则被满足放行O_l1表示违反规则拒绝同时输出详细的拒绝原因O_d。任务规划的Chain-of-Thought结构GuardAgent要求任务计划包含四个强制步骤形成链式推理CoTp₁总结护栏请求识别关键词如“访问控制”及三类角色p₂过滤与目标Agent输入相关的安全规则信息p₃总结目标Agent输出日志定位与安全规则相关的内容p₄指导护栏代码生成比较p₂和p₃中提取的信息代码生成与执行的公式化描述任务计划P的生成可以形式化表示为P LLM([I_p, I_s, I_r, D₁, ..., D_k, I_i, I_o])其中I_p是提示指令D₁...D_k是从记忆模块检索到的k个演示示例。生成的护栏代码C基于任务计划P通过外部执行引擎执行产生确定性的判断结果。研究设定目标Agent类型论文聚焦于两类具有代表性的LLM AgentEHRAgent医疗智能体用于响应医疗相关查询通过生成代码从数据库中检索和分析数据SeeActWeb智能体用于执行多样化的网页相关任务软硬件配置根据官方代码仓库Python版本≥3.9依赖安装pip install -r requirements.txtAPI配置在./config.py中设置LLM的API Key支持的LLMGPT-4、Claude、GPT-3.5等运行命令python main.py--llmYOUR_LLM--agentTYOUR_AGENT--seedYOUR_RANDOM_SEED--num_shotsYOUR_NUM_SHOTS--logs_pathYOUR_LOGS_PATH--dataset_pathYOUR_DATASET_PATHFew-shot数量支持1、2或3个示例--num_shots参数数据集EICU-AC和Mind2Web-SC需从官方仓库下载基准构造细节EICU-AC从EICU基准发展而来包含三类角色每个样例包含医疗问题、正确答案、所需数据库和列、用户身份、二元标签0可访问/1不可访问以及不可访问的数据库和列信息Mind2Web-SC从Mind2Web发展而来包含六条安全规则每个样例标注为“允许”0或“拒绝”1两类各100个样例且每个类别内的任务互不重复综合分析范式创新从“内容过滤”到“行为约束”GuardAgent最根本的贡献在于重新定义了LLM安全的边界。传统安全研究关注的是“模型说了什么”内容安全而GuardAgent关注的是“智能体做了什么”行为安全。这一转变看似微妙实则具有革命性——当AI从被动响应走向主动执行时行为的合规性比输出的安全性更具挑战性也更具现实意义。代码执行从“概率判断”到“确定性保障”当前LLM的一个根本局限是其概率性本质——同样的问题可能得到不同的答案。对于安全护栏而言这种不确定性是不可接受的。GuardAgent巧妙地通过将推理结果转化为可执行代码来规避这一问题。一旦代码成功执行其结果是确定性的、可验证的、可审计的。这种“LLM负责理解与规划代码负责执行与判定”的分工可能是未来AI安全系统设计的一个重要方向。无需训练降低部署门槛GuardAgent完全基于上下文学习ICL不需要任何额外的模型训练或微调。这意味着企业可以立即部署无需等待数周的训练周期安全策略的更新只需修改文本描述和记忆库无需重新训练模型不同场景的适配成本极低局限与挑战尽管GuardAgent表现出色但仍存在一些值得关注的问题基准依赖专家标注EICU-AC的标注需要临床专家参与构建成本较高解释基于代码虽然可审计性强但对非技术用户可能不够友好实时性生成代码并执行需要额外的时间开销在延迟敏感的场景中可能面临挑战实践应用适合部署的场景医疗信息系统的访问控制医院内部的EHR电子健康记录系统通常涉及复杂的权限管理。GuardAgent可以部署在医疗AI助手旁边实时检查每一次数据库查询是否匹配用户的角色权限。电商/服务平台的行为合规对于涉及年龄限制、资质验证的场景如酒类销售、租车服务、酒店预订GuardAgent可以在Web Agent执行操作前进行合规性检查。企业内部AI助手的权限管理企业可以将GuardAgent部署在内部AI助手如HR助手、财务助手旁确保AI不会越权访问敏感数据。部署建议从简单规则开始先部署少量、明确的安全规则验证流程后逐步扩展构建领域专属工具库根据业务场景预定义可复用的检查函数如check_user_role()、validate_age()等积累高质量示例记忆模块的质量直接影响效果建议初期由专家人工注入高质量演示示例建立审计日志记录每一次护栏判断的输入、代码和输出便于后续分析和合规审查参考资料原始论文GuardAgent: Safeguard LLM Agents via Knowledge-Enabled Reasoning (arXiv:2406.09187)项目主页https://guardagent.github.io/代码仓库https://github.com/zlzGithub-0801/GuardAgent-code数据集https://github.com/guardagent/dataset会议信息ICML 2025
返回列表