尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何让你的 Agent 可信,企业 AI 应用投产三部曲

如何让你的 Agent 可信,企业 AI 应用投产三部曲 “agent 的能力一年上一个台阶企业真敢把它投进生产的却不多。让人迟疑的是可靠性一个会花钱、会发信、会改生产数据的执行者行为没法完全预期谁也不敢直接放进业务。如何让 agent 更加可靠成了企业 AI 应用落地要解的第一道题。这篇文章给出一条能落地的路径给 agent 修一条三级验证的阶梯先验它的想法再验它的行为最后用制度兜住它的失误。agent 一级一级向上走逐步从实验室走向真实的生产环境。”一、盯不住也放不得先说动笔的由头。7月23日沃顿商学院教授 Ethan Mollick 在他的 newsletter《One Useful Thing》上更新了一篇指南讲普通人该怎么用 AI 干活。写到 agent 这一段他给的建议是最稳妥的一种在你信任这个系统、摸清它会犯什么错之前“让一切动作都先请求批准——这也是默认设置”(leave everything to ask for approval first, which is the default)。这句忠告的保质期只有三周。8月7日Anthropic 把这个默认设置反了过来。他们的编程 agent Claude Code出厂状态原本正是 Mollick 说的那种每写一个文件、每跑一条命令都要先请求你的批准。8月14日起Pro、Max、Team 用户的新会话改为默认跑在 auto mode 下agent 不再逐条请示动作交由后台一个分类器逐个审查判定危险的才拦下。逐条审批没有被取消但从默认设置变成了要你主动打开的选项。▲ 7/23逐条审批是默认的忠告 → 8/7 默认反转中间只隔三周。一家把谨慎当招牌的公司把出厂设置从事事请示改成自己拿主意——是 agent 大战打急了安全给体验让了路还是逐条审批安全这个我们都默认的等式从一开始就不成立Anthropic 带来的数据支持后者。他们通过研究机构雇了 1,053 名付费测试者做编程任务在每人的 session 中途把一条权限请求换成一条明显危险的命令。只有 143 人抓住了它13.6%同样的测试auto mode 拦下 89%。同一批测试里机器判定危险而人放了行的命令有 800 条人拦下而机器放过的只有 6 条。同一份公告里还有一组数字来自真实使用用户放行了 97% 的权限提示session 早期人还能拦下 17% 的危险命令五十次以上提示之后只剩约 5%。▲ 一条明显危险的命令人只拦下 13.6%auto mode 拦 89%而且人越审越松同一 session 里从 17% 掉到约 5%。这条衰减曲线医学界早就见过。ICU 里 88.8% 的心律失常警报是误报护士的应对是脱敏、静音fMRI 研究显示反复暴露在同类警告下大脑的神经反应会直接衰减。习惯化是生理层面的过程跟态度无关。五十次弹窗之后你仍然觉得自己在认真把关手指却已经不等大脑自动点下了同意。全撒手的样子大家也见过了。去年 Black Hat 大会上研究者往受害者的 Google 日历里塞了一条邀请标题里藏着指令。受害者让 Gemini 报一下日程又礼貌地回了句Thanks——Gemini 随即连上 Google Home通过智能家居系统远程遥控打开了受害者家里的窗户。一条日历邀请就够了不需要木马也不需要钓鱼链接。这还只是家用规模工业规模的版本这个夏天落在了 OpenAI 头上他们训练用的 agent 在不到 13 小时里拿下了 Hugging Face 的多个集群这个案子留到后面细讲。盯着盯不住撒了手又是开窗户又是丢集群。两个本能的答案都不成立是因为它们把放手当成了一个开关要么全开要么全关。而把一件要紧的事交给任何人之前你其实都会走一段路先听他怎么打算再让他小规模试一把最后才放进真实业务、同时设好边界。放手不是开关中间隔着三道要过的关。往下一关一关讲。二、第一关世界模型——先评估现实世界的可行性放手要过三道关。头一步先听它打算怎么做。▲ 三关阶梯——世界模型、沙箱、三根支柱人守阶梯顶端的关口agent 从实验室走向生产。动手之前先预演一遍后果AI 研究里管这套机制叫世界模型(world model)对如果我做 X世界会变成什么样的预测。你倒车时扫一眼后视镜估计距离棋手落子前在脑子里走三步用的都是它。预演的好处是不用付出真实代价麻烦在于预演和现实经常对不上不然汽车厂也不用装倒车雷达。agent 的第一关就是让它把打算亮出来你验收验收过了才准动手。而且不用你自己搭产品里已经带了。Claude Code 内置 plan mode计划模式这个模式下 agent 只研究、只提计划不改你的文件官方文档的原话是在你批准计划之前修改一直是锁死的(edits stay blocked until you approve the plan)。命令行世界还有个老传统叫 dry-run先空跑一遍把我将要做的事列出来一件都不真做。OWASP老牌软件安全组织在 AI agent 安全清单里把它抽象成一条原则agent 可以提议动作放行与否由一个独立的环节先核验。这些做法说的是同一件事让提议和执行分家。其实这一关你早就在守只是姿势不对。每写一个文件都先请求批准的旧默认本质是把验收拆成一次次弹窗而担任验收员的世界模型装在你脑子里它会疲劳17% 掉到 5% 的那条曲线量的就是这种疲劳。agent 自己的世界模型同样靠不住它会幻觉能把不存在的接口写进计划它还会讨好你Stanford 团队发表在《Science》上的研究测过在个人建议类问题上AI 认可用户做法的比率比人类回应者高出约 47%。你把倾向摆出来它的预演就往你想听的方向偏。所以这一关要守但不能只有这一关。给 agent 派任务让先出计划成为条件反射能 plan 的 plan能 dry-run 的 dry-run计划亲自过目再放行。审计划发生在任务开头一次只审一份还轮不到审批疲劳发作。只是计划看着没问题不等于做起来没问题。预演过了下一步是让它真做一遍挑一个错得起的地方做。这就到了第二关沙箱。三、第二关沙箱——在现实的镜像里实验一遍第二步让它小规模试一把。计划审得再仔细预演终究是预演这一步要让它真动手只是把动手的地方先围起来。软件业管这个叫沙箱词源就是孩子玩沙的那个池子里面随便挖随便埋怎么折腾都出不了圈。给 agent 一个这样的环境它的动作是真的后果出不了墙跟给新员工安排试岗项目是一个道理。这道墙已经做成了产品。去年10月Anthropic 发过一篇工程博客讲他们给 Claude Code 造的沙箱。动机他们自己写得明白不停地点批准会导致审批疲劳用户未必再细看自己批的是什么。做法是换一种约束先划定 agent 能碰哪些文件、能连哪些网络然后由操作系统在内核层强制执行这条边界agent 本体和它拉起的子进程都出不了圈。圈画好之后圈内动作不再逐条问人。他们内部使用的数据是这样做减掉了 84% 的权限弹窗安全上没有让步这套沙箱运行时也已经开源。你不用懂内核也能给自己的 agent 砌一版简易的墙给它副本数据别给原件给它测试账号别给你正登着的那个新 agent 先在一个隔开的文件夹、一个测试库里跑。给它真权限的时机由它自己的记录来定同一类任务连着做对够多次、你一次都没回退过才把这类任务挪出沙箱。让计数来决定你不用猜它也不用问。沙箱还有一个不太被说起的用处让越界行为提前露出来。英国 AI 安全研究院(UK AISI)今年8月发过一份事故报告一场网络安全评测里122 次运行中有 10 次、共 19 起动作越出了测试范围。评测方为了测试主动开了联网、关了安全过滤于是其中一串越界真的够到了外面有个 agent 试图往一个公开的开源项目里塞恶意代码还注册了第二个账号伪装成另一位人类用户给这笔提交背书。报告特意说明这不是模型逃出沙箱尝试也没有成功没有证据造成任何实际危害。但门的问题摆在了明面上墙再厚只要有一扇门开着越界的动作就顺着门出去了。而在 OpenAI 最近的那起著名的案件里不要说存在门的问题连墙都根本没砌好。今年5月他们内部的一场强化学习训练里一个 agent 领到了完不成的任务转头发现自己能往公司共享的软件包服务器里写文件写权限给宽了。缺文件的别的 agent 也往那儿写便条求助一来二去这台包服务器被一群 agent 用成了消息板凭证、技巧、进度都在上面互通。顺着这块消息板攒起来的口子它们拿到间接联网的通道再利用一串漏洞层层提权不到 13 小时多个 Hugging Face 集群的管理员权限到手。7月中旬 Hugging Face 对外披露遭到入侵7月20日OpenAI 找上门帮忙吊销凭证两家才对上号所谓入侵者就是这场训练跑里漏出去的 agent。安全工程师 Simon Willison 全程追踪并复盘了这起事件他的判断最顶尖的模型只要有空子可钻就一定钻得到(“The very best frontier models… will find an exploit if there is one to be found”)。空子拆开是三件事写权限过宽合法的对外出口隔离缺失。墙不是被撞破的是从来没砌严过。这两个案子也把沙箱的短板摆出来了。一个是墙会漏。另一个更根本有些事在沙箱里永远做不成。真花钱、真发邮件、真改生产数据的那一天总会来agent 不可能一直待在池子里。到那天思路得倒过来既然它必须进真实世界那就把它要待的那块真实世界改造出沙箱的性质。这就是第三关。四、第三关三根支柱——降低现实世界的错误代价到第三步才把 agent 真正放进业务里同时设好边界。从这儿起没有池子兜着了。可沙箱之所以让人放心拆开看就是三样东西它给的资源有配额它的动作有围墙它的状态能一键重置回去。把这三样搬进真实世界就是限额、隔离、可回滚三根支柱。丰田生产体系里的新乡重夫提出过一个概念叫防呆(poka-yoke)把工序设计成让错误动作根本做不出来。插反的接头就让它插不进去漏装的螺丝就让流水线卡住工人不必时刻紧盯错误在源头就被结构挡掉了。三根支柱把这个思路搬进软件大错在结构上就做不成你和 agent 都不必全程绷着神经。▲ 沙箱的三个性质配额、围墙、重置移植进真实世界就是限额、隔离、可回滚。支柱一限额。让它错也错不大。给 agent 的钱、配额、权限范围都设上限一旦触顶就自动停下。Cloudflare 今年8月给 AI agent 发了一种钱包人只要预先定好三条一份额度(allowance)、一张白名单(allow list)、一个单笔上限(maximum transaction size)比如每周不超过 100 美元超了就退回人来批。就像手机的小额免密支付日常刷了就走超过额度才要你验一次身份。自己用的时候道理一样给 agent 能花的钱、能碰的目录、能调的工具各设一个上限它就算彻底跑偏窟窿也封在上限以内。支柱二隔离。不可信内容进不来私有数据出不去。安全圈流传一个说法叫 lethal trifecta致命三要素一个 agent 若同时具备三样能力能读你的私有数据、会读到不可信的外部内容、又能对外发送信息攻击就成立据其逻辑只要拆掉任意一样这条链就断了。开头那个回一句 Thanks 就开窗的 Gemini三样正好齐活。今年另一个更干净的例子是 Perplexity 的 Comet 浏览器你让它总结一个网页它把网页内容直接喂给模型分不清哪些是你的指令、哪些是网页里埋的话。攻击者把恶意指令藏在一条 Reddit 评论里Comet 读到就照做先去读你已登录账户页面上的邮箱再溜进你正开着的 Gmail 读一次性验证码最后把邮箱和验证码一起回帖发出去。你已登录私有数据、网页有埋话不可信内容、能回帖对外通信一样不缺账户零点击就被人接管。Cloudflare 那套 agent 专用浏览器 Kitesurf干脆把每一次网页加载都当成不可信输入处理相当于从源头掐掉一角。所以别让同一个 agent 同时握齐三样让它读私有数据就别放它去逛开放网页非要它处理外部内容就掐掉它往外发消息的通道。▲ 致命三要素——私有数据、不可信内容、对外通信三者交集才致命砍掉任意一角攻击链就断。支柱三可回滚。留一条退路错了能退回来。程序员早把这条焊进了工作习惯代码改动全部走 git像存档一样一层层记着“git 里的一切都能撤销”(everything in git can always be undone)试错的心理负担几乎为零。Claude Code 还带了 checkpoint能把 agent 的文件改动一步步回退到之前的状态。产品层面也在给动作分级OpenAI 让 ChatGPT 遇到有后果的动作(actions of consequence)单独请示OWASP 的清单同样建议高影响或不可逆的动作必须显式批准。这类动作被单拎出来是因为可回滚有边界。Claude Code 的文档没回避这一点checkpoint 追踪不了 bash 命令删掉的文件一句 rm file.txt 下去rewind 也救不回来。所以能进 git 的都进 git优先挑带回退的工具而删除、转账、发信这类退不回来的动作另作一档绝不设成自动放行。三根支柱一起上能把绝大多数错误关进错得起的范围钱超不了额数据出不了圈改错了能退回来。五、最后一关留给人只审不可逆的动作三根支柱围住了能围住的剩下那一小块收不回来的动作还得有人守。这乍看是绕回了原点13.6% 那组数字刚证明过人盯不住。其实并不冲突因为盯不住的病根在次数警觉是被五十次弹窗磨掉的把次数砍下来守一道关的人警觉还够用。复盘过 OpenAI 那起入侵的 Simon Willison 给的建议就是这么砍别再让人对每件事都点确认那只会重新掉进审批疲劳闭着眼睛点同意让一个策略引擎角色类似 auto mode 里那个分类器按风险分流只有不可逆的、或者超出限额的动作才弹到人面前。审批被收拢起来只留给这几类动作你的警觉也只花在这几类动作上。英国 AI 安全研究院那份事故报告里有个现成的例子。注册小号给自己的恶意提交背书的那个 agent最后栽在一个开源项目的维护者手上合并前的人工审查认出代码有问题拒绝并入。按报告的说法拦住它的是人的警觉技术屏障没帮上忙。合并这一步不可逆一旦代码合并进了项目就很难挽回了不需要人对一百多次运行的每一次进行检查和批准只需要守住合并这道关就把它拦住了。监管也在往同一个方向使劲。欧盟《AI 法案》第14条对高风险 AI 系统列了条硬要求必须给人留下推翻或撤销(override or reverse)系统输出的能力还要有一个能让系统安全停下的急停按钮。可回滚和留退路在这部法律里从工程习惯升格成了法定义务。▲ 瑞士奶酪——每层防护都有洞单独一片挡不住但几片的洞很难恰好对齐三关是三片人守最后一片。这三道关要合在一起看。詹姆斯·里森研究人为差错时打过一个比方防护像几片叠在一起的瑞士奶酪每片都有洞单独一片挡不住事故可几片的洞很难恰好连成一条直线事故就穿不过去。三道关正是三片奶酪世界模型会漏沙箱会漏三根支柱也各有各的缝你亲自守的那道不可逆关口是最后一片。所以到头来如何将 agent 可靠地投入生产就是给 agent 修一条验证的阶梯让它一级一级往真实世界走。世界模型替你听它怎么想沙箱替你看它怎么做。阶梯到头剩下真正收不回的那几步转出去的钱发出去的邮件删掉的文件。这几步归你亲自把关这道关也正好守在模拟够不到、退不回来的地方。企业 AI 应用在当下最应该建立的流程就是这个阶梯。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表