Havenlon | 杂谈:AI乌托邦:我们不需要一台永不犯错的机器
一、我们给AI提了一个从没对人类提过的要求不少企业的AI项目最后卡住的地方并不是准确率。95%的准确率放在一个人类岗位上是优秀员工放在AI身上往往是再等等还不能上线。同一个数字两套标准。我们知道医生会误诊司机会走神律师会漏条款财务会把款打错。我们从没要求过任何一个人永不犯错我们只是为这些错误配了制度复诊、保险、复核、审批、事故调查。但面对AI很多人心里的默认值是100%。它答错一个问题讨论马上升级到它是否可靠“是否该进入真实世界”。这不只是苛刻这是一种悄悄的替换。我们已经不是在评估一件工具而是在寻找一个可以彻底交出去的对象——一个不会犯错的代理人一个没有私心的管理者一个永远猜得中我们真实意图的数字圣人。我们对AI的真实期待不是它比人更强而是它比人更值得被完全托付。这已经不是对工具的要求了。这是AI时代最贵的一个幻想。贵在它一边推高预期一边推迟落地。二、我们真正想买的是确定性出门以后突然怀疑门有没有锁转账之后反复打开账户看收款人邮件发出去再检查一遍附件在不在。多数时候事情本来就做对了只是记忆没办法给自己出具证明。于是人类造了一大堆东西来对付这种不安门锁的提示音、车门状态灯、银行的到账短信、系统的操作日志。这些东西本身不创造价值它们生产的是安心。AI恰好长得很像确定性。它秒回语气完整句子结构工整几乎任何问题都能立刻给出一个看起来成立的答案。它不像人那样犹豫也很少在开口前沉默。但流畅不等于正确。能写出答案的样子不等于握有答案。AI最危险的产品特性不是它会犯错而是它犯错时的语气和它答对时一模一样。现实并没有因为它的流畅变简单。只是那段本该存在的不确定被藏到了漂亮的句子后面。三、意图这件事机器只能猜同一句话在不同的人嘴里是完全不同的事。“帮我把门打开”——可能是房主对家人说的也可能是陌生人站在门外说的。“把这笔钱转过去”——可能在付货款也可能正在被骗子牵着走。“把这个文件删掉”——可能是例行清理也可能是在销毁证据。句子本身不携带善恶。真正决定一个动作合不合理的是说话人的身份、当下的处境、之前发生过什么、可能造成什么后果以及那些从来没被说出口的关系。人有时候能判断出来不只是因为懂中文。我们共享一整套生活经验会看神情、听语气、留意反常。即便如此人照样会误会、会被骗、会把善意当恶意。那凭什么相信只要模型再大一点、数据再多一点它就能永远准确地读出一句话背后的真实意图它能推测意图不能读取意图。它能根据上下文形成判断但它没有办法证明自己没有漏掉关键背景。这也不是多加几条禁令能补上的窟窿。因为语言是活的今天的黑话明天变味缩写和暗示每周都在长新的同一句话在不同行业、不同关系里可能指向相反的东西。只要语言还活着安全边界就必须一直在移动。而一条一直在移动的线注定画不完。四、你不能既要它灵活又要它绝不出错一个常见直觉是既然会错那就多加规则。禁止某些问题屏蔽某些词遇到风险内容直接拒绝。这些当然有用但它没办法把一个开放系统变成一台门禁机。门禁机可靠是因为它面对的是封闭问题卡号在不在名单里时间对不对密码对不对。答案集合是有限的穷举得完。AI的价值恰恰相反。它需要理解没见过的句子处理没见过的组合在信息不全的时候推断对方到底想干什么。于是我们其实提了两个互相打架的要求既要它面对陌生问题时给得出答案又要它只在完全确定时才动手。它值钱是因为它能处理规则没写到的地方它危险也正因为它会处理规则没写到的地方。这是同一个能力的两面不是两件可以分开采购的功能。如果只允许它处理训练时见过并且逐条验证过的输入它会更好控制但也就退化成一个很贵的检索系统。顺便说一个常被误解的点把随机性关掉、让同样的输入永远得到同样的输出只能让它错得更稳定不能让它变对。稳定地犯错仍然是犯错。五、绝对安全的尽头是什么都不做如果真的要求数学意义上的零风险会得到什么最安全的车是永远停在车库里的车。最安全的账户是不能转账的账户。最安全的门是谁都打不开的门。同样绝不产生有害输出的AI只能拒绝一切有歧义的问题绝不执行错误任务的Agent只能不进入真实世界。因为只要它开始回答、开始选择、开始调用工具它就进入了信息不完整的环境。信息不完整错误就不可能被彻底排除。所以绝对安全和实际可用之间隔的不是技术差距是结构性矛盾。等再等两年、等下一代模型等不来。安全这个词需要被重新定义它不是把风险消灭干净而是决定哪些风险可以扛、哪些后果必须堵死、以及判断错了之后系统还剩多少补救空间。六、成熟的系统从不假设参与者不犯错交通事故消灭不了我们没有禁止汽车上路我们做了安全带、红绿灯、限速、驾照、保险和事故调查。银行会出错我们没有停掉电子支付我们做了限额、短信提醒、延迟到账、异常检测和人工复核。医生会误诊我们没有关掉医院我们做了会诊、处方审核、检查复查和责任追溯。这些制度的共同前提只有一条所有人都可能出错所以重要的事不能只过一个判断。财务上有个更朴素的说法叫四眼原则——两个人看过才能付款。它不是因为不信任出纳而是因为任何一个人签字就生效的流程时间足够长就一定会出事。文明不是找到了一群永远正确的人而是造出了一套人会犯错也照样能转的制度。AI没有理由成为例外。七、真问题不是它够不够聪明是它能碰到什么很多AI项目停在Demo阶段原因不在模型在没人敢签字。如果把讨论从它准不准换成下面这组问题落地反而快得多它能影响什么读数据还是改数据它能调用哪些系统权限是按人给的还是按任务给的单次行动的上限是多少金额、条数、影响范围各是多少哪些动作必须人工二次确认出错之后能不能回滚多久能被发现最终责任落在谁头上这几个问题答清楚了95%的准确率也能上线答不清楚99.9%也没人敢开。有一条特别实用的切分线可逆动作和不可逆动作。写草稿、出方案、跑分析、生成初版代码——错了改一遍就是这类事可以大胆放开人工review的成本远低于收益。转账、发货、删库、对外发函、签署文件、公开发布——错了追不回来这类事必须卡一道人。判断一件事该不该交给AI先别问它有多聪明先问这件事错了之后能不能撤回。意图可以交给AI理解执行必须由边界控制。这不是不信任AI。恰恰相反这是让它进入更多真实业务的前提。只有当出错不会立刻变成不可逆的损失企业才敢把更重要的事交出去只有系统具备拒绝、限额、复核和留痕的能力自动化的范围才可能一步步扩大。安全不是创新的对立面。没有后手的创新才会让所有人都不敢往前走。八、该消灭的不是错误是零风险幻觉AI的出错率还会不会降当然会。更好的数据、更严的评估、更完整的上下文会修掉大量常见错误明显的攻击方式也会逐渐失效。但只要它面对的还是开放的语言、变化中的现实和看不见的人心风险就压不到绝对的零。要求它做到零等于要求它提前知道所有还没被发明出来的说法理解所有没说出口的背景并且永远算准每一个动作的后果。那已经不是工程目标了那是在要求一台机器全知。我们真正需要接受的不是AI永远危险而是一个更朴素的常识任何有能力影响现实的东西都不应该因为看起来聪明就被授予不受约束的权力。AI不需要永远正确才有价值。它只需要在该发挥的时候发挥在不确定的时候被拦住。我们也不必等一台完美的机器出现。真正要建的是一个不要求任何机器完美、也不会因为一次犯错就赔上全部的世界。AI时代真正的进步不是把出错概率写成零而是让错误不再能轻易穿透现实。允许它思考允许它建议允许它不断变强。但在事情真正落地之前永远留一道人能踩下去的刹车。