尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从炼金术到AI幻觉:重读Dreyfus对符号AI的批评

从炼金术到AI幻觉:重读Dreyfus对符号AI的批评 1965 年兰德公司一位名叫 Hubert Dreyfus 的哲学家写下一篇后来让整个 AI 学术圈炸锅的报告。报告的标题很直接《Alchemy and AI》——炼金术与人工智能。那时候符号 AI 正处在黄金时代。Newell 和 Simon 的“通用问题求解器”风头正劲Minsky 和 McCarthy 正在搭建 MIT 和斯坦福的 AI 实验室学界普遍相信“只要把足够多的规则写进程序机器就能学会思考”。Dreyfus 偏偏在这个节骨眼上泼冷水。他说你们做的事情本质上和中世纪炼金术士没有区别没有理解物质的基本结构就去点石成金没有理解智能的真正机制就去制造思考的机器。60 年后的今天大模型席卷一切AI Agent 成为新的风口几乎每个团队都在忙着接入 API、搭建知识库、优化提示词。如果你愿意暂时从“技术迭代焦虑”里抽身出来认真读一遍 Dreyfus 当年的批评会发现他的很多判断并没有过时——有些甚至精准地击中了大模型时代的软肋。这篇文章不打算写成 AI 历史课的讲义而是想把 Dreyfus 1965 年的批评翻译成现代 AI 开发者能直接使用的“技术判断工具”。读完你至少能获得三样东西第一理解为什么当年符号 AI 会走向衰落第二看清深度学习和大模型到底推翻了什么、又留下了什么第三在工程实践中知道如何用 Dreyfus 的视角去避免过度承诺、控制 AI 幻觉、设计更可靠的系统。1. 为什么一篇 1965 年的论文值得 2025 年的开发者重读1.1 从“炼金术”这个比喻说起“炼金术”这个词在科学史里几乎等于“昂贵而精致的骗局”。中世纪炼金术士为了把铅变成金子设计了复杂的配方、神秘符号和繁琐仪式却始终没有成功。直到拉瓦锡、道尔顿等人搞清楚原子和元素的概念化学才真正取代了炼金术。Dreyfus 的潜台词非常明确早期 AI 研究者正在走同样的弯路。他们试图通过堆砌逻辑规则来复刻通用智能却忽略了一个根本问题——他们并没有真正理解“智能”是什么。就像炼金术士不理解化学一样AI 研究者也不理解认知的本质。他们以为只要规则足够多智能就会像点石成金一样自然出现。这个比喻在今天依然扎心。你只要看看大模型产品发布时那些夸张的演示视频就能感受到“炼金术心态”的现代版用精心挑选的提示词在特定的测试样本上展示一段惊艳的对话然后宣称“AGI 已经到来”。实际情况是当你把同样的模型部署到真实业务中处理刚才那些精心设计的例子之外的长尾输入时它经常给你编造一个看似合理、实则错误的答案。演示是炼金术工程是化学。对开发者而言这个比喻最重要的启示是区分“看起来智能”和“真正解决问题”是 AI 工程的第一课。在 2025 年这句忠告的适用性一点都没降低。1.2 兰德公司、AI 大佬与一场哲学冲突Dreyfus 写下这篇报告的时候正在兰德公司工作。兰德公司是那个年代最重要的军事与科技研究机构之一AI 早期的许多核心人物都和它有密切关系。1965 年的符号 AI 阵营非常自信Newell 和 Simon 做了通用问题求解器GPS宣称已经找到“通用智能”的算法框架Minsky 正在谋划建立一个能理解常识的系统McCarthy 则在推动“用逻辑表达知识”的研究范式。Dreyfus 是现象学家深受胡塞尔、海德格尔和梅洛-庞蒂影响。他关心的不是逻辑系统如何运作而是“人在世界中如何存在、如何理解”。他对 AI 圈子最大的不满不是“计算机不够强大”而是“研究者对智能的理解过于幼稚”。他从哲学层面质疑了“智能等同符号操作”这一核心假设。这种冲突不完全是技术争论还掺杂着学术话语权之争。Minsky 后来公开嘲讽 Dreyfus“根本不理解计算机”Dreyfus 则在 1966 年预测“计算机在十年内无法下棋战胜人类”——这个预测后来被 1997 年深蓝的胜利打脸。但正如很多历史事件一样一个局部的预测错误并不能推翻整体的结构性批评。这段历史给今天 AI 从业者的提醒是AI 从来不只是一个纯技术问题。学术范式、科研经费、行业话语权、公司战略都在塑造人们对“AI 能做什么”的预期。理解了这一层你就不会轻易被某某公司“技术革命”的公关稿带偏。1.3 对 2025 年开发者的价值听起来很哲学离工程很远事实恰恰相反。如果你在一线做 AI 业务大概率遇到过这些问题业务方问“大模型不是什么都懂吗为什么在垂直领域一直说错”产品经理问“为什么 Agent 会编造一个不存在的订单号”运维问“为什么模型部署上线后效果和测试集完全不一样”老板问“既然大模型这么强为什么我还要养一个 AI 工程师团队”这些问题本质上都是 Dreyfus 问题的现代变体。他当年强调的“背景知识缺失”“常识的不可穷尽”“隐性知识无法形式化”并没有随着大模型的出现而消失只是换了一副面孔AI 幻觉、领域漂移、样本外泛化不足、长尾失败。重读《Alchemy and AI》不是让你回到 1965 年的争论现场去做考古而是为了获得一种校准技术边界的视角。在所有人都在欢呼“大模型万能”的时候你需要一个能让你冷静下来的参照系。2. 《Alchemy and AI》Dreyfus 到底批评了什么Dreyfus 的批评系统而复杂但最核心的可以归纳为四个问题。理解这四个问题你就能看懂 1965 年那场争论的本质。2.1 常识问题一个无法靠枚举完成的知识库Dreyfus 最著名的批评之一是“常识问题”。想象一个很简单的场景下雨了你要收衣服。你不查说明书不搜索“衣服遇到雨水会怎样”不需要经过三步推理只是看了一眼窗外就自然地站起来去收衣服。这背后是一个庞大的背景知识系统衣服怕淋、淋湿了不舒服、大雨前收衣服最好、阳台和卧室的距离该如何处理……这些知识密集、琐碎、互相嵌套而且从来没有被写在任何一本“生活常识大全”里。早期 AI 试图把常识一条条手工编码成规则后来甚至出现了 CYC 这样专门构建常识知识库的项目目标是把“显而易见”的事实全部录入计算机。但几十年过去CYC 的教训是常识的规模和开放性远超人工程序的承受能力。你不可能把所有“理所当然”都列出来因为“理所当然”恰恰是因为它数不清。大模型时代常识问题看起来被缓解了。GPT 模型通过海量语料中的统计规律能够回答“下雨为什么要收衣服”这种问题。但它的“常识”是不稳定的换一种问法换一个语境它可能就答错了。更关键的是它不一定能把这种“语言层面的常识”用于真实世界的行动。这就是为什么大模型可以做对话却很难直接驱动机器人在现实环境里完成家务。2.2 框架问题世界里的无限信息与当下目标框架问题来自哲学与分析哲学对“行动”的讨论。假设你让一个 AI 智能体完成“帮我端一杯咖啡”这个任务。它需要考虑哪些信息杯子在哪里、咖啡温度是否合适、路上有没有障碍物。但同一时刻世界上还有无数信息天花板的颜色、窗外的鸟叫、电脑屏幕的亮度、旁边同事的衬衫颜色……这些信息对“端咖啡”这个任务完全没有影响。一个显式规则系统要运行必须提前定义好“哪些信息与当前任务相关哪些无关”。这就是“框架”。问题在于任务一旦变化框架就要随之调整环境一旦变化框架也要重新更新。在真实世界里这种“重新定义框架”的成本是天文数字。这也是早期符号 AI 系统只能活在“玩具世界”里的根本原因。因为玩具世界的框架是预先设计好的你不需要处理无关信息。一旦进入开放世界框架问题就会让规则系统崩溃。现代深度学习在某些感知任务上绕开了框架问题——卷积神经网络会自动学习“哪些特征对分类有用”不需要人为指定。但如果你在做多步骤规划的 Agent框架问题依然存在模型面对一堆工具如何判断当前步骤该用哪个如何排除不相关的观察结果这本质上仍是 1965 年的那个难题。2.3 隐性知识专家说不出、写不下的那些判断Dreyfus 深受波兰尼“隐性知识”概念的影响。波兰尼有一句名言“我们知道的比我们能说出来的多。”一个老中医通过脉诊判断患者体质很难把全部经验写成文字规则。一个资深架构师看一眼系统日志就能判断出问题出在哪个环节但你要让他解释“为什么”他可能只能说“感觉不对劲”。一个优秀的销售能读出客户话音里的犹豫但他未必能总结出“犹豫的信号有哪些”。Dreyfus 认为人类专家水平的一个核心成分正是这种隐性知识。如果 AI 只处理显性规则那么它最多达到“新手”或“高级初学者”的水平永远无法到达“专家”境界。这件事对今天的 AI 工程特别有启发。很多团队尝试把行业专家的经验写成 prompt 模板、画成工作流、做成知识库然后宣称在做“行业 AI 专家”。结果往往不尽如人意。原因在于专家自己在很多决策时刻也“说不清理由”你让他把经验写下来他只能给出一部分显性规则而真正让他成为专家的那部分隐性判断从来没进入过语言层面。这不是 prompt 写得不够好而是“把隐性知识变成显性规则”这条路本身就有天花板。2.4 具身性智能是不是身体经验的产物Dreyfus 的哲学立场让他特别重视“具身认知”。他认为人类智能不是悬浮在抽象逻辑空间里的而是与身体在物理世界中的感受、移动、交互紧密相关。一个没有身体、只在符号层面运作的程序很难真正理解“重”“痛”“平衡”这些概念。它可以操作这些词对应的符号甚至能写出关于“疼痛”的优美散文但它不会在碰到滚烫的杯子时缩手也不会因为连续熬夜而感到疲惫。Dreyfus 坚持认为这种“身体感的缺席”意味着符号系统无法获得真正的智能。这个观点在 1965 年听起来像是“反技术”的。但今天具身智能Embodied AI研究已经成为 AI 领域的热点人形机器人结合大模型、世界模型、强化学习试图让 AI 通过与真实环境的交互来学习。Dreyfus 的一个核心直觉——智能离不开与环境持续交互的经验——正以工程化的方式被重新验证。当然他 1965 年的表达是抽象思辨没有给出工程方案。但他提出的问题“智能到底需不需要身体经验”至今没有一个确定的答案。GPT-4o 的“机器人口粮”实验让人们看到了纯文本模型和真实世界行动之间的鸿沟也让更多研究者开始认真对待具身认知的议题。3. 符号 AI 的黄金时代Dreyfus 批评的对象3.1 什么是符号 AI符号 AI也被称为“老式 AI”Good Old-Fashioned AIGOFAI。它的核心思想是智能可以被理解为符号操作。它的基本路径如下把知识表达成逻辑命题例如“人都会死”“苏格拉底是人”。使用推理规则如肯定前件推导新命题例如“苏格拉底会死”。通过搜索算法在状态空间里寻找目标状态。这套路径来自弗雷格、罗素等人的数理逻辑传统在数学定理证明、专家系统、下棋程序等领域都取得了可观的成果。1970 年代末期专家系统是符号 AI 最亮眼的商业应用MYCIN 能诊断血液感染XCON 能为计算机系统做配置企业界纷纷相信“知识工程”会改变世界。3.2 专家系统的兴起与泡沫专家系统的基本思路是把一个行业专家的知识提取成“IF-THEN 规则”然后由推理引擎根据规则进行判断。理论上只要规则足够丰富系统就能复制专家水平。问题在于现实远比教科书残酷。规则维护是第一个噩梦。随着规则数量增加规则之间的冲突会指数级增长。你加了一条“如果症状 A则怀疑疾病 X”很快发现“症状 A”在另一种条件下应该怀疑疾病 Y于是你需要加更多规则去处理例外。每条新规则都可能与旧规则产生新的冲突。专家不配合是第二个噩梦。专家往往“说不出”自己判断的依据。你把几十个专家叫到一起开会试图提取他们的经验最后得到的是各自经验的“显性但零碎”版本毫无整体结构。边界情况是第三个噩梦。知识库覆盖了常见场景但一旦遇到知识库之外的边缘情况系统就会直接给出一个离奇的结果而且没有任何常识兜底。到了 1980 年代末专家系统泡沫破裂“AI 冬天”到来。这个结局和 Dreyfus 在 1965 年的判断是吻合的显式规则无法承载人类知识的结构性复杂。3.3 为什么“规则搜索”没有通向通用智能规则搜索的组合非常强大但它依赖两个前提领域可以被完整、一致地形式化领域知识可以被显式描述成规则。这两个前提在封闭世界里成立。国际象棋的规则是固定的数学公理是可枚举的所以在这些领域符号 AI 表现得很好。但开放世界完全不同。开放世界充满歧义规则是动态的、语境依赖的、不断演变的。你无法把“理解日常对话”所需的全部规则写出来因为不同的语境、不同的说话者、不同的语气会让同一种表达产生截然不同的含义。Dreyfus 在 1965 年批评的正是“把一切知识都符号化”的野心。他不是说符号方法没有用而是说只靠符号方法无法覆盖人类的全部智能。3.4 代码示例一笔规则系统的“旧账”为了让你直观感受符号 AI 的表达方式这里用一个极简的 Prolog 示例来说明。% 文件路径demo_rule.pl % 一个极简的专家系统规则示例仅用于教学展示 % 规则如果体温高于38度且出现咳嗽则可能感冒。 diagnosis(cold) :- temperature(T), T 38, symptom(cough). % 事实当前患者体温39度有咳嗽症状。 temperature(39). symptom(cough).这段代码的逻辑很简单查询diagnosis(cold)时Prolog 会去匹配temperature(T)和symptom(cough)如果事实都满足返回真。看起来非常优雅对不对这就是 70 年代人们觉得专家系统能解决一切问题的原因。但你只需要把规则扩展一下就能立刻感受到它的脆弱% 假设患者不仅有咳嗽还有头痛且体温低于38度…… % 你的规则库需要新增多少条规则才能覆盖所有组合 % 而且更麻烦的是新规则可能与旧规则产生冲突需要手动调整优先级。随着规则数量增长维护成本会急剧上升。这就是符号 AI 系统的“规模不经济”——它不是不能工作而是越扩越大越来越脆直到某一天彻底失去可控性。4. 深度学习与大模型哪些批评被推翻了哪些还站在那儿4.1 深度学习的胜利绕过规则直接学表示2012 年AlexNet 在 ImageNet 竞赛中大幅领先深度学习开始主导 AI 研究。深度学习的思路和符号 AI 完全不同不再手工写规则和知识库而是通过大量数据训练神经网络让模型自动学习特征和表示。在图像识别、语音识别、机器翻译等任务上深度学习的表现惊人。它用一个统一的架构在大量数据驱动下达到了手工规则系统无法想象的准确率。更重要是它证明了很多智能行为不需要被预先编码成规则而是可以从数据中涌现出来。这直接推翻了 Dreyfus 1965 年的一个隐含假设——“不能完全形式化的能力机器的智能很难达到”。实际情况是只要数据足够多、算力足够强大量“隐性”模式可以从统计中自动学习。4.2 AlphaGo 教会我们的事特定任务的极限2016 年AlphaGo 战胜李世石成为 AI 史上的标志性事件。从技术上看AlphaGo 是“深度神经网络蒙特卡洛树搜索”的组合它不需要人工编码围棋战术通过自我对弈学习到超越人类的棋感。Dreyfus 在 1966 年预测“计算机十年内无法下棋战胜人类”被彻底打脸。但 AlphaGo 也揭示了另一层含义。它在下围棋时像是神级选手离开围棋棋盘它对世界一无所知。它不理解“围棋”在人类文化中的位置不理解下棋的仪式感、胜负的情感不理解棋手为何会懊恼、为何会欣喜。它只是在封闭、规则清晰、目标明确的游戏世界里做到了极致。这恰好为 Dreyfus 的批评提供了一种镜像式的验证即便不是因为符号规则而是因为“数据驱动搜索”一个 AI 系统依然可以非常强大同时依然不具备通用性、不具备常识、不具备真正的理解。4.3 大模型为何能部分回应 Dreyfus大语言模型通过与海量文本的统计学习意外获得了一些“常识”能力。GPT-4 可以回答“如果我把一杯水放在零度以下的地方会怎么样”它会说水会结冰。这看起来就是常识。这些知识没有被人工编码而是从文本预测任务中涌现出来的。这背后的道理值得深思人类语言本身就是关于世界的浓缩描述。语言里包含了大量的物理常识、社会规则、情感模式、文化背景。模型在预测“下一个词”时实际上被迫编码了大量关于世界的“统计阴影”。因此Dreyfus 所说的“常识知识”以一种隐式方式被编码进了大模型的参数里。他不是全对——常识可以通过数据驱动的方式部分掌握这一点深度学习的胜利已经证明。4.4 大模型为何仍未解决 Dreyfus 的质疑但真正让一线工程师头疼的“AI 幻觉”问题恰恰说明了 Dreyfus 的批评在另一个层面依然有效。幻觉指的是模型生成的内容流畅、自信但事实是编造的。模型不是“因为知道答案”才回答而是“因为这段符号序列的概率高”才生成。它缺少一个稳定的世界模型来校验自己的输出。举个例子你问一个没有联网的 LLM“我的同事昨天中午吃了什么”它大概率会编一个答案因为它既不知道你的同事是谁也没有一份“昨天发生了什么”的世界状态记录。模型生成这段话纯粹是根据语言统计推断“这种情况下通常的回答方式”。这种对世界状态的“无根”状态正是 Dreyfus 所说“只懂符号、不懂在世”的另一种表现。语言统计可以记住大量事实但真正做决策、做计划、采取行动时它缺乏一个与真实世界持续同步的“状态模型”。Dreyfus 1965 年的批评深度学习/大模型时代的现状常识无法手工编码大模型从海量语料学到很多“常识”但常识依然脆弱、不稳定容易出现“一本正经胡说八道”规则系统无法处理开放世界的复杂性端到端学习在感知任务上取得突破但在多步规划和稳定推理上仍不扎实隐性知识无法形式化模型可以从数据中隐式学习特征但很难用符号解释它到底学到了什么智能依赖身体经验纯文本模型缺少身体经验世界模型和具身智能成为新的研究热点5. 从“背景知识”到“AI 幻觉”大模型时代的新旧对话5.1 AI 幻觉是不是“背景知识缺乏”的现代版Dreyfus 强调人类的理解依赖上下文背景。背景不是一条具体的知识而是一种组织一切知识的方式。人类知道如何将“杯子”“咖啡”“桌子”“会烫手”这些零散概念整合到一个连贯的情境里并据此行动。大模型虽然能回答大量事实型问题但它依赖的“背景”是文本统计分布而非真实世界状态。当模型被问到一个问题它首先判断的是“这段文本在语料里通常是怎么被回答的”而不是“关于这个具体情境世界的真实状态是什么”。这种偏差导致它很容易把几段结构相似的文本进行缝合生成一个看起来成立、实际上
返回列表