尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

重读1965年经典:AI炼金术、大模型幻觉与能力边界

重读1965年经典:AI炼金术、大模型幻觉与能力边界 2026 年再看 AI很多开发者的状态是一边用大模型写代码、做 Agent、搭 RAG 应用一边又被它的幻觉、常识缺失和一本正经胡说八道折磨得头疼。如果你也处于这种状态那很有必要读一读一篇 1965 年的论文——Hubert Dreyfus 的《Alchemy and Artificial Intelligence》。先给一个明确判断这篇论文不是考古文献而是理解当代大模型困境的钥匙。Dreyfus 在 ChatGPT 出现的 60 年前就用炼金术三个字精准概括了盲目相信符号操作就能产生智能的危险。今天的大模型虽然换了一套技术路线但它在理解与模式匹配之间的边界依然没有完全绕过当年那些问题。这篇文章会从论文的核心论点出发把它和今天的大模型、Agent、具身智能工程实践放在一起对照然后落到一个开发者最关心的问题我们该怎么判断模型是真的会了还是只是碰巧答对了如果你的工作涉及模型选型、Prompt 设计、Agent 编排或者你正在为一个 AI 功能写验收标准这篇文章值得读完也适合收藏备用。1. 为什么一篇 1965 年的论文值得今天重新读先交代一下背景。Hubert Dreyfus 是美国哲学家长期在 UC Berkeley 任教。1965 年前后他在兰德公司RAND Corporation工作期间发表了一系列批评早期人工智能研究的报告《Alchemy and Artificial Intelligence》是其中被引用最多的一篇后来他还把相关观点扩展成了专著《What Computers Cant Do》1972。它被频繁引用不是因为 Dreyfus 对 AI 技术细节有多了解而是因为他从哲学和认知科学的角度提前指出了符号主义 AI 的结构性局限。那么问题来了一个 1965 年的哲学家跟我们 2026 年在搞大模型、Agent、RAG 的工程师有什么关系关系非常大。因为今天很多工程问题表面上是模型能力不够、数据质量不行、推理链路太长本质上却是我们把人脑的智能模式错误地类比到了机器上。比如我们以为只要给模型足够多的知识它就能理解世界我们以为模型回答错了只是训练数据不够多我们以为让模型接上工具、连上数据库它就智能了。这些想法恰恰是 Dreyfus 60 年前批评过的炼金术思维的现代变体。所以这篇论文的价值不在于它教会我们怎么写代码而在于它帮我们建立一个判断 AI 能力边界的思考框架。这个框架比任何一篇模型评测报告都更底层。2. 炼金术的比喻论文的核心判断Dreyfus 为什么用炼金术这个词这个比喻非常精妙值得稍微拆开讲。炼金术士相信只要掌握了正确的配方和操作步骤就能把铅变成金子。他们确实积累了很多化学实验技巧甚至发明了蒸馏器、坩埚等工具但他们缺少一个根本性的认识物质结构不是靠肉眼看到的形态决定的。所以炼金术永远是失败的直到现代化学出现。Dreyfus 用这个比喻批评早期 AI研究者相信只要在计算机里正确地操作符号、规则和逻辑就能产生智能。他们确实做出了一些让人印象深刻的实验比如跳棋程序、定理证明器、早期对话系统但他们缺少一个根本性的认识人类智能不只是符号的机械操作它依赖身体、情感、情境感知和大量的隐性常识。用今天的话说就是你可以在代码里塞进成千上万条规则但机器不会因此获得生活经验。更关键的在于Dreyfus 认为炼金术这个类比有三个层次表面层次早期 AI 研究者像炼金术士一样用看起来科学的方法追求一个其实还没有被真正理解的目标。方法层次他们相信只要符号足够多、规则足够复杂智能就会出现这和只要配方足够玄铅就能变金是同一类错误。根因层次他们没有意识到智能的很多核心机制比如常识、直觉、背景理解根本不以显式符号的形式存在。这个判断放到今天依然有解释力。大模型的训练方式已经不再是手动写规则而是从海量数据里统计规律但AI 真的理解了吗这个疑问和 1965 年并没有本质不同。区别只在于炼金术士在烧瓶里造不出金子今天的大模型已经能给出一大堆看起来像金子的东西但有经验的工程师还是能分辨出哪些是镀金哪些是实心。3. Dreyfus 的四个反对论点一份给 AI 研究者的预判清单《Alchemy and Artificial Intelligence》最有工程启发性的部分是 Dreyfus 把早期 AI 的失败归因于四个层面的简化假设。这四个假设我建议所有做 AI 应用的开发者都打印出来贴墙上。Dreyfus 认为早期 AI 研究在四个方面做了过度简化层面简化假设被 AI 忽略的关键事实生物学层面大脑可以脱离身体像计算机一样纯粹地处理信息智能依赖身体与环境的互动心理学层面智能行为可以完全形式化为离散步骤人类大量推理是整体性的、直觉性的认识论层面知识可以完全显式化为符号命题大量知识是隐性的无法言说本体论层面世界可以分解为独立、可枚举的对象和属性世界的意义取决于情境和背景这个表格值得反复看因为今天很多 AI 产品的问题依然可以归入这四个格子。3.1 生物学假设智能是不是可以脱离身体Dreyfus 认为早期 AI 研究者把大脑当成一块湿件认为只要程序够好硬件是什么无所谓。但他指出人类智能的很多能力比如抓握、分辨轻重、判断距离、理解杯子快掉下来了都依赖于身体的物理结构和感觉反馈。我们会觉得某个问题简单、某个问题难很大程度上是由身体经验塑造的。比如一个三岁小孩知道躲在门后意味着什么因为他的身体和空间有互动。但一个程序拿到一千篇描述门的文章也不会真正获得门能挡住视线的体验。在 1965 年这个观点被视为保守。但在今天具身智能Embodied AI、机器人学习、多模态感知成为热点恰恰说明 Dreyfus 的提醒不是杞人忧天。纯文本训练的大模型物理世界的理解永远是二手的。它可以做到非常流畅地描述苹果从树上掉下来的物理过程但它没有重力、没有触觉、没有重量感的真实体验。3.2 心理学假设智能是不是可分解的步骤早期 AI 的另一个假设是任何智能行为都可以拆解成一系列明确的步骤只要按顺序执行就完成了智能行为。比如下棋程序就是把走棋规则和估价函数写成代码。Dreyfus 反驳说人类专家做判断时往往不是按步骤来的。一个经验丰富的医生看 X 光片常常是一眼就看出来了你让他说说为什么他可能说不清楚。象棋大师也是靠棋感和模式识别而不是每步都在心里跑 minimax。这就是后来模式识别 vs 逻辑推理之争的雏形。也是今天为什么视觉大模型、向量检索、相似度计算这么流行——因为大量场景下模式匹配比规则推演更接近人类智能。但 Dreyfus 也提醒我们如果你把一个本质上靠直觉完成的任务强行拆成规则步骤效果大概率是灾难性的。这个坑今天依然到处都是。比如有些团队做客服机器人试图用几千条 if-else 规则覆盖所有话术维护成本极高效果却远不如一个微调过的小模型。3.3 认识论假设知识能不能完全写出来这是 Dreyfus 最核心的认识论批评。早期 AI 的一个信念是知识工程是由专家把知识显式化然后写进知识库。只要你把医学知识、法律知识、工程知识都写成规则AI 就能像专家一样工作。Dreyfus 指出人类知识中有大量内容属于隐性知识tacit knowledge。比如骑自行车、游泳、识别一张熟悉的脸这些技能我们很难用文字描述清楚。你会在骑自行车时自动调整重心根本不需要一个重心公式。这个观点对今天大模型的启示是即使我们把互联网上所有文本都喂给模型也训练不出身体性的隐性知识。模型无法告诉你骑自行车是什么感觉它只能复述别人对骑车的描述。所以在所有需要真正操作、感知、身体判断的领域——比如外科手术、驾驶、精密机械操作——纯语言模型的知识是非常可疑的。这也解释了为什么大模型在某些纯文本任务上惊人地擅长但在物理世界的真实操作上显得笨拙它学到的是知识的影子而不是知识的存在。3.4 本体论假设世界是不是可以枚举的对象最后一个假设是早期 AI 认为世界可以分解为一组独立的对象和属性然后把这些对象和关系存进数据库。比如一个家庭关系知识库存父亲、母亲、儿子、女儿、妻子、丈夫等关系机器就能推理。Dreyfus 表示反对世界的意义不是静态的对象清单而是由使用者和情境共同构建的。椅子不只是一个有四条腿的木制品它可能是一个用来垫脚的台阶、一件艺术品、一个门挡。同一个物体在不同情境中意义完全不同。今天的大模型反而在这个问题上取得了一些进步它不强行建立严格的逻辑本体而是通过语义向量把词与词、事物与事物之间的关系模糊地编码。但也正因为如此它经常出现一种语义跳跃——它知道椅子和座位相关但不知道在一个具体物理场景里椅子能不能真的承受重量。这四组假设Dreyfus 的核心意思是AI 研究者为了在计算机上实现智能把智能本身修剪成了计算机能处理的样子然后以为自己在研究智能的全部。这个修剪过的智能和真实智能之间的距离就是后来所有 AI 失败案例的根源。4. 从 1965 到 2026哪些预言被验证哪些被推翻了一篇写于 1965 年的论文能流传到今天一定不是因为它全对。我们需要客观看Dreyfus 哪里说对了哪里确实没有预见到。4.1 验证的部分第一个被验证的判断是规则符号系统做不了常识推理。无数专家系统项目在上世纪七八十年代折戟沉沙原因正是 Dreyfus 说的规则再多也覆盖不了真实世界的无穷例外。今天的 AI 工程师仍然在跟边缘 case作斗争只是战场从规则引擎换成了模型 Prompt。第二个被验证的判断是隐性知识难以显式编码。知识工程的老问题——专家说不清楚自己怎么判断的——在今天的模型训练里依然存在。即使我们有了海量数据模型学到的知识依然和人类专家的隐性经验有本质差异。第三个被验证的判断是智能依赖情境和身体。2024 年以来具身智能大火机器人操作、World Model、空间智能成为前沿方向。这从一个侧面说明纯语言和纯视觉的静态模型达不到真正的智能。4.2 推翻的部分但 Dreyfus 也有明显没预见到的地方。他最著名的错误判断是低估了统计学习和算力规模带来的超线性收益。Dreyfus 当年认为符号主义者试图用形式规则模拟智能是死路但他没有料到连接主义路线通过大规模数据统计和神经网络可以让机器在大量语言任务上逼近甚至超过人类。今天我们看到的 GPT 类大模型就是统计连接主义路线的胜利。另一个被推翻的观点是机器完全做不到直觉判断。Dreyfus 认为直觉来自身体经验机器没有身体所以永远不会有直觉。但从结果看大模型在某些任务上表现出了类似直觉的反应——比如一眼识别情绪、快速给出问题倾向——尽管这种直觉和人类的直觉在机制上完全不同更像是统计规律的表层复现。所以更准确的结论是Dreyfus 对符号主义的批评是准确的甚至可以说是预言级的但他对连接主义/统计学习的进展预测不足他提出的智能不能脱离身体这个命题在今天从具身智能、多模态、World Model 等方向重新获得了生命力。这也提醒我们读 1965 年的论文不是为了找到一个AI 永远做不到 X的结论而是为了理解为什么很多 AI 系统在演示时惊艳、生产时翻车。5. 大模型时代的重读幻觉、常识与假装理解现在我们把镜头拉回到开发者的日常。2026 年的大模型已经非常强能写代码、能总结文档、能做 Agent 规划但工程里翻车最多的三个问题恰恰可以在这个论文框架里找到解释。5.1 幻觉模式匹配与真实理解的差距大模型幻觉本质上就是 Dreyfus 讲的认识论问题模型并没有一个稳定的世界模型来检查自己的回答它只是在生成概率最高的文本序列。当你问一个它没有稳固知识支撑的问题时它会用最流畅、最像正确答案的方式填补空白而不是承认自己不知道。用 Dreyfus 的话说这就是炼金术的现代版本系统看起来掌握了知识但实际上只是在操作符号token的概率分布。5.2 常识缺失本体论假设的当代变体大模型的常识问题比如如果一个杯子在桌子上你推桌子杯子会怎样模型通常能答对因为它读过很多类似文本。但如果换一个稍微奇怪的情境——一个杯子在桌子上你轻轻推桌子的左边杯子会怎样如果桌腿是果冻做的呢——模型很容易开始一本正经地编造物理规律。这正对应 Dreyfus 的本体论批评模型没有一个可以推导的物理世界模型它只有语言统计的近似。工程上最常见的错误就是把模型在训练数据里见过的文本当成模型真正掌握的常识。一个模型能写出非常合理的如果……那么……推理不代表它在任何场景下都能执行这个推理。这是设计 Agent、RAG 系统时必须要有的清醒认识。5.3 假装理解评测分数背后的陷阱再往工程走一步。很多团队在选模型时只看 benchmark 分数和人工抽评的通过率。但 Dreyfus 的框架提醒我们通过率意味着什么取决于测试任务的性质。如果一个测试集是从训练数据分布中抽样出来的那么模型得分高可能只是因为它记住了更多相似表达而不是因为它真的学会了推理。这就像炼金术士拿着自己配好的配方反复宣称成功却从未面对过不按配方出牌的原料。所以做 AI 应用我建议把评测任务分成三类模式复现型总结、改写、分类、抽取模型通过率可以很高规则推理型代码生成、数学题、逻辑推导需要仔细构造测试集世界交互型物理操作、实时决策、道德判断谨慎对待模型的回答。这三类任务的理解密度是递增的。模式复现型任务里模型答得好可能只是模式匹配世界交互型任务里哪怕模型答得像模像样也要默认它其实并不真正理解。6. 给当代 AI 工程师的工程启示说了这么多理论和历史这一章落实到工程实践。Dreyfus 的这篇论文虽然不教代码但它的思路可以直接转化为四条工程原则。6.1 原则一根据任务本质选择技术路线在立项之初先问清楚这个任务本质上是模式匹配还是规则推理还是世界交互# 文件路径examples/task_classifier.py # 一个简单的任务分类逻辑帮助团队在方案选型前统一判断 # 真实项目中可以根据评分输出技术路线建议 def classify_task(description: str) - str: 根据任务描述粗略判断适合的技术路线。 这个函数不是银弹只是帮助团队在方案评审时对齐思路。 keywords_pattern [总结, 改写, 分类, 抽取, 翻译, 情感分析] keywords_rule [代码生成, 数学推导, 逻辑判断, 合规检查, SQL生成] keywords_world [物理操作, 实时控制, 机器调度, 外科手术, 驾驶决策] if any(k in description for k in keywords_world): return world_interaction: 强烈建议引入具身/仿真/强化学习环节仅靠文本模型远不够 if any(k in description for k in keywords_rule): return rule_reasoning: 适合大模型外部工具严格验证但要构造对抗性测试集 if any(k in description for k in keywords_pattern): return pattern_matching: 大模型效果较好但要注意分布外数据 return unknown: 建议先做小规模原型验证这个简单的分类逻辑不是严格的框架但它能帮助团队避免一个典型错误把一个世界交互型任务当成模式匹配型任务来做最后上线翻车。6.2 原则二为隐性知识留出验证机制如果模型需要在现实世界中执行动作比如审批、操作 API、生成配置不要相信模型自己的口头解释必须为它设计一个外部验证环节。# 文件路径examples/validation_loop.py # 为 Agent 的每个关键动作增加独立校验 def verify_action(action: dict, system_state: dict) - bool: 外部校验函数判断 Agent 的动作建议是否与系统状态一致。 不要把 Agent 的输出直接当作可执行命令。 Dreyfus 的启示模型没有对世界的稳定理解必须用外部事实兜底。 required_keys [action, target, reason] if not all(k in action for k in required_keys): return False if action[target] not in system_state: # 模型可能幻觉了一个不存在的资源 return False if action[action] delete and not action.get(backup_done): # 高风险操作必须显式声明已备份 return False return True # 使用示意 agent_output { action: update, target: config_v1, reason: 用户要求调整参数, backup_done: True, } print(verify_action(agent_output, system_state{config_v1: active}))这个原则的实质是不要把模型当作可信的世界模型把它当作一个聪明的假设生成器。Agent 可以提出假设但最终的决定必须经过外部现实数据库、API 返回、人工审批的验证。6.3 原则三用分布外测试发现模型边界Dreyfus 批评符号主义时有一个核心论断系统只能在预设的规则里运行遇到规则外的情况就崩。现代大模型虽然更灵活但依然有分布内表现好、分布外表现差的问题。所以每个模型上线前都应该做分布外测试。// 文件路径configs/oos_test_cases.json // 以客服意图识别为例设计超出训练数据分布的测试用例 { test_suite: customer_service_oos, cases: [ { input: 我的订单号是 #12345但我不小心把它删了怎么办, expected_intent: order_recovery, reason: 同时涉及订单查询和误删恢复属于组合型诉求容易误判 }, { input: 我想了一个办法……算了不说了你先告诉我你们几点下班, expected_intent: business_hours, reason: 包含口语化的自我否定对意图识别是挑战 } ] }这种测试用例不是为了证明模型在工作而是为了证明模型在最不像训练数据的时候还能不能工作。这正是 Dreyfus 的核心关注点智能不是背诵是在意外情境里还能做正确判断。6.4 原则四警惕炼金术式成功Dreyfus 的比喻里炼金术士最危险的地方在于他们会把偶然的、局部的成功解释为普遍方法的突破。写代码时我们也会犯同样的错误。一个常用的防侥幸手段是三次复现原则同一个 Prompt、同一个任务换三个不同的输入看结果是否稳定同一类任务换一个不常见的表达方式看模型是否依然正确换一个不同的模型版本或随机种子看结果是否依然是已知的最佳答案。如果三次里有一次明显退步那你需要认真考虑模型之前的表现是真的学会了还是只是碰巧命中了。7. 常见认知误区与排查思路在工程一线围绕 AI 能力边界会出现很多重复性问题。下面整理一份类似排错手册的表格适合团队评审和故障复盘时对照。现象可能的根因排查方式解决方案模型在测试集上表现好上线后崩测试集与真实场景分布不一致检查测试集数据来源做分布外测试增加真实线上样本设计对抗性测试集定期重采样验证模型回答非常流利但事实错误模型在生成高概率文本而非检索事实对答案做关键词/实体级校验交叉验证多路回答为关键业务接入 RAG 或外部知识库强制模型引用来源Agent 执行了不该执行的操作模型对工具调用结果做了错误推断检查 Agent 规划日志查看工具返回数据与模型决策之间的逻辑在工具调用外增加独立校验层高风险操作必须人工确认同一个 Prompt 结果时好时坏模型本质是概率生成天然不稳定设置温度参数统计多轮输出的方差对关键输出做确定性后处理使用投票或自洽性校验模型说我不能访问互联网但业务需要实时数据模型训练数据有截止时间不具备实时性查看模型版本和上下文限制接入 API 检索/网页搜索工具不要期望模型自带实时性把手工规则系统换成大模型后准确率反而下降任务本质可能是高精度规则推理生成模型并不擅长对比规则系统和大模型在边界 case 上的表现混合架构规则系统兜底大模型负责模糊匹配和理解这些问题的共同根因几乎都能在 Dreyfus 的论证里找到影子系统把符号操作误认为是理解把局部成功误认为是普遍能力。8. 从论文到工程一份实践清单站在 2026 年回看Dreyfus 这篇论文最大的贡献可能不是AI 能不能成功这个哲学命题而是给工程师提供了一个智能系统能力边界的三层判断模型符号层系统能不能按规则处理适合确定性的、可枚举的任务。统计层系统能不能在模糊输入下给出合理的概率响应适合语言、图像等感知任务。具身层系统能不能在真实物理世界安全地操作这是当前最难、也最依赖外部验证的层级。如果你在设计一个 AI 应用先想清楚你的任务落在这三层里的哪一层然后选择对应方案如果任务在符号层直接用规则引擎、数据库查询、确定性算法不需要上大模型如果任务在统计层大模型、向量检索、分类模型都值得尝试如果任务在具身层必须为系统配置仿真环境、物理校验、人工监督和回滚机制。 把这个清单放进项目周会里每次评审模型方案前过一遍。它能帮你避免很多 为什么模型看起来会但实际不会 的尴尬。9. 延伸思考与后续阅读方向如果你对 Dreyfus 的思想产生了兴趣有几个方向值得继续深入。第一个方向是读 Dreyfus 的后续著作尤其是 1972 年出版的《What Computers Cant Do》以及他与弟弟 Stuart Dreyfus 合著的《Mind Over Machine》。前者把 1965 年的论点扩展得更系统后者则深入讨论了人类专家与计算机决策的差异。第二个方向是了解具身智能和World Model的最新进展。Dreyfus 提出的智能不能脱离身体的主张这几年在机器人学、多模态模型和自动驾驶领域被重新赋予了技术含义。如果你做 Agent 或机器人应用读一些具身智能方向的论文能更好地理解为什么纯文本模型做不了物理操作。第三个方向是关注幻觉检测和模型能力边界评测工具链。Dreyfus 的哲学问题已经转化为一个非常实际的工程问题我们怎么判断模型输出是否可信。现在有很多开源工具可以做事实核查、自洽性校验、不确定性估计都与这个问题相关。这篇文章想传递的核心信息总结成一句话就是1965 年 Dreyfus 用炼金术提醒我们不能把符号操作误认为智能2026 年我们依然不能把模式匹配误认为理解。AI 正在变得更强但它离真正的理解始终隔着一道隐性的沟这道沟的轮廓Dreyfus 早已画出来了。写代码之外偶尔读一篇这样的老论文是性价比很高的投资。建议收藏这份实践清单下次项目评审或者排查大模型为什么答错了的时候拿出来对照一遍总会有新的发现。
返回列表