尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

模型“变笨”趋势:用世界知识换推理能力,解决幻觉问题还能本地运行!

模型“变笨”趋势:用世界知识换推理能力,解决幻觉问题还能本地运行! 模型正有意变得“更笨”2026年8月17日指出推理得分持续攀升同时每个token的计算量却在不断下降。[GLM - 5.2](https://benchlm.ai/best/reasoning-models)在2026年的美国数学邀请赛AIME中得分达到99.2%每个token约有400亿个活跃参数。Qwen3.5以170亿个活跃参数获得了91.3%的分数。[DeepSeek V4 - Flash](https://www.morphllm.com/deepseek-v4-flash)的活跃参数为130亿个。作为对比2023年有传言称GPT - 4运行时约有2800亿个活跃参数但它几乎无法解决AIME的问题。在小模型方面[Qwen3.5 9B](https://artificialanalysis.ai/articles/qwen3-5-small-models)量化后只需6GB的显存在Artificial Analysis的智能指数中其得分大约是100亿参数以下次优模型的两倍。如果仅看数学和代码基准测试会得出模型每个参数的智能程度正以惊人速度提升的结论。不过在基准测试中虽如此但如果问这些模型一个简单的事实性问题情况就会反转。在 [SimpleQA](https://pricepertoken.com/leaderboards/benchmark/simpleqa)一个不允许使用工具的事实回忆基准测试中目前排名第一的是Gemini 2.5 Pro得分53%这意味着即使花钱能买到的最佳回忆能力也会答错一半的问题。小模型的表现更是惨不忍睹。Artificial Analysis在其知识基准测试中测得Qwen3.5 4B和9B的幻觉率达到80%至82%这意味着在大多数情况下当它们不知道某个事实时就会编造一个。若问Qwen3.5 9B一个19世纪小数学家的出生年份它会给出一个自信、看似合理但错误的答案。参数数量的减少并非没有代价研究实验室正在用世界知识换取推理能力而且这种交换是有意为之。参数的用途事实需要占用空间。关于知识容量的研究“语言模型物理学”系列的测量最为清晰表明每个参数大约能存储两比特的事实性知识。若想要一个能知道每个维基百科小角色的出生年份、每个荷兰城市的人口数量以及每个npm包中每个函数的参数顺序的模型就得在权重上付出代价这也是前沿模型发展到数万亿参数的一个重要原因。推理能力比事实性知识更易于压缩因为推理是相对较少的一组程序的反复应用将问题分解成部分、跟踪中间状态、检查自己的工作以及在某一步失败时回溯。在可验证任务上进行蒸馏和强化学习能很好地将这些程序迁移到小模型中。Phi - 4有140亿个参数大量使用合成教科书式数据进行训练它擅长数学但不擅长琐事这恰恰反映了其训练数据的内容。这种情况过去看起来像是合成数据方法的局限现在却像是设计目标。在这种交换中留存下来的知识有其特点。这些模型是通才对几乎所有事物都略知一二但几乎没有深入了解。若问其中一个模型关于PostgreSQL的问题它知道这是什么、有什么优点以及多版本并发控制MVCC大致是如何工作的但若问哪个版本添加了某个特定的查询规划器功能它就会给出编造的事实。保留这种广度的知识是正确的因为广度能让模型理解问题的含义、知道该查找什么以及判断信息来源是否合理。深度知识获取成本低但存储成本高所以这部分就被舍弃了。事实会过时程序不会一次前沿的训练运行需要数月时间花费数亿美元而一旦训练完成其中的事实就开始过时。库的API会改变价格会变化人们会换工作2024年的模型对JavaScript生态系统的认知在模型发布前就有一半已经过时了。每个被编入权重的事实都有保质期而更新它的唯一方法就是再次进行训练。但程序不会过时。1970年的代数运算方法和现在一样将问题分解或发现两个信息源之间的矛盾的方法也是如此。一个主要基于程序、只包含少量事实的模型不会像知识密集型模型那样快速老化。它的训练截止日期影响要小得多因为现实世界的当前状态本来就不应该存储在权重中。这是整个方法最有力的论据它将昂贵、缓慢的产物训练好的模型与每天都在变化的事物事实分离开来。辅助工具承载知识如果模型本身不知道某些事情那就需要其他东西来提供这些知识这个东西就是辅助工具对知识库的检索、工具调用、网络搜索以及装满文档的文件系统。之前写过 [Rust是智能体的辅助工具](/blog/rust-is-a-harness)它能提供廉价的机器可检查反馈。从另一个角度看这是同样的道理。模型负责推理而它推理所需的一切信息都在运行时提供。已经可以看到智能体以这种方式工作。一个编码智能体不需要记住你依赖项的API接口因为它在调用任何东西之前会先在 node_modules 中搜索或阅读文档而且它的答案基于你实际安装的版本而不是训练数据中占主导地位的版本。以前每次前向传播中固定的回忆成本现在变成了按需查找。在你的GPU上运行前沿模型按照这个趋势发展几年认为会得到一个具有前沿质量推理能力类似Fable的质量、能在单个消费级GPU上运行的模型。计算能力方面已经接近实现。DeepSeek V4 - Flash每个token用大约130亿个活跃参数进行推理这完全在消费级GPU的能力范围内。装不下的是其专家层中另外2710亿个参数而专家层主要用于存储事实。这就是整个交换过程中可以舍弃的部分。去掉知识后模型的总大小会接近活跃参数的大小一个200亿到400亿参数、4比特量化的模型可以装在自2022年以来就用于游戏电脑的24GB显卡上。不过有个问题这样的模型知道的东西不多。如果不借助任何工具问它一个简单的事实性问题它正确的做法应该是说不知道然后去查找答案。如果搭配一个不错的辅助工具这就满足了现在使用前沿模型的大部分需求而且可以在本地运行无需按token付费也不会有数据流出机器。这在很大程度上解决了幻觉问题认为最有前景的是这种方法对幻觉问题的改善。当事实存储在权重中时错误的事实很难被发现和修正。无法在权重中进行搜索无法与上个月的权重进行对比而且修正一个错误可能意味着进行微调而这可能会破坏其他未知的东西。模型会以与正确事实相同的流畅自信陈述错误事实而且没有可参考的依据来检查。当事实存储在模型之外时错误答案就有迹可循。模型会引用一份文档可以打开该文档。如果文档有误可以编辑文档这样以后的每个查询都会得到修正这比等待下一次训练运行要快大约一年。检索并不能完全消除错误因为模型仍然可能误读信息源或错误地拼接两个信息源但有来源的陈述是可以检查的而来自权重的陈述则无法检查。知识库中的错误事实只是一个普通的数据错误是已经知道如何追踪、修复并编写回归测试的那种错误。在未来的某个阶段模型卡片可能根本不再列出知识截止日期因为权重中剩余的知识过时周期是以年为单位而不是以周为单位。模型在运行时会被赋予现实世界的当前状态就像CPU被赋予一个程序一样。目录参数的用途事实会过时程序不会辅助工具承载知识在你的GPU上运行前沿模型这在很大程度上解决了幻觉问题
返回列表