为什么“预测下一个 Token”可以产生智能?
先跳出一个很容易出现的误区很多人初次接触模型都会错误的认为模型是“学会了任务”比如学会写代码学会翻译学会推理但真实情况却是模型没有“学任务”,它也不能真实的理解这些任务.模型只学了一件事语言分布这些产生的所有能力都是“预测下一个 Token”的副产品(请一定要记住这句话)7.2 我们换一个视角世界被压缩成语言我们先想一个问题人类的互联网里有什么代码数学论文对话逻辑推理操作步骤知识解释…等等内容这些东西有什么共同点都是用文本(文字)表达的!所以可以认为:互联网本身就是一个“超大规模语言分布样本”所以科学家们的训练目标就变成学习这个世界“所有文本出现的概率规律”7.3 下一词预测 ≠ 文字接龙很多人理解为就是简单的续写句子.但我们通读了本系列前面的内容,其实就应该知道.模型在学习的是token的“条件概率分布”从数学层面描述一下:模型学的是,在当前上下文下.所有可能的下一个 token 的概率举个例子“水的沸点是”模型不会只知道一个答案而是Token 概率100°C 高一百摄氏度 高约100度 中香蕉 低所以它学的是“世界上的文本如何自然延续”7.4 为什么这件事会变成“智能”这是最神奇的一点,其实很多科学家也还在探讨.我们先按我们的理解拆成三层第一层语言 知识压缩格式我们熟悉的所有知识科学规律逻辑关系人类经验最终其实都被写进文本,所以我们可以认为文本 知识的载体第二层预测 反推结构(Transformer做的事情)要预测下一个 token你必须理解语法结构语义关系因果逻辑世界知识第三层优化目标逼迫模型学会“结构” (训练)模型为了降低损失会自动学会哪些 token 之间存在结构关系结果就是模型被迫学习“世界的统计结构”7.5 用比喻来描述一下可以这样理解我们在训练模型时其实是在做给一个人无限做“完形填空”但这个填空是全互联网级别全语言全领域所以会产生一个长期结果这个人会逐渐学会语法逻辑常识专业知识推理模式虽然没有人教“推理”但他会自己学出来了7.6 为什么“能力会涌现Emergence”这是非常关键和神奇的核心现象。什么说是涌现因为模型的参数在达到某个规模之前,是不会做数学题的.当它的参数规模突破到某个点之后,就突然会做了.所以这也是为什么模型越大,能力越多 越完善.为什么会涌现因为小模型只能记模式,然而大模型则大量的开始学结构关键转折点当模型容量足够大可以同时表示“语言 逻辑 知识组合”于是出现推理能力代码能力规划能力它的本质不是“突然学会”而是从“记忆”升级为“结构建模”7.7 为什么模型会写代码回到我们程序员最关心的问题.很多人错误的认为,是因为GPT训练了 整个GitHub的资料但是这是不完整或者说从抽象层面来说 是错误的理解.作为程序员, 我们知道代码本质是一种高结构语言.它的特点就是语法严格、逻辑明确、模式重复、上下文强约束.模型通过训练GitHub学到的是“代码 Token 的统计规律”举例if (x 0) {后面高概率是return …}模型不是“理解代码”而是学会了代码世界的语言分布结构7.8 为什么模型会“推理”推理在模型世界其实不是一种能力而是语言结构的一种形式例如如果 A B并且 B C那么 A C这种结构在训练数据中出现过无数次数学证明教科书解释文本模型学到的是“这种 token 组合通常如何延续”所以,在模型层面, 推理 高结构文本续写7.9 非常重要的结论这一节,我们先记住一个概念模型没有“理解世界”它只是学会了“世界如何被描述”但是为什么在普通人看来像理解那是因为 人类语言本身就是“世界压缩后的表达”7.10 为什么一个目标能统一所有任务我们把所有任务统一抽象理解写代码预测代码 token翻译预测目标语言 token总结预测压缩版本 token推理预测逻辑延续 token可以看出来,上面的所有任务本质都是同一个问题的不同数据分布7.11 一个更深层的抽象概念LLM 本质不是分类器也不是推理机.而是一个超大规模条件概率函数逼近器它一直在做一件事学习函数[P(token_{t1} | token_{1:t})]7.12 为什么这种函数会变成智能因为现实世界本身就通过人类语言形式,变成了“可压缩的结构”模型则是在做继续压缩世界学习规律重建分布最终就得到了: 语言能力 ≈ 智能能力的投影