尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

LLM那些事(二):LLM训练三阶段——从会接龙,到会听话,到会思考

LLM那些事(二):LLM训练三阶段——从会接龙,到会听话,到会思考 1. 两个困惑上一篇《LLM 是什么——它不是查资料是在接龙》的结尾我留了一句话训练这件事够单独写一整篇。你是否已到过这两个困惑。第一个它明明不会为什么装会你让它写一个冷门知识点它能面不改色地给你编出一整段语气还特笃定事后一查全是幻觉。第二个它为什么突然不听话你问一个再正常不过的问题它却像被谁掐住了喉咙丢回一句「我不能回答」——明明跟安全八竿子打不着。这俩症状我在上一篇里其实埋了一半它只会接龙只保证「说得像」不保证「说得对」。但「装会」和「不听话」具体怎么来的得把它怎么被教出来的讲完才能说清。答案一句话训练不是一回事是三道工序——先教会它接龙再教会它听话最后教会它规矩和思考。往下慢慢道来2. 三阶段总览从会接龙到会听话到会思考先立骨架后面每章都是给这三个框装细节。预训练pretraining把海量文本喂进去学会接龙。这是能力上限的来源也是最贵的一道工序。SFT监督微调拿「问题 理想回答」的样例教会它答题格式学会听话。对齐 / 强化学习教它规矩什么能说、怎么答更好2026 年还加上教它思考怎么把题做对。三道工序不是三选一是流水线依次叠上去① 预训练读万卷书学会接龙能力上限 · 成本 80-90%② SFT语文老师教答题格式学会听话③ 对齐 / 强化学习评卷老师判偏好数学考试练思考学会规矩与思考这张图你后面可以一直回来对。第 3 章讲第一框第 4 章讲第二框第 5 章讲第三框——那是最热闹的一框。3. 预训练读万卷书学会接龙先看第一道工序。预训练就是它「会接龙」的本事从哪来。做法一句话把几乎能搞到的文本全喂进去——网页、书、代码、论文、维基百科、论坛帖子——反复练同一件事看前面的文字猜下一个 token。猜错了就把参数往「对」的方向拧一点点。就这么拧几万亿次。先给数字。Meta 的 LLaMA 3 用了 15 万亿个 token。四年前的 GPT-3 是 3000 亿四年涨了 50 倍。到 2026 年新一代已经往 20 万亿以上的量级冲。15 万亿什么概念上一篇那个 Excel 里 104 字的语料得放大几亿亿倍。这些数据不是平均分的。网页里低质量的会被滤掉代码、数学、多语言这类「高质量」语料会被反复上采样——数据配比是预训练团队抠得最细的地方。你最后用到的「会写代码」「会推理」很大程度是这个配比决定的。这一道工序产出什么我称它「升级版自动补全」。它在接龙这件事上炉火纯青语法、事实、逻辑、常识全藏在参数里。但它还不会「听话」——你丢给它一句「巴黎是哪个国家的首都」它不会停下来回答而是顺着话头继续编。要它停下来回答问题是下一道工序的事。预训练也是三阶段里最贵的。行业里普遍的说法是占总成本八成到九成有的口径算到九成五。它像盖一栋楼的主体结构后面所有工序都是装修。这也解释了一件事为什么绝大多数公司不从头训而是拿开源基础模型LLaMA、Qwen、DeepSeek 那批直接往下做。从零预训练是几十亿人民币量级的烧法拿现成基础模型微调是装修费。除非你要「连骨架都自己定」否则没人自己盖楼。4. SFT语文老师教答题格式预训练完它还是个补全工具。第二道工序叫 SFT监督微调。我的类比语文老师教答题格式。做法也一句话攒一批「问题 理想回答」的样例——「巴黎是哪个国家的首都」配「法国。」——让模型照着练。看问题学着自己答答得越像标准答案越好。注意一个细节损失只在「回答」那部分 token 上算题目本身不算。题目只是触发条件。它学到的是「格式」。什么时候用问好、什么时候分段、怎么收尾以及「当别人提问时我该以回答者的姿态接话」——这就是「会听话」。它不是懂道理是学会了「提问之后该走答题的流程」。SFT 数据贵精不贵多。Meta 那篇 LIMA只用 1000 条精挑细选的样例做监督微调就做到跟一堆用了 RLHF 的大模型在人类评估里不相上下。2026 年更狠一个 3 万条高质量合成数据的模型压过了用千万条级专有数据训练、还叠了偏好优化的旗舰开源模型。1000 条好样例胜过 10 万条平庸的——这不是鸡汤是 2026 年的主流共识。但 SFT 有天花板它教不出「偏好」。给模型看「巴黎→法国」它学会了标准答案但它说不清「为什么 A 回答比 B 回答好」。SFT 只会模仿样例不会判断好坏——「这个回答更礼貌」「那个回答更准确」「这是垃圾」这些判断它学不会。教偏好得换一种方法。这就是第三道工序出场的理由。5. 对齐 / 强化学习学规矩 学思考第三道工序最热闹也分两半一半教规矩一半教思考。2026 年变化最快的也是这一道。教规矩RLHF 和它的继任者先教规矩。方法迭代了几代2026 年的谱系大致是RLHF → DPO → GRPO/RLVR。RLHF人类反馈强化学习是 ChatGPT 那一波带火的。做法是请「评卷老师」让标注员给同一个问题的多个回答打分排序——A 比 B 好B 比 C 好——再用这些偏好训练一个奖励模型当裁判用强化学习把模型的输出往「高分段」推。评卷老师判的是偏好。这个回答更友好那个更准确这个冒犯了人、扣分。注意「拒绝」就是在这时候被焊上去的——标注员给「我拒绝回答这个问题」打了高分模型就学会了拒绝。RLHF 贵。奖励模型要额外烧一遍算力经典实现PPO还要一个跟策略网络差不多大的价值网络内存直接翻倍。2026 年更主流的是 DPO直接偏好优化不用训练奖励模型直接把「A 好 B 差」这个偏好对变成训练信号让模型自己在参数里学会「往 A 靠、离 B 远」。业界的说法是能拿到 RLHF 约八成的效果成本低一个量级。教思考RLVR 和 2026 的推理浪潮2026 年真正的变化在另一半——教思考。方法是 RLVR可验证奖励的强化学习。它换了个裁判不再是人给偏好而是机器能验的客观对错数学题答案对不对代码测试跑没跑过对就是对错就是错验证器一判不需要人标。这个转变我打个比方SFT 是语文老师教格式RLVR 是数学老师只发对错答案、不发解题过程让你自己在题海里琢磨出套路。题海战术真能练出解题思路——R1 证明强化学习能长出新能力。这句话我要立成判断往下用 R1 当证据。DeepSeek-R1题海长出来的思考DeepSeek-R1 是这个判断的实锤。它直接在基础模型上上强化学习方法叫 GRPO是 R1 带火的特点是省掉了价值网络只给两类奖励答案对不对、格式对不对。没有人工标注的解题过程模型全靠自己在题海里试。结果长出了谁都没教过它的东西。训练过程中模型的「思考」越变越长从几千 token 长到上万 token它会自己停下来检查、怀疑、回头改甚至冒出过「Wait, wait. Wait. That’s an aha moment」这种自我修正的瞬间。AIME 2024 数学竞赛通过率从基础模型的百分之十几拉到七十多。能力不是教出来的是「题海 对错反馈」逼着长出来的。这翻转了一个旧认知。以前强化学习在 LLM 里只是「薄薄一层对齐」——OpenAI 联合创始人 Ilya Sutskever 有个流传很广的比喻预训练像受教育RLHF 之后那层调教像入职培训。培训教规矩但改不了能力底子。R1 打破了这个分工强化学习不只是教规矩它能长出推理、自我修正这种实打实的新能力。更吓人的是成本。按 R1 的数据RL 只占预训练成本的几个百分点约 5%。又便宜又能长能力2026 年没人敢再小看这道工序。6. 困惑①的答案它明明不会为什么装会回到引言第一个困惑它明明不会为什么装会现在能答了。能力上限在预训练就定死了后面所有的调教都是在挖和表演。这是这篇文章最核心的一句判断。理论依据叫 Superficial Alignment Hypothesis浅对齐假说出自 LIMA 那篇。它的主张模型几乎所有的知识和能力在预训练阶段就学完了后面 SFT、RLHF 这些主要是在教「用什么格式把已有的东西说出来」——是挖掘和表演不是注入新知识。「装会」就是这么来的。预训练里它见多了「XX 是什么」这类句子学到的不是「我知道 XX」而是「这类问题后面该跟一段像样的话」。SFT 又教了它「被提问时答得笃定、完整」。于是当它遇到训练语料里根本没有的知识点它不会说「我不知道」——它没有这个选项——它只会顺着「问题 → 像样回答」的格式把见过的词汇、句式拼成一段听起来特专业的话。这就是幻觉。幻觉跟「能力上限」的关系本系列后面会专门拆一篇这里先埋个引子。你只要先记住一句话幻觉不是它学坏了是它只会按格式表演——它背不出「我不会」这个答案。7. 困惑②的答案它为什么突然不听话再答引言第二个困惑它为什么突然不听话拒绝不是它本来的性格是后来被教出来的规矩。预训练完的基础模型其实什么都会接包括那些不该接的。拒绝是 SFT 先教了「这类问题要说『我不能』」的格式再被偏好强化焊上去的。它内部怎么装的2026 年研究得很细。拒绝不是一个复杂的决策系统而是藏在参数空间里的一个低维「方向向量」。研究者的做法很粗暴把模型在某一层的激活值往这个方向的反方向推一点模型当场「解锁」什么都能答——像个开关。有人把它做成了 95% 成功率、1 秒出结果的工具。更意外的是这个开关装得有多浅。有篇 ICLR 论文的标题直接就是这个意思安全对齐不应该只做「几个 token 深」。拒绝主要作用在生成的前几个 token 上——模型先吐出个「我不能」把路堵死后面就放开了。这就是为什么套个「角色扮演」的壳把前几个 token 绕过去后面它往往就顺着接了。越狱之所以容易很大程度是因为这个开关太浅。2026 年「过度拒绝」成了实打实的问题论文扎堆。模型分不清「该拒的」和「不该拒的」你问个无害的问题它也像被狼来了吓过的小孩。学者进一步发现真正的安全拒绝是一个「全局方向向量」但过度拒绝复杂得多——它跟任务绑定、是高维的。所以「一刀切关掉拒绝」行不通会把安全一起关掉。厂商现在头疼的就是「有用」和「无害」这两个目标打架2026 年把它叫对齐悖论——大家已经接受这是个此消彼长的帕累托边界而不是能一次性解决的分歧。说到底它「不听话」是因为有人给它装了个「这句话不能说」的开关。开关是后装的不是天生的。8. 技术深挖可跳过这节写给想看机制细节的开发者跳过不影响主线。RLHF奖励模型 PPORLHF 三步走。第一步 SFT 让模型会说人话。第二步用人类标注的偏好数据训一个奖励模型给任何回答打分。第三步用强化学习经典实现是 PPO让模型在生成时优化这个分数同时加一个 KL 约束防止模型为了刷高分脱离人类语言、答得怪。贵在哪奖励模型要单独训PPO 还要一个价值网络估计状态值内存直接翻倍。偏好对还得人逐条标慢、贵。DPO把偏好对直接变成训练信号DPO 的关键洞察奖励模型那一步可以省。给定偏好对「A 好、B 差」DPO 直接把它翻译成训练损失让模型自己在参数里学会偏好不需要显式的奖励模型。离线训练稳定、便宜。这是 2026 年做偏好对齐的主流。GRPO省掉价值网络的组内相对优势GRPO 由 DeepSeekMath 提出、R1 带火。PPO 需要价值网络估计「这个状态值多少」GRPO 不要。它对同一个问题采样一组回答常见 8 到 64 个算每个回答的奖励再用组内均值、标准差归一化——「比组内其他回答好多少」就是优势。省掉一整张价值网络内存少一半数学上还等价于一个理想价值网络。RLVR验证器当裁判RLVR 把奖励从「人」换成「验证器」。数学题比对最终答案代码跑测试用例结构化任务校验输出格式。对就是对错就是错客观、不怕被刷分。代价是只适用于「答案可验证」的任务——「写一段打动人的产品文案」没有验证器还得回到偏好那套。9. 收束上限是读出来的性格是教出来的把三道工序的账总一下。预训练让它会接龙——能力上限在这定死SFT 让它会听话——答题格式在这学会对齐/强化学习让它会规矩、会思考——什么能说、怎么答更好、难题怎么解在这焊上。这就是标题那句从会接龙到会听话到会思考。如果你还没动手回去打开上一篇那个 Excel把「语料」Sheet 的 A1 整段换掉。上一篇我说这是「换语料等于重新训练」。现在你知道了那只是三阶段里的第一步——预训练。真实世界里换完语料后面还有两道工序SFT 补答题格式对齐补规矩。那个 Excel 只模拟了第一格后面两格它模拟不了——但你现在知道它们存在了。下一篇本系列第 3 篇《Transformer 与注意力》。
返回列表