大模型从“训练”到“使用”
大模型从“训练”到“使用”可以理解为先让模型学习海量知识和语言规律再教它按照人类意图回答最后部署到服务器供用户调用。数据准备预训练指令微调人类偏好与安全对齐评测与优化压缩和部署用户推理调用持续反馈与迭代1. 数据准备首先从互联网、书籍、论文、代码库、问答数据等来源收集大量数据。随后进行处理去除重复、乱码和低质量内容过滤违法、有害、隐私数据对数据进行分类和质量评分将文本切分成 Token划分训练集、验证集和测试集Token 是模型处理文本的基本单位。它可能是一个汉字、一个单词或单词的一部分。例如用户输入大模型是如何训练的 Token大 / 模型 / 是 / 如何 / 训练 / 的实际切分结果取决于模型使用的分词器。2. 预训练预训练是成本最高、规模最大的训练阶段。模型会阅读海量文本并反复完成一个核心任务根据前面的 Token预测下一个 Token。例如输入法国的首都是 目标巴黎模型预测错误后通过反向传播调整内部参数。这个过程会重复数万亿次。经过预训练后模型会逐渐学会语言和语法规律一般事实和知识代码结构上下文关系一定程度的推理模式但预训练后的模型更像一个“文本续写器”不一定能够很好地理解和执行用户指令。3. 指令微调接下来使用高质量的“指令—答案”数据继续训练也叫监督微调英文简称 SFT。例如指令请解释什么是 WebSocket 答案WebSocket 是一种支持客户端与服务器双向通信的协议……这一阶段主要教会模型理解用户要求按指定格式回答进行总结、翻译和代码生成完成多轮对话在信息不足时提出问题预训练负责“获得基础能力”指令微调负责“学会怎么帮助用户”。4. 人类偏好和安全对齐对于同一个问题模型可能生成多个答案。人类标注人员或其他模型会对答案进行比较例如哪个答案更准确哪个表达更清楚哪个更符合用户意图哪个答案更加安全哪个更少出现虚假信息然后使用这些偏好数据继续优化模型。常见方法包括RLHF基于人类反馈的强化学习RLAIF基于 AI 反馈的强化学习DPO直接偏好优化规则奖励和可验证奖励经过这一阶段模型通常会变得更有帮助、更守规则也更符合人类的表达习惯。5. 评测和优化训练完成后需要从多个方面评估模型评测方向主要内容知识能力是否掌握事实和专业知识推理能力数学、逻辑、规划和问题分析编程能力代码生成、调试和代码理解指令遵循是否严格执行用户要求安全性是否生成有害或违规内容幻觉率是否会编造事实、链接或数据性能响应速度、显存占用和调用成本如果评测不理想可能需要重新清洗数据、调整训练方式或继续进行专项训练。6. 模型压缩和部署训练模型通常需要大量 GPU但用户使用模型时服务也必须足够快、足够便宜。部署前可能进行量化把 FP16 参数转换为 INT8、INT4 等低精度格式蒸馏让小模型学习大模型的能力剪枝删除影响较小的参数推理引擎优化提升 GPU 利用率KV Cache缓存历史上下文的计算结果批处理同时处理多个用户请求之后模型会部署到 GPU 服务器或本地设备并通过 API、网页、App 等方式提供服务。7. 用户实际使用推理阶段用户向模型发送问题时并不会重新训练模型而是执行“推理”。例如用户输入请介绍一下 WebSocket系统大致会进行以下处理将系统规则、历史对话和当前问题组合成上下文使用分词器转换为 Token输入神经网络进行计算预测下一个 Token将新 Token 加入上下文继续预测直到生成结束也就是说模型的回答是一个 Token 一个 Token 生成的。否是用户问题转换为 Token模型计算概率选择下一个 Token是否结束返回完整答案生成时还会受到一些参数影响Temperature越高回答越随机Top-p限制候选 Token 的概率范围Max tokens控制最大输出长度Context window决定一次可以处理多少上下文8. 大模型如何获得最新或私有信息模型训练完成后参数通常不会因为一次对话立即发生变化。因此模型本身可能不知道训练之后发生的事情。实际产品通常会增加外部能力RAG 知识检索先从企业知识库、文档或搜索引擎中找资料再把资料放进上下文让模型回答。用户问题 → 搜索相关文档 → 将文档片段提供给模型 → 模型根据文档生成答案工具调用模型判断需要调用某个工具例如查询天气搜索网页运行代码查询数据库发送邮件创建日程工具返回结果后模型再组织成自然语言答案。微调如果企业需要模型长期掌握特定表达方式或任务模式可以使用行业数据继续微调模型。简单来说RAG 用来补充知识工具调用用来执行操作微调用来改变模型的行为习惯。9. 持续迭代模型上线后开发者会收集经过脱敏和授权的反馈例如用户喜欢或不喜欢哪些回答哪些问题经常回答错误是否存在安全漏洞推理速度和成本是否合理新模型是否优于旧模型这些数据不会让当前模型瞬间“边用边学”而是通常经过处理后用于训练或优化下一版本。一句话总结大模型的完整生命周期是用海量数据预训练基础能力通过指令微调和偏好对齐让它学会帮助人类经过评测和推理优化后部署到服务器用户使用时再结合上下文、知识库和外部工具生成答案。