
法律科技公司 Harvey 宣布推出基于 Kimi K3 的后训练模型 Harvey Tenet。看到这条消息我的第一反应不是再去刷新一轮模型榜单而是注意到另一个信号AI 行业里真正决定交付质量的环节正在从“写提示词”切换到“做后训练”。过去两年很多人已经习惯了把大模型当 API 用给提示词调参数加检索。这套组合确实能解决一部分问题但一到专业领域就会发现天花板很明显。通用模型能聊法律、能写案例摘要却很难稳定地按律所内部的格式、口径和流程输出。要想真正进入生产环境通常只有两条路要么花大量精力设计复杂工作流要么拿起一个小模型或基础模型对它做针对性的后训练。Harvey Tenet 选择的是后一条路。它选择的底座还是 Kimi K3——从公开讨论看这款模型被外界关注的点通常集中在长文本、复杂推理和中文能力上。更准确地说Harvey 要的不是“用 Kimi K3 的 API 再套一层产品”而是把 Kimi K3 作为底座经过自己的数据配比和专业标注训练出一个更懂法律场景的专用模型。这个动作看起来很技术但背后是一个值得展开聊的问题所谓行业大模型到底是怎么造出来的为什么一个专注法律的公司不自己从零训练而要选择一个基础模型做后训练后训练和微调有什么区别普通开发者在什么阶段也应该考虑这条路这篇文章就围绕这几点展开。1. 先理解这个动作它不是一次 API 调用而是一次模型再造1.1 Harvey 在做什么专业公司与基础模型的关系变了过去一家法律科技公司要想做大模型产品最常见的做法是接 GPT、Claude、Kimi 等模型的 API然后把律所的知识库接进来再写一些针对法律问答的提示词。这套做法能产品化但有几个问题提示词可以被模仿知识库的检索质量不稳定模型自身的语言风格、推理习惯和输出结构也未必符合专业场景。另一种做法是选择一套基础模型权重拿自己的专业数据去调整它。Harvey Tenet 就属于这条路。它把 Kimi K3 当作底座用法律领域的数据和任务对齐方式做后训练最终形成独立的模型产物而不是一个 API 之上的包装层。这里有一个容易混淆的点。很多人听到“基于 Kimi K3”以为就是换个界面继续调 API。但在技术实现上后训练通常意味着你拥有或使用模型权重并且可以对模型的参数继续训练。选择哪个底座为什么不是自己从零训练这背后是数据、算力和工程投入的权衡。1.2 为什么“后训练”这三个字才是重点后训练不是新概念但在过去两年里被严重低估了。基础模型在预训练阶段学习了海量文本中的统计规律形成“广谱能力”但要让模型在特定行业里稳定履行任务比如从合同里抽取管辖条款、按判决书结构生成摘要还需要后续的指令微调、偏好对齐和任务适配。这些步骤共同构成后训练。为什么专业公司越来越重视后训练核心原因是提示词只能改变模型的表达方向很难改变模型的知识边界和决策偏好。后训练则可以直接把专业任务的数据结构、输出格式、错误判断方式灌进模型。一个后训练充分的法律模型拿到案件材料后不会只给出“可能涉及违约责任”这类笼统回答而是会按律所预先定义的框架先识别争议焦点再引用对应法条最后给出结论和风险提示。这种稳定性不是考更好的提示词就能达到的。1.3 关于 Kimi K3别被参数讨论带走在很多技术社区里Kimi K3 被讨论时常常伴随着参数量、MoE 架构、超长上下文、推理能力这类关键词。还有一些讨论会把不同公司的模型放到一起对比甚至预测后续版本。站在使用者的角度我不建议把注意力全部放在这些数字上。选择哪个基础模型做后训练是一个匹配问题而不是纯粹的“谁更强”的问题。你需要考虑的因素至少包括基础模型是否开放可训练接口许可证是否允许你用它的权重做领域后训练并商用底座的中文、英文、代码、长文本能力是否匹配你的行业训练工具链是否成熟后续版本是否有清晰的兼容策略。Harvey 选 Kimi K3外界只能看到结果看不到它的评估过程但我们可以推断它看重的不是单点分数而是模型能力与法律场景需求的匹配度。关于参数规模和架构目前公开可验证的细节有限。我不建议大家把传闻中的参数量当作决策依据更建议关注官方文档、模型卡和实际评估结果。2. 后训练到底在解决什么问题2.1 预训练决定上限后训练决定下限几乎所有大模型都遵循同一个基本分工预训练阶段用海量文本学习语言规律和世界知识决定模型的能力上限后训练阶段用更聚焦的数据让模型学会具体如何答题决定模型在真实任务中的表现下限。打个比方预训练像是让一个人读完一所超大型图书馆的所有藏书。这个人因此知道法律、医学、编程、历史但问题是你不知道怎么跟他对话才能得到可靠答案。后训练就是对这个人做定向训练告诉他法律问答的规则、输出结构、风险提示告诉他哪些问题要明确说不确定哪些问题必须引用来源。于是他从“懂得很多的人”变成一个“靠谱的助理”。很多人把“后训练”和“微调”混为一谈。严格来说微调只是后训练的一部分。后训练一般包含指令微调、对齐训练、任务适配、评估回归等环节。它们的目标一样让模型在特定使用方式下满足预期的行为标准。2.2 后训练不是一个步骤而是一条流水线如果只在基础模型上跑几轮指令微调通常还不够。一个完整的后训练流水线可能包含以下环节数据准备从业务场景里采集任务样本整理成指令、输入、输出的三元组。指令微调SFT用样本教会模型按特定格式完成任务。偏好对齐通过人类偏好或自动反馈让模型学会选择更合理、更安全的答案。评估回归用一套固定的评测集验证每次训练有没有把能力改坏。上线迭代把实际使用中的 badcase 回收回来形成下一轮训练数据。这些环节不是一次性做完就结束。真正负责的团队会把后训练当成一条长期运行的流水线。每次数据更新、每次需求调整都可能触发新一轮训练。2.3 为什么不是所有团队都需要从零训练有一种直觉是既然要造行业模型为什么不干脆从零训练一个法律大模型答案是成本和可行性都不支持。从零预训练需要的数据量和算力通常是个人开发者甚至中型公司很难承担的。而且从零训练不一定能获得比成熟基础模型更好的世界知识。行业模型的价值通常不在“更聪明”而在“更符合特定任务规范”。所以更合理的路径是在成熟基础模型之上用领域数据做后训练把通用能力转成专业交付能力。这个思路的好处很明显基础模型负责通用能力专业团队负责领域知识、任务格式和风险控制。两个人各做自己最擅长的事。3. 领域后训练的工程化路径一份可复用四步清单3.1 第一步先锁业务场景和评测基准很多人做后训练的第一个误区是急着找数据。事实上第一步应该先定义清楚你希望模型在哪些场景下做什么事做到什么程度才算合格。比如法律场景可以先列出最常用的 10 类任务合同风险识别、判例检索摘要、诉讼材料整理、法律咨询回复、文书草拟、条款对比、争议焦点归纳、法条溯源、合规审查、客户问答。每个任务都要给出明确的输入输出示例。然后基于这些任务建立评测集数量不需要很大但必须覆盖典型边界。评测集应该包含三部分正常样例、边界样例、错误样例。正常样例用来衡量基本能力边界样例用来测模型在模糊场景下的反应错误样例用来确保模型不会在关键信息上犯错。没有评测集就开始训练基本等于闭眼开车。3.2 第二步数据整理、清洗和配比后训练效果好不好数据质量通常比模型参数量更重要。原始数据不能直接灌给模型。需要先做清洗、去重、脱敏和格式统一。一个常见的数据准备流程是从律所知识库、合同模板、历史问答、公开裁判文书中收集材料去掉个人隐私和企业敏感信息把材料切分成合适的粒度由法律专家写出标准答案或修订模型输出再按任务类型配比。配比很关键。如果合同抽取任务在业务中占 60%训练数据里也应该大致保持这个比例否则模型会慢慢偏向数据更多的任务。我自己比较推荐的做法是先做一个小型种子集可能只有几百到一千条跑通端到端流程。确认训练、评估、部署链路都没问题再扩大到数万条。不要一上来就追求数据量大先确保数据格式和流程是稳定的。3.3 第三步训练、评估、回归数据准备好之后进入训练环节。第一步通常是拿一个很小的子集做一次短训练确认 loss 是否正常下降输出是否出现格式变化。然后再跑正式训练。训练过程中要关注几个具体现象模型是否出现灾难性遗忘也就是原来会的能力变差了是否出现过度拟合模型把训练数据背下来但泛化能力不足是否出现输出格式不稳定有时候符合要求有时候又回到通用模型风格。评估不是只看一次准确率。更建议的做法是每训练一轮就跑到评测集上对比前一轮结果。如果某类任务分数明显下降就要回看数据配比或者降低训练强度。性能回归是后训练里最容易被忽略的一环。这里可以给出一份训练配置示例具体参数要以实际底座和显存为准# 示例结构不来自官方文档 base_model: kimi-k3-backbone train_dataset: legal_sft_v1.jsonl eval_dataset: legal_eval_v1.jsonl sft: learning_rate: 1.0e-5 batch_size: 128 micro_batch_size: 4 max_length: 8192 epochs: 2 warmup_ratio: 0.03注意这个配置只是一个示例不是某个模型的官方推荐。真实环境中学习率、batch size、序列长度都要根据显存和任务复杂度调整。3.4 第四步部署、监控和迭代训练完成后模型需要被部署成可用的推理服务。这里的重点不是把模型加载起来就结束而是要做好版本管理和效果监控。落地时至少要考虑模型服务是否支持多版本并行以便灰度切换推理延迟是否满足业务要求尤其是交互式问答场景是否有权限隔离确保不同客户的数据不会被混淆是否有日志系统记录模型输入、输出和人工反馈。然后是把 badcase 回流。每一次人工纠错都是下一轮训练数据的来源。这个闭环如果建立不起来后训练的价值会随时间递减因为业务场景一直在变。步骤关键动作主要风险验收标准锁场景定义任务、建立评测集场景太杂无法测准10 类任务各有 20 条以上评测样本备数据清洗、去重、脱敏、配比数据泄漏/标准混乱训练集与评测集无重叠人工抽样合格率达标训练回归小规模验证、正式训练、回归灾难性遗忘/过拟合新任务达标旧任务分数不降部署迭代灰度、监控、日志、badcase 回流服务不稳定/无反馈通道线上成功率与人工满意率达到预设线4. 从通用对话到法律专业场景难点在哪4.1 低容错场景要求更高不是能读法条就行法律场景和通用对话最大的区别是容错率极低。通用助手的回答哪怕不够精确用户可能笑一笑就过去了但在法律场景里一份错误的合同摘要、一个遗漏的争议焦点可能直接影响决策和工作效率。这也是为什么“能读懂法条”远远不够。模型需要理解法律文书的层级结构、责任条款的构成要件、程序性事项的时间要求。它还应该知道什么情况下必须给出不确定性提示什么时候不适合直接给结论。这些规范很难靠通用知识自动生成必须通过后训练把规则注入。4.2 幻觉问题不能只靠模型克制还要靠工程约束几乎所有语言模型都会在事实不确定时一本正经地编造内容。后训练可以减少幻觉但很难完全消除。工程上通常需要叠加检索、引用、约束解码等手段。例如要求模型在输出法条时附上来源并要求来源必须来自给定材料或者要求模型在材料不完整时直接输出“无法判断”而不是猜测。这些行为可以通过后训练中的偏好数据来强化但推理阶段仍然需要链路约束来兜底。后训练负责“让模型更愿意遵守规范”工程链路负责“确保违反规范的结果不被展示”。4.3 数据合规与权限隔离是前置条件法律行业的数据比其他行业更敏感。做后训练之前数据来源是否合法、是否经过脱敏、是否有权使用这些问题必须在前置阶段解决。如果用了未经授权的客户数据或裁判文书训练出的模型即使效果很好也会埋下巨大风险。部署阶段还要考虑客户隔离。同一个模型服务如果被多家律所使用必须确保提示词、文档和检索结果不会跨客户串扰。这个要求听起来很基础但实际落地时经常被忽视。4.4 效果不理想时按什么顺序排查后训练模型上线后效果不理想不要急着调整训练参数。我建议按下面这个顺序排查先看评测任务和业务场景是否对齐。如果评测集和实际需求不一致结果没有意义。再看数据质量。有没有重复、格式不统一、答案错误、任务分布失衡。再看数据泄漏。训练集和评测集是否重叠有没有把测试答案学进去。再看训练配置。学习率是否太高训练轮次是否过长有没有过拟合或遗忘。最后看推理链路。输入截断、上下文长度、检索结果、后处理逻辑是否引入错误。其中数据问题导致的异常最多不要一上来就怀疑模型结构或者底座能力。5. Harvey Tenet 背后更大的趋势5.1 基础模型会变成底座行业模型会越来越多Harvey Tenet 出现之前行业里已经有大量公司在做类似的事情选一个基础模型用领域数据做后训练形成自己的专用模型。这条路之所以越来越常见是因为基础模型的通用能力已经基本够用而真正的差异化转移到数据、场景和交付规范。可以预见的是未来会出现明显的模型分层少数公司做大规模基础模型服务海量场景大量行业公司做后训练形成专业助手。基础模型是底座行业模型是应用。Harvey Tenet 是这种趋势在专业服务领域的一个具体案例。5.2 对普通开发者意味着什么对普通开发者来说这个趋势带来两个变化。第一不必再害怕“模型能力不够”因为可以拿一个成熟底座用领域数据把它变成自己的工具第二也不能再靠“接一个 API 套壳”建立壁垒因为底层模型大家都一样真正的壁垒在于你有没有高质量的数据闭环、稳定的评测体系和真实的用户反馈。如果你在一个垂直行业工作现在就可以开始积累几样东西任务清单、评测集、标注规范、badcase 池。这些东西可能比参数调优更值钱。后续即使没有足够的算力自己训练也可以借助云端的训练服务或托管环境来完成类似工作不一定需要本地维护整套训练集群。5.3 后训练的适用边界什么情况下不该做后训练听起来很美好但不是所有场景都适合。以下几种情况我更建议先不要急着做后训练任务相对简单用提示词加检索可以解决 90% 的场景。高质量领域数据很少或者只有资料没有标注结果。没有评测闭环无法判断模型改好还是改坏。预算有限租用训练资源会影响其他业务。业务需求变化太快模型训练跟不上需求迭代。在这些情况下先用提示词工程、RAG 和流程编排把产品跑起来积累数据后再考虑是否值得后训练。后训练是放大器不是起点。6. 如果我是准备跟进这件事的技术人我会怎么做6.1 先建立自己的评测集别盯着跑分看到 Harvey Tenet 这类新闻最容易出现的反应是去搜模型对比榜单。但我更建议回归到自己的场景先写下你要解决的 20 个真实任务请业务专家标注 50 到 100 条期望输出组成最小评测集。然后用现有通用模型和可能的替代模型各跑一遍记录差距。这一步不需要花钱训练就已经能建立基线。没有基线的后训练就是自嗨。6.2 选择基础模型时要看可训练性和生态如果你真的要启动一个后训练项目选择底座时要确认几个开放性问题有没有公开的训练代码或者训练接口许可证是否允许商用和二次训练生态里是否有成熟的微调、对齐和部署工具社区是否活跃遇到问题是否能找到解决方案。模型单点跑分只能作为参考不能作为唯一指标。6.3 从最小可复现的后训练实验开始最后控制投入。不要一开始就做十万条数据的完整训练可以先拿 500 条高质量数据做一次短训练直接看输出变化。目标不是立刻获得完美模型而是验证链路数据格式、训练脚本、资源开销、评测工具、部署方式。在这个过程中可以顺手沉淀一个内部模板把数据准备、训练配置、评测命令、部署步骤都写成可复用的脚本。等业务验证有价值之后再放大数据规模。即使最终决定不做后训练这套模板也能帮你更清楚地判断问题出在模型能力上还是出在业务链路里。回到开头那一则消息。Harvey Tenet 之所以值得关注不是因为它多了一个新模型的名字而是它再一次印证了大模型落地的关键路径通用底座负责能力后训练负责专业业务闭环负责迭代。基础模型之间还会继续竞争但对大多数人和公司来说真正要下的功夫不是再去刷一个榜单而是把数据、评测和反馈体系建好。模型会换代数据闭环不会后训练这件事会越来越像一门工程技术而不是实验室里的一次实验。