尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Barret Zoph加盟Google:RLHF工程化经验重塑大模型对齐竞争

Barret Zoph加盟Google:RLHF工程化经验重塑大模型对齐竞争 先说结论这轮人事变动比多数人想象的更值得关注。Barret Zoph 离开 OpenAI 后加入 Google出任研究副总裁。表面上是又一位 AI 高管跳槽实际上是把“RLHF 工程化的核心经验”从 OpenAI 搬到了 Google 研究体系。如果你关注大模型后训练、对齐技术、人才流动对模型能力的影响这篇文章适合直接读完。Barret Zoph 这个名字在普通用户里可能不如 OpenAI 的 CEO 或首席科学家出名但在从事大模型训练、微调、对齐工作的技术圈子里他是绕不开的关键人物。公开履历显示他早期在 Google Brain 做过研究后来加入 OpenAI长期参与 ChatGPT 背后的对齐工作尤其是 RLHF从人类反馈中强化学习Reinforcement Learning from Human Feedback方向。这次回到 Google 体系等于给 Google 的对齐研究团队补充了一位既有学术能力、又有实战经验的负责人。这篇文章会围绕五个角度展开第一他的技术履历到底做了什么第二RLHF 和可扩展监督这条技术主线为什么重要第三他加入 Google 后可能带来什么变化第四这轮人才流动对整个行业意味着什么第五普通开发者和研究者接下来应该关注什么、学习什么。全程不做情绪化判断只从技术路径和团队格局出发帮你理清信息。1. 核心事件速览信息项说明人物Barret Zoph原职位OpenAI 研究副总裁Research VP新职位Google 研究副总裁Research VP公开技术标签RLHF、可扩展监督、ChatGPT 对齐工程技术主线神经架构搜索NAS→ RLHF → 可扩展监督行业信号大模型竞争重点从预训练转移到后训练与对齐关键履历节点Google Brain 研究/实习 → OpenAI 对齐团队 → 回归 Google 研究体系对普通开发者的意义“后训练 对齐”是当前最值得投入的技术方向这里要说明一点具体的组织归属Google DeepMind 还是 Google Research、汇报关系、团队规模目前应以官方公告为准。公开报道只明确了他离开 OpenAI 后加入 Google出任研究副总裁。因此本文对团队影响的分析属于基于公开信息和技术趋势的合理判断而不是内部消息。2. Barret Zoph 的技术履历与关键成就2.1 从神经架构搜索到强化学习Barret 早期的研究工作有一个明显主线把强化学习用于模型结构的自动搜索。公开资料显示他在 Google Brain 阶段与 Quoc Le 等人合作参与了基于强化学习的神经架构搜索NAS方向。这个方向的目标不是手工设计网络结构而是让算法自动搜索出性能更好的网络结构。现在大家熟悉的 AutoML 概念很大程度上就是沿着这一路线发展起来的。这段经历虽然发生在深度学习早期但能看出他对强化学习一直有长期积累。后来他在 OpenAI 的工作重心转向 RLHF本质上仍然是强化学习在语言模型上的应用。换句话说他的技术路径不是临时转向而是从“用强化学习找网络结构”自然过渡到“用强化学习对齐模型行为”。2.2 ChatGPT 背后的 RLHF 工程Barret 真正在行业里产生大影响是在 OpenAI 期间参与推动 RLHF 的工程化。ChatGPT 之所以从“会续写的语言模型”变成“能听懂指令、按指令执行的助手”核心不是预训练部分而是后训练部分先做监督微调SFT再训练奖励模型Reward Model最后用强化学习PPO微调策略模型。在早期这条管线远没有现在这么成熟。奖励模型怎么训练、PPO 在语言模型上如何稳定运行、人类偏好数据怎么采集、数据质量怎么控制这些都是需要反复实验和推敲的工程问题。公开报道显示Barret 在 OpenAI 期间承担了相当一部分对齐研究领导工作。InstructGPT 论文是这条路线的重要里程碑ChatGPT 的对齐能力正是在此基础上放大的。从技术贡献看他属于把“RLHF 从论文变成产品”的关键参与者之一。2.3 可扩展监督与 OpenAI 对齐团队变动2023 年 OpenAI 成立超级对齐团队后陆续有核心成员离开。Ilya Sutskever、Jan Leike 先后从 OpenAI 离开公开报道显示 Jan Leike 离开后Barret Zoph 在可扩展监督方向接过了更多研究领导职责。可扩展监督要解决的核心问题是当模型能力越来越强人类越来越难评估模型输出是否正确时如何用 AI 辅助的方式继续保证模型行为安全、可控。从 OpenAI 对齐团队的变动看Barret 的离开意味着 OpenAI 在“既懂 RLHF 工程又懂对齐研究”的领导者名单上又少了一位关键人物。而 Google 正好在 Gemini 系列模型的后训练阶段需要这类经验因此这轮跳槽在逻辑上很合理。3. 为什么这次跳槽值得关注3.1 从“老东家”回到 Google 研究体系Barret 的履历里有 Google Brain 阶段的研究经历这次加入 Google 更像是回归。值得注意的是2023 年 Google Brain 与 DeepMind 合并后Google 的 AI 研究力量高度集中。一个既熟悉 Google 研究文化、又在 OpenAI 积累了后训练实战经验的人回到 Google 体系后能够很快融入并发挥作用。对于 Google 来说这比从外部招一个没有大厂对齐工程经验的研究者要高效得多。因为后训练管线非常依赖工程细节数据怎么清洗、奖励模型怎么防过拟合、PPO 怎么调参、上线后怎么持续收集用户反馈。这些经验很难从论文里学到只能靠实际做过。3.2 OpenAI 对齐人才持续流失近两年OpenAI 流失的研究核心并不少。Ilya Sutskever 是预训练和深度学习方向的标志性人物Jan Leike 是对齐研究的代表性人物Mira Murati 也在 2024 年离开。现在 Barret Zoph 再离开OpenAI 的对齐研究团队在人才厚度上的压力会更明显。当然OpenAI 依然有很强的研究资源、算力储备和产品渠道不能因为几个人离开就否定整个团队。但从人才梯队看连续流失顶尖研究者之后OpenAI 需要尽快在内部培养出新的对齐方向领军人物否则在长期研究积累上会落后于 Google DeepMind、Anthropic 这些对手。3.3 对齐研究已经成为大模型“军备竞赛”的一部分过去行业比拼的重点是“谁的模型参数多、谁的数据质量高、谁的算力强”。现在这些当然仍然重要但模型能力到一定程度后用户体感差异越来越取决于后训练做得好不好指令跟随是否稳定、回答是否有帮助、是否拒绝危险请求、是否符合人类偏好。RLHF 只是这条赛道的起点后面还有可扩展监督、过程奖励模型、宪法 AI、DPO、GRPO、测试时计算等大量方向。Google 引入一名在 RLHF 和对齐方向有实际工程经验的研究副总裁不能只看成一次普通招聘而是在押注“后训练是下一个核心竞争力”。这个判断和 Anthropic、OpenAI、Meta 近两年的研究投入方向是一致的。4. RLHF 与可扩展监督他的技术主线4.1 RLHF 到底解决什么问题预训练语言模型的目标是“根据上文预测下一个词”所以模型只会续写不一定会回答用户问题。为了让模型具备“助手感”需要后训练阶段告诉模型什么是好回答什么是坏回答。RLHF 做的就是这件事核心流程可以用下面这段伪代码理解# RLHF 后训练管线示意非可执行代码 # 1. 监督微调 SFT # 收集人工编写的“指令-回答”样本让模型学会基础问答格式 # 2. 训练奖励模型 RM # 对同一问题收集多个回答让标注员排序用排序结果训练打分模型 # 3. 强化学习 PPO # 让策略模型在奖励模型的打分下迭代优化同时加 KL 约束避免输出偏离原始分布这段流程里最容易出问题的不是“跑起来”而是“稳定地跑好”。奖励模型过拟合、PPO 训练发散、数据偏好分布不均衡都会让最终模型出现“谄媚”“复读”“拒绝回答”等行为问题。Barret 在 OpenAI 期间参与推动的正是把这条流程在产品级模型上稳定落地。这也是他加入 Google 后最容易被直接复用的经验。4.2 可扩展监督为什么是下一步RLHF 虽然有效但有一个明显瓶颈它依赖人类对模型输出的判断。当模型能力低于人类时人类能可靠地评估回答质量当模型能力接近甚至超过人类时人类判断的准确性会下降。比如面对一个专家级医疗问题或复杂代码问题普通标注员很难分辨模型是否在编造答案。可扩展监督的思路是让 AI 系统辅助人类完成监督用一个强度稍弱的模型帮助检查强模型的输出或者把复杂任务拆成多个可验证的子任务再让人对子任务做评估。Barret 在 OpenAI 期间参与的可扩展对齐方向就是要解决“人类如何监督比自己更聪明的模型”这个问题。这个方向目前还远未成熟但 Google DeepMind 和 OpenAI 都在投入大量资源。他加入 Google 后大概率还会继续沿着这条线推进因为 Google 对安全对齐的研究投入一直在增加。5. Google 研究体系加入后可能带来的变化5.1 Google 当前的后训练格局Google DeepMind 的 Gemini 系列模型在后训练阶段大量使用 RLHF 和基于 AI 反馈的强化学习RLAIF。Google 也有自己的对齐研究团队并且开源了 Gemma 系列模型方便社区做微调和后训练实验。Barret 加入后最直接的变化可能是把 OpenAI 时代积累的一整套“人类偏好数据 → 奖励模型 → 强化学习微调”的经验带入 Google 的模型生产线。对开发者来说一个可观察的信号是 Gemma 新版本或 Gemini 后续版本的“指令跟随能力”是否明显提升。如果后训练管线得到强化模型在长对话、复杂指令、格式化输出等场景下的表现会更稳定。5.2 对 Gemini 和开源生态的影响Google 一直有“研究开放”的传统很多技术成果会以论文或开源模型的形式对外公开。如果 Barret 的对齐方法在 Google 内部走通后续可能会体现在论文和开源模型中。这对社区是一件好事OpenAI 的很多后训练细节并不公开而 Google 相对更愿意通过论文和 Gemma 系列把方法分享出来。需要注意这条判断存在不确定性。因为研究副总裁的具体职责范围要等官方组织架构公布后才能确认。更稳妥的看法是他的加入会强化 Google 在后训练和对齐方向的人才密度但具体能带来多大的产品变化要看团队协作和公司战略。5.3 需要观察的信号要判断这次跳槽是否真正影响技术走向可以关注几个指标Google 是否发表更多 RLHF 可扩展监督方向的新论文Gemma 新版本是否出现新的对齐方法Barret 是否在公开场合介绍新的对齐思路Google 是否加大对人类偏好数据体系的建设。如果这些信号在半年内密集出现说明他已经在研究体系内发挥作用。6. 对 AI 人才流动与行业竞争的影响6.1 顶尖研究人才进入“旋转门”AI 领域的研究人才流动已经常态化。Google、OpenAI、Anthropic、Meta 之间的互相流动越来越频繁原因很简单大模型竞争已经变成算力、数据、算法、人才四线并行而人才是唯一能把这些资源串起来的因素。一个熟悉后训练管线的研究者换一个平台后能把前一个平台的方法论带过来减少新团队的探索成本。这也解释了为什么各家公司都在用高薪、算力资源、研究自由度来留住顶尖研究员。单纯给钱已经不够顶尖研究者更在意“能不能继续做前沿问题”和“手里的算力够不够规模实验”。6.2 OpenAI 的“人才压力”与 Google 的“补强”OpenAI 过去两年经历的核心人才流失公开报道已经覆盖了很多案例。虽然 OpenAI 仍然有很强的产品势能和算力资源但研究团队深度确实是需要考虑的问题。后训练是一个极度依赖团队连续积累的领域团队核心成员频繁更换容易影响经验传承和管线迭代节奏。Google 这边则明显在补强。DeepMind 本身就有很强的研究传统加上 Barret 这样有 OpenAI 实战经验的人研究团队的“后训练方法论”会更加完整。如果把视野放大到整个 AI 行业这轮流动会让“对齐”这件事从合规压力变成技术竞争点谁能把对齐做得又好又便宜谁就能更快迭代产品。6.3 对创业公司和开源社区的影响顶尖人才流向大厂也会间接影响创业公司和开源社区。原因是大厂研究者跳槽后往往会把一些非核心但有用的工程经验通过论文或开源工具释放出来。比如后训练框架、奖励模型训练技巧、数据组织规范这些一旦公开小团队就能快速复用行业整体水平会上升。反过来如果这些经验始终锁在大厂内部开源社区和后发团队只能自己摸索迭代速度会慢很多。因此Barret 加入 Google 后一个值得期待的副产品是Google 在后训练对齐领域的研究产出可能增加最终惠及到使用开源模型的开发者。7. 对开发者和研究者的参考价值7.1 技术方向后训练比预训练更值得投入对普通开发者来说这轮人事变动最大的参考价值不是“谁去了哪家公司”而是“技术重点正在向后训练转移”。预训练大模型越来越像基础设施再训练一个 GPT-4 级别的模型需要极高的成本这不符合大多数团队的条件。但后训练完全不同在开源基座模型上做指令微调、奖励模型训练、RLHF 或 DPO成本低得多并且和业务直接挂钩。如果你正在规划技术方向后训练、评估、对齐这三个关键词比“继续卷模型规模”更值得关注。原因很简单每家公司都需要让通用模型变成好用的业务模型这个环节需要大量工程人才。7.2 可以立刻开始的学习路径复现一个指令微调流程理解 SFT 数据格式和训练参数。训练一个小规模奖励模型用开源偏好数据跑通排序打分流程。在一个小模型上跑 DPO 或 GRPO体验不依赖奖励模型的偏好优化方法。阅读 InstructGPT 论文、Constitutional AI、DPO 论文对比不同对齐思路。关注 Gemma 等开源模型的后训练配置理解基座模型和助手的差别。动手建立一组评估集覆盖格式、事实性、安全性、多轮对话用来量化后训练效果。下面给出一个信息订阅清单可以直接作为参考# 建议订阅信息源按优先级 # 1. arxiv.org 论文检索RLHF / scalable alignment / post-training # 2. Google DeepMind 官方博客与论文开放页 # 3. OpenAI 官方博客与研究发布页 # 4. 开源模型发布说明Gemma、Llama、Qwen 的后训练报告 # 5. Barret 本人公开账号和技术演讲7.3 工程能力比追新闻更重要很多开发者容易陷入一种误区紧跟人才流动新闻却不花时间理解背后的技术。实际上Barret 离开 OpenAI 加入 Google对绝大多数人的日常工作不会产生直接影响。真正有影响的是后训练这件事本身越来越重要。与其讨论他会在 Google 做什么不如先把 RLHF、DPO、奖励模型评估这些基础能力练熟。后训练项目最常见的失败原因包括偏好数据质量差、奖励模型过拟合、训练超参不合适、评估集过于简单。这些问题只有亲手跑过才会真正理解。下一次当你看到“某团队新提出一种对齐方法”的新闻时如果已经亲自动手做过后训练你就能快速判断它和现有方法的差异在哪里而不是停留在概念层面。8. 后续观察点与信息来源8.1 值得持续跟踪的信号Google 发布的论文中是否出现新的后训练对齐方法。Gemini 或 Gemma 新版本的指令跟随能力是否有明显提升。OpenAI 是否调整对齐团队的组织架构以及是否有人接替他原来的职责。Barret 本人是否在公开场合发表关于可扩展监督的技术观点。Google 是否加大对人类偏好数据采集和后训练基础设施的投入。这些信号如果出现说明这次人事变动已经转化为实际产出。如果没有出现那说明他目前更多是参与管理和方向制定短期内不会直接改变产品线。8.2 如何避免被碎片信息误导关于顶尖人才流动网络上往往会出现两极化解读一边是“某公司要完了”另一边是“某公司要统治行业了”。这些都是过度简化。一个研究者的离开或加入只会影响长期技术积累的方向和速度不会在几周内改变模型能力。判断真相的方法只有一个看后续的技术产出而不是看新闻标题。官方博客、论文、开源模型发布说明是优先级最高的信息源。社交平台上的“内幕爆料”只能作为线索不能作为决策依据。如果某个消息没有对应的论文或官方公告支撑应该谨慎对待。9. 总结与下一步这次人事变动最值得关注的点不是“Barret Zoph 离开 OpenAI”本身而是他所在的领域——后训练与对齐正在成为大模型竞争的核心战场。OpenAI 在 RLHF 工程化上积累了明显的先发优势现在这个经验正随着核心研究者的流动被带到 Google 研究体系未来可能影响 Gemini 系列模型的迭代速度和对齐质量。建议第一步先验证一件事去读一遍 InstructGPT 论文再把 RLHF 流程中的 SFT、RM、RL 三个环节分别跑通。哪怕只在小模型上实验也比记住十个人事新闻有用。最容易踩的坑是忽视偏好数据质量把注意力全部放在模型架构和训练参数上。数据分布一旦偏了后续所有优化都会失真。后续可以继续观察的方向包括 Google 是否加速后训练对齐论文的发布、Gemini 的指令跟随能力是否提升、OpenAI 是否重新补强对齐团队。对普通开发者和研究者来说把后训练和对齐技术栈学扎实比赌任何一家公司的未来都更稳妥。这次人事变动可以看作一个提醒大模型技术竞争已经从“谁的底座更强”进入了“谁的后训练做得更好”的阶段。
返回列表