ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

从Barret Zoph跳槽看AI对齐研究:大模型竞赛进入后训练时代

从Barret Zoph跳槽看AI对齐研究:大模型竞赛进入后训练时代 一位 AI 研究者的工作变动为什么能成为整个技术圈持续关注的话题2024 年下半年Barret Zoph 从 OpenAI 离职的消息传出时很多人第一反应是惊讶——毕竟他深度参与了 GPT-4o 这样影响力极大的模型训练工作。而随后消息确认他加入了 Google 出任研究副总裁讨论焦点迅速从“为什么走”变成了“这件事说明了什么”。我的判断是Barret Zoph 的去向本身不是新闻真正值得关注的是它折射出 AI 研究的主导权正在发生转移。过去几年掌握算力和数据的机构掌握话语权接下来几年谁能解决“模型怎么训得更可靠、更可信、更可控”谁就会定义下一代 AI 技术栈。而对齐研究正是这场转移的枢纽。这篇文章不打算做八卦式复盘而是从这个事件切入讲清楚三件事Barret Zoph 在 OpenAI 期间做了什么为什么他的研究方向正在成为行业焦点以及作为普通开发者与大模型使用者我们能从这次人才流动中看到哪些确定的技术趋势。1. Barret Zoph 是谁一位技术负责人更是一位“对齐派”代表Barret Zoph 在 AI 研究社区并不是一个陌生的名字但他与一些高频出镜的研究明星不同更多时候是以“幕后关键人物”的身份存在于技术体系之中。他拥有卡内基梅隆大学博士学位研究方向横跨强化学习、神经网络架构搜索与自然语言处理。早期工作里他和同事在自动化机器学习、架构搜索等领域做过大量探索这些积累为后来进入大模型训练一线打下了基础。在 OpenAI 期间Barret Zoph 担任副总裁级别的研究职位负责的方向覆盖模型后训练、强化学习与超级对齐等关键环节。这里需要解释一个背景很多关注 ChatGPT 的用户只知道 GPT 系列参数越来越大、能力越来越强却未必清楚——真正决定模型“乖不乖”“稳不稳”“听不听话”的并不是预训练阶段而是预训练之后的后训练阶段。Barret Zoph 的工作重心恰好就在这个阶段。他在 OpenAI 内部深度参与了 GPT-4o 等模型的训练与部署尤其是 RLHF 之后的强化学习环节优化。GPT-4o 发布后OpenAI 官方系统卡中提到了他们使用的训练方法里包含 RPOReinforced Preference Optimization强化偏好优化这项方法正是与 Barret Zoph 紧密相关的技术成果之一。从公众视角看Barret Zoph 可能没有 Sam Altman 或 Ilya Sutskever 那样高的知名度但从研究工作本身来看他代表了 OpenAI 内部非常核心的一批人不负责对外发声不生产口号负责把“模型如何被训练成安全、有用、可控”这件事真正落地。理解这一点才能理解为什么 Google 会以研究副总裁的身份将他纳入团队。2. 从 OpenAI 到 Google一次高端人才流动的信号意义顶级研究者的流动在 AI 行业并不罕见但这一次受人关注有两个特殊原因。第一Barret Zoph 离开的不是普通岗位而是 OpenAI 模型后训练与对齐方向的关键技术负责岗位。他前脚离开后脚 OpenAI 在很长一段时间内都在调整自己的对齐研究架构。这不是个案而是一连串人事变动中的一环。对齐研究人才在 2024 年呈现出明显的流动趋势OpenAI、Anthropic、Google DeepMind 之间互相“换血”本质上都指向同一个问题对齐研究正在成为大模型竞争的下一个主战场。第二Google 的加入让这件事有了更清晰的战略含义。Google 并不是没有对齐研究能力DeepMind 在 AI 安全、红队测试、模型评估方面一直有深厚积累。但“研究副总裁”这个岗位级别说明 Google 不只是要一个能发论文的研究员而是要一位能搭团队、定方向、带项目的技术领袖。换句话说Google 在通过引进关键人才的方式强化自己在大模型可信度、可控性和后训练优化上的整体能力。这背后有一个现实的竞争焦虑今天大模型产品的能力边界越来越接近单靠参数规模已经很难拉开绝对差距谁能把模型调教得更稳、更好用、更安全谁才能真正获得用户信任。从行业信号的角度看这次流动释放出一个明确判断大模型竞赛正在从“预训练军备竞赛”切换到“后训练工程质量竞赛”。过去大家比的是谁先训练出千亿参数模型现在比的是谁能把这些模型变成可靠的产品。这种变化对普通开发者的直接影响是未来选择模型时不能只看参数规模和基准分数还要关注模型背后的对齐策略、训练方法和安全措施。一个“分数高但容易失控”的模型在真实业务中带来的风险远超收益。3. 对齐研究为什么一个副总裁的去向会与安全绑定很多人听到“AI 对齐”会觉得这是一个偏学术、偏伦理的话题离工程实践很远。但实际情况恰恰相反对齐研究已经渗透到大模型产品开发的每一个环节。先给一个通俗定义AI 对齐指的是让模型的行为目标与人类意图保持一致。以大模型为例预训练阶段模型学会的是“文本接龙”它知道词与词之间的统计规律但并不知道哪些回答是用户真正想要的更不知道哪些回答会造成伤害。对齐要做的事就是在预训练之后把模型从“什么都敢说”调教成“有用、诚实、无害”。目前主流的对齐方法可以归为三大类。第一类是 RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习。它通过训练一个奖励模型来模拟人类偏好再用强化学习让模型学会输出更符合偏好的内容。GPT-4 时代的技术路线中RLHF 是核心支撑。第二类是直接偏好优化代表方法是 DPODirect Preference Optimization。DPO 的思路更经济它跳过了显式奖励模型直接利用人类偏好数据优化策略训练成本比 RLHF 低很多在小规模团队和开源模型中被广泛使用。第三类是一系列混合改进方案RPO 就是其中之一。RPO 的思路是把强化学习的稳定性与偏好优化的效率结合起来在训练目标中引入 KL 散度约束避免模型在优化过程中偏离原始能力太远。对齐研究的工程价值是实打实的。一个没有做对齐的模型可能在公开基准测试上表现很好但一到真实对话场景就出现逻辑混乱、言行不一致、被提示词注入攻击后轻易“越狱”等问题。这些问题不是学术圈自娱自乐而是任何做大模型应用落地的团队都会遇到的真实故障。对齐研究的重要性上升意味着模型安全不再只是“合规部门的事”而是与模型性能深度绑定的技术能力。Barret Zoph 这样的人才流向哪里本质上就是在为这种技术能力投票。4. RPO 技术拆解一次值得复盘的训练方法升级如果说 RLHF 是 GPT 时代对齐方案的地基那么 RPO 更像是在地基之上做出的一次重要结构优化。它不追求推倒重来而是试图解决 RLHF 在实际工程中的痛点。RLHF 的经典流程分三步用人类偏好数据训练奖励模型用奖励模型给生成结果打分再用强化学习算法如 PPO更新策略模型。这套方法效果稳定但成本很高。奖励模型训练需要大量标注数据强化学习阶段对超参数极其敏感训练过程容易出现奖励黑客reward hacking现象——模型为了拿高分找到奖励模型的漏洞而不是真正提升回答质量。DPO 简化了流程不再训练奖励模型直接从偏好对中构造目标函数。因为流程短、资源消耗低它在开源社区被广泛接受。但 DPO 也有局限它对数据质量极度敏感离线优化的方式也让它难以应对分布变化。RPO 的思路可以理解为“取两者所长”它保留强化学习的在线采样优势又结合偏好优化的直接监督信号同时在优化目标中加入 KL 正则项让模型在每一步更新时都不会偏离参考策略太远。为了便于理解下面给出一段概念性的伪代码用来展示 RPO 训练思路的核心框架# 概念性伪代码用于理解 RPO 的训练框架 # 不代表 OpenAI 实际训练代码 import torch import torch.nn.functional as F def compute_rpo_loss( policy_logprobs, ref_logprobs, reward_scores, chosen_logprobs, rejected_logprobs, beta0.1, kl_coeff0.05 ): # 1. 偏好优化损失让 chosen 的概率高于 rejected log_ratio_chosen chosen_logprobs - ref_logprobs log_ratio_rejected rejected_logprobs - ref_logprobs preference_loss -F.logsigmoid( beta * (log_ratio_chosen - log_ratio_rejected) ) # 2. KL 正则约束策略与参考模型的分布距离 kl_loss F.kl_div( policy_logprobs.log_softmax(dim-1), ref_logprobs.softmax(dim-1), reductionbatchmean ) # 3. 奖励信号可选的在线采样打分 reward_loss -torch.mean(reward_scores) return preference_loss kl_coeff * kl_loss 0.1 * reward_loss这段代码只是为了说明 RPO 的三段式目标偏好约束、KL 距离约束、奖励信号约束。它们共同作用让模型既学会人类偏好又不至于在反复迭代中“学偏”。RPO 在 GPT-4o 这类产品上的意义可以从结果反推相比早期 GPT-4GPT-4o 在对话一致性、语气稳定性和安全边界上的表现明显更好。这套能力不全是预训练模型的功劳更多来自后训练阶段的对齐策略优化。对普通研究者和工程师来说RPO 最大的启发不是某个具体公式而是“对齐训练是可以工程化优化的”。它不是一个黑盒而是可以用清晰目标函数、完善数据管道、严格评测流程来持续改进的工程系统。5. 大模型研究格局变化从“能跑起来”到“能用得住”把 Barret Zoph 的职业路径放在更长的时间轴里看会看到一个更宏观的变化大模型行业的人才结构正在从“预训练人才主导”转向“后训练与对齐人才吃香”。预训练主导的阶段核心竞争要素是算力、数据、模型架构和分布式训练工程能力。那几年顶尖人才都在研究怎么扩大 batch size、怎么优化 MoE 结构、怎么把训练稳定性做到万卡级别。这套能力到今天依然重要但它已经变成一种基础设施能力不再构成差异化优势。几乎所有头部团队都能预训练一个“能力差不多”的底座模型。真正的差距出现在预训练之后。同一个底座模型用不同的后训练策略最终产品体验可能天差地别。有的模型在公开评测里分数很高实际对话却逻辑混乱有的模型能严格遵守复杂指令却因为过度安全而显得笨拙。这些差异很大程度取决于后训练阶段的数据配比、对齐算法和评测方案。这意味着行业的重心正在从“能跑起来”转向“能用得住”。所谓“用得住”至少要满足三件事第一可靠。模型不能时而聪明时而愚蠢回答质量需要保持稳定。这在客服、教育、医疗等严肃场景中至关重要。第二可控。模型需要理解并遵守复杂的系统级约束比如拒绝回答某些问题、在不确定时承认不知道、按照固定格式输出内容。第三可评估。模型的每次更新都要有可靠的评测机制来判断是变好了还是变坏了而不是凭感觉发布新版本。Barret Zoph 的研究背景几乎完美匹配这三个方向。他既懂强化学习这类底层技术又有大规模产品级模型的实操经验还深度参与过 GPT-4o 从训练到部署的全流程。Google 引入这样的人目标显然不只是发论文而是要在 Gemini 这类产品上建立更强、更可靠的后训练体系。对开源社区和中小开发团队来说这个趋势同样重要。过去大家关注的是“开源模型的排行榜”未来更要关注“这些模型是否好对齐”。与其拿着一个能力很强但很难驯服的开源模型不如选择一个也许分数稍低、但行为稳定、容易微调对齐的模型。6. 对普通开发者和研究者的启示顶尖人才流动的背后往往藏着行业未来几年的技术路线图。对于不在一线大厂工作的普通开发者和研究者至少可以得到下面几个实用启示。第一把对齐能力纳入模型选型标准。以前评估大模型主要看 MMLU、HumanEval 等基准分数现在应该增加一维评估视角这个模型在对抗性测试下表现如何它对复杂指令的遵循能力怎么样它的安全机制会不会误伤正常请求一个对齐做得好的模型即使基准分数略低长期使用的综合成本往往更小。第二认真对待后训练技术的学习。很多工程师对 RLHF、DPO、RPO 这些概念停留在“听过名字”的层面甚至觉得这些是算法研究员才需要关心的事。但趋势已经很明显应用层做模型微调、模型改造的团队越来越需要理解后训练技术才能在数据准备、训练参数选择、效果评估上做出正确判断。第三重视评测体系建设。对齐不是一次性工作而是一个持续迭代的过程。模型每次更新都需要有可靠的评测集来检测它在安全性、指令遵循、幻觉控制、越狱防御等维度的表现。建议团队在项目早期就建立自己的评测基线不要依赖公开榜单。第四关注强化学习与大模型结合的交叉方向。目前这个领域的人才缺口非常大懂强化学习又懂大模型训练的工程师更是稀缺。如果正在规划技能方向这条路径值得投入。可以尝试从一个小任务开始实践选择一个开源模型准备一组包含“安全拒绝”和“正常回答”的偏好数据用 DPO 或类 RPO 方法做一次小规模对齐训练再对比对齐前后的回答质量差异。这个过程跑通之后对后训练技术的理解会比读十篇文章都深刻。7. 常见的误读与判断误区每次行业动向出现都伴随着大量误读。关于 Barret Zoph 的去向以及对齐研究本身有几个典型误区需要澄清。第一个误读对齐研究只是为了“安全合规”。实际上对齐优化的直接收益是模型可用性和产品体验的提升。一个能正确拒绝不当请求、不会在用户诱导下“翻车”的模型本身就是更好的产品。安全与性能不是对立关系而是共生关系。第二个误读RPO 会全面取代 RLHF。从实际技术生态看替代不会发生得那么快。RLHF 的流程更成熟工业界跑通过无数次且不同方法在不同场景下各有优势。更可能出现的局面是多种方法并行甚至组合使用而不是某一种方法通吃全局。第三个误读顶级研究员离职意味着某家公司“不行了”。这种判断没有依据。OpenAI 仍是目前模型能力与工程化水平最高的机构之一Google 本身也有深厚的研究积累。人才流动更合理的解读是各家都在加码对齐研究导致这个方向的人才市场供不应求。第四个误读对齐研究是大厂的事与小团队无关。实际上任何把大模型接入业务系统的团队都会遇到对齐问题。客服系统需要限制模型不要乱承诺内容产品需要防止模型生成不当内容知识库问答需要让模型严格引用来源。这些都是对齐问题只是规模不同。第五个误读对齐研究会导致模型能力变弱。如果对齐做得好不会显著牺牲能力反而会通过约束噪声、聚焦目标让模型在关键场景表现更稳定。真正弱化能力的是不合格的对齐比如过度安全让模型变得保守愚钝或者数据质量低下让模型“学歪”。把这些误读放在一起看会发现它们背后有一个共同根源把对齐理解成一个“事后修补”环节而不是“模型训练的一部分”。事实上对齐在今天已经与模型能力深度耦合脱离了训练方案去谈模型效果很难得到准确的判断。8. 总结AI 研究的主导权正在转移Barret Zoph 离开 OpenAI 加入 Google表面上是又一起大厂人才争夺战更深层的含义是AI 研究的主导权正在从“谁算力强”转向“谁更懂怎么让模型变得可靠可控”。预训练军备竞赛的天花板正在显现。堆更多 GPU、用更多数据带来的边际收益逐渐递减而优化后训练流程、改进对齐策略、提升模型可控性还有大量的工程红利可挖。这一点从头部公司争相布局对齐研究的人事动作里已经看得很清楚。对于普通技术从业者这里有一个值得记住的判断大模型的能力差距会越来越大体现在“工程细节”上而不是“架构创新”上。谁能把对齐数据做好把评测体系建好把 RLHF/DPO/RPO 这类技术用在刀刃上谁就能在真实业务里把模型的潜力释放到最大。建议收藏这条思路并把它放进你的模型选型和工程规划里。未来半年到一年你会看到越来越多与对齐相关的新方法、新论文、新产品出现而理解这些变化背后的逻辑会比追逐每一个新名词有价值得多。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进