RLHF、InstructGPT 与 DPO:大模型对齐训练全面解析

发布时间:2026/9/24 8:24:54
RLHF、InstructGPT 与 DPO:大模型对齐训练全面解析
本文系统讲解大模型对齐训练的核心方法RLHF基于人类反馈的强化学习、InstructGPT 的三步对齐流程以及DPO直接偏好优化。从原理、步骤、优缺点到实践细节一篇讲透。一、什么是 RLHFRLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习是一种让语言模型对齐人类偏好的训练方法。核心思想把「人类偏好」变成「奖励分数」再用强化学习让模型最大化这个分数。为什么需要 RLHF预训练模型只会「续写」不会「按指令回答」SFT 能让模型「会回答」但不知道「什么是好回答」RLHF 让模型学会「人类喜欢什么样的回答」二、RLHF 的三个核心步骤步骤 1SFT 训练Supervised Fine-Tuning定义基于一个已经训练好的模型用人工标注的输入输出对去训练它。目标提升特定任务如问答、摘要的准确性。本质是延续语言建模的目标。优势训练稳定实现简单万级样本即可见效劣势无法感知人类偏好对安全、伦理问题缺乏建模能力步骤 2RM 训练Reward Model定义收集排序数据训练奖励模型。步骤选择问题用 SFT 为每个 prompt 生成多个输出将输出从最佳到最差排序得到一个新的标签数据集用新的标签数据集训练 RM 模型关键细节每个 prompt 生成多个 output而不是两个——多个结果的标注难度低于两个RM 输出连续分数训练目标是让「好回答」的分数 「差回答」的分数本质是pairwise ranking loss-log σ(r(好) - r(差))步骤 3PPO 强化学习定义使用 RM 奖励模型去优化 SFT 模型。做法继续微调 SFT 模型每次生成的答案放进 RM 打分优化 SFT 的参数使其获得更高的分数关键点RM 在此阶段不再更新只使用来自 API 的真实 prompt通常加KL 惩罚防止模型过度优化 RM、跑偏三、InstructGPT 对齐训练InstructGPT是 OpenAI 用 RLHF 训练出的对齐模型是 ChatGPT 的前身。三步走步骤名称数据目标1SFT人工标注问题和答案对从只会续写变成会按指令回答2RM人工排序数据学会给人类喜欢的回答打高分3PPORM 作为奖励函数生成的答案在 RM 上得高分步骤 1SFT三类演示数据类型做法目的Plain标注员提 prompt给答案形成多样化 promptFew-shot标注员提 prompt给多个示例答案形成多样化答案User-basedAPI 申请用例改写 人工答案贴近真实用户需求作用让模型初始化获得先验知识知道 prompt 和 answer 的标准形式。步骤 2RM做法SFT 为每个 prompt 生成多个 output人工排序训练 RMRM 功能对符合人类价值观的回答给高分。步骤 3PPO做法用 RM 当奖励函数用 PPO 优化 SFT 模型让模型生成的回答在 RM 上得高分关键RM 不更新加 KL 惩罚防跑偏可迭代模型变强后重训 RM四、奖励模型需要和基础模型一致吗结论不需要一致取决于任务复杂度和优化目标。情况奖励模型和基础模型适用场景单任务可以共享参数简单、省资源多任务各自独立为每个子任务定义奖励模型复杂任务加权整合一句话单任务可共享多任务需独立取决于任务。五、RLHF 在实践中的 5 个不足不足核心影响① 代价高昂人工反馈需大量人力时间限制可扩展性② 主观性不同专家标准不一致反馈有差异③ 延迟稀疏人类无法实时监控每一步训练效率低④ 错误反馈人也会标错模型学坏⑤ 探索不足过度依赖人类反馈不敢探索新策略记忆口诀「贵、偏、慢、错、懒」六、DPO直接偏好优化定义DPODirect Preference Optimization直接偏好优化将 RLHF 的两阶段RM PPO转化为一阶段直接利用偏好数据优化策略。核心思想将偏好学习转化为一个分类问题通过损失函数直接让「优胜回答」的概率高于「失败回答」从而绕过奖励模型和复杂的强化学习。对比 RLHF维度RLHFDPO阶段两阶段RM PPO一阶段是否需要 RM✅ 需要❌ 不需要是否需要 RL✅ 需要 PPO❌ 不需要训练稳定性较难调更稳定计算成本高低效果强接近甚至更好DPO 的优势简化流程跳过 RM 训练和 PPO 调参训练稳定本质是分类任务比 RL 稳定计算高效不需要采样、不需要 RM 前向效果接近 RLHF多篇论文验证DPO 的局限依赖高质量的偏好数据对分布外数据泛化可能弱某些复杂任务上不如 RLHF七、RLHF vs DPO演进脉络预训练模型 ↓ SFT学会按指令回答 ↓ ┌──────────────────────────────┐ │ RLHF │ │ ├─ RM训练奖励模型 │ │ └─ PPO强化学习优化 │ └──────────────────────────────┘ ↓ DPO直接偏好优化跳过 RM 和 PPO ↓ RLAIF用 AI 反馈替代人类反馈核心趋势RLHF效果强但复杂、贵DPO简化流程效果接近RLAIF用 AI 替代人类进一步降本八、一句话总结方法核心特点RLHF人类反馈 强化学习三步走效果强但复杂InstructGPTRLHF 的落地实践SFT → RM → PPODPO直接偏好优化一阶段跳过 RM 和 PPO核心逻辑把「人类偏好」变成「奖励分数」再用强化学习让模型最大化这个分数。一句话RLHF 让模型从「能说话」变成「说人话」DPO 把 RLHF 的两阶段简化为一阶段更稳定、更高效。对齐训练是大模型从「可用」到「好用」的关键一步。