跳转到内容

RLHF 全流程

InstructGPT 确立的三阶段:监督微调、从人类偏好训练奖励模型、用 PPO 在 KL 约束下最大化奖励。本章给出每阶段的数据需求、目标函数与常见失败模式,以及 KL 惩罚作为”信任域”的角色。

  • KL 惩罚防止策略漂离参考模型(奖励黑客与语言退化)
  • 偏好数据的质量与一致性是上限
  • 整个流程是一个上下文老虎机而非长期 MDP