跳转到内容

DPO 与无奖励模型方法

DPO 证明 KL 约束下的 RLHF 最优策略与奖励之间有闭式关系,从而可以直接用偏好数据做分类式训练,无需奖励模型与采样。本章推导 DPO,比较 IPO、KTO、SimPO 等变体,讨论其相对 PPO 的优劣与离线特性带来的问题。

  • DPO 是离线方法,受偏好数据分布限制
  • 在线 DPO / 迭代 DPO 部分弥补这一点
  • 简单性使其成为开源社区默认选择