跳转到内容

TRPO 与 PPO

策略更新过大会导致性能崩溃。TRPO 用 KL 约束的二阶方法保证单调改进;PPO 用裁剪的目标函数以一阶方法近似之。本章推导替代目标、解释裁剪的作用,并讨论 PPO 实际效果高度依赖实现细节这一事实。

  • PPO-clip 的目标:min(rtAt,clip(rt,1±ϵ)At)\min(r_t A_t, \mathrm{clip}(r_t, 1\pm\epsilon) A_t)
  • 优势归一化、价值裁剪、学习率退火等细节影响巨大
  • PPO 是 RLHF 的默认算法