TRPO 与 PPO
策略更新过大会导致性能崩溃。TRPO 用 KL 约束的二阶方法保证单调改进;PPO 用裁剪的目标函数以一阶方法近似之。本章推导替代目标、解释裁剪的作用,并讨论 PPO 实际效果高度依赖实现细节这一事实。
- PPO-clip 的目标:
- 优势归一化、价值裁剪、学习率退火等细节影响巨大
- PPO 是 RLHF 的默认算法
策略更新过大会导致性能崩溃。TRPO 用 KL 约束的二阶方法保证单调改进;PPO 用裁剪的目标函数以一阶方法近似之。本章推导替代目标、解释裁剪的作用,并讨论 PPO 实际效果高度依赖实现细节这一事实。