第四卷 · 策略梯度与 Actor-Critic
直接对策略参数求梯度,是深度 RL 中应用最广的一族方法,也是 RLHF 的基础。本卷从策略梯度定理出发,一路推到 PPO 与 SAC。
- 第一部分 · On-policy 方法:策略梯度定理与 REINFORCE、Actor-Critic 与 GAE、TRPO 与 PPO。
- 第二部分 · 连续控制:DDPG、TD3 与 SAC、策略梯度的理论问题。
第一卷;第三卷第一部分。
直接对策略参数求梯度,是深度 RL 中应用最广的一族方法,也是 RLHF 的基础。本卷从策略梯度定理出发,一路推到 PPO 与 SAC。
第一卷;第三卷第一部分。