DDPG、TD3 与 SAC
DDPG 把 DQN 推广到连续动作:actor 输出确定性动作,critic 评估。TD3 用双 critic、延迟更新、目标平滑修复高估;SAC 引入最大熵目标获得更稳的探索与鲁棒性。本章比较三者并给出 SAC 成为默认选择的原因。
- TD3 的三个技巧各自针对一个失败模式
- SAC 的温度参数自动调节
- 离线数据复用是这族方法样本效率高的原因
DDPG 把 DQN 推广到连续动作:actor 输出确定性动作,critic 评估。TD3 用双 critic、延迟更新、目标平滑修复高估;SAC 引入最大熵目标获得更稳的探索与鲁棒性。本章比较三者并给出 SAC 成为默认选择的原因。