跳转到内容

DDPG、TD3 与 SAC

DDPG 把 DQN 推广到连续动作:actor 输出确定性动作,critic 评估。TD3 用双 critic、延迟更新、目标平滑修复高估;SAC 引入最大熵目标获得更稳的探索与鲁棒性。本章比较三者并给出 SAC 成为默认选择的原因。

  • TD3 的三个技巧各自针对一个失败模式
  • SAC 的温度参数自动调节
  • 离线数据复用是这族方法样本效率高的原因