跳转到内容

连续动作空间的值方法

连续动作下 maxaQ(s,a)\max_a Q(s,a) 无法枚举。本章介绍 NAF、采样式最大化、以及为什么主流做法是转向 Actor-Critic(DDPG/TD3/SAC 用 actor 近似 argmax)。

  • 值方法在连续控制中几乎总是配一个 actor
  • 离散化动作空间在低维时可行
  • 第四卷连续控制部分承接本章