连续动作下 maxaQ(s,a)\max_a Q(s,a)maxaQ(s,a) 无法枚举。本章介绍 NAF、采样式最大化、以及为什么主流做法是转向 Actor-Critic(DDPG/TD3/SAC 用 actor 近似 argmax)。