跳转到内容

DQN 及其改进

DQN 用经验回放打破样本相关、用目标网络稳定自举目标。本章逐一讲解 Double DQN(高估)、Dueling(价值/优势分解)、优先经验回放、n-step、Noisy Nets,以及 Rainbow 的消融结论。

  • 经验回放让 Q-learning 成为 off-policy 的必要条件
  • max 操作导致系统性高估,Double DQN 解耦选择与评估
  • Rainbow 消融:优先回放与 n-step 贡献最大