跳转到内容

Actor-Critic 与 GAE

用学到的 VV 替代蒙特卡洛回报,得到 Actor-Critic;广义优势估计(GAE)用 λ\lambda 在偏差与方差之间插值。本章讲 A2C/A3C 的同步/异步实现、GAE 的推导与 λ\lambdaγ\gamma 的选择。

  • GAE(λ) 是 TD(λ) 在优势估计上的对应物
  • λ≈0.95、γ≈0.99 是常见起点
  • 并行环境是 on-policy 方法样本效率的关键