Actor-Critic 与 GAE
用学到的 替代蒙特卡洛回报,得到 Actor-Critic;广义优势估计(GAE)用 在偏差与方差之间插值。本章讲 A2C/A3C 的同步/异步实现、GAE 的推导与 、 的选择。
- GAE(λ) 是 TD(λ) 在优势估计上的对应物
- λ≈0.95、γ≈0.99 是常见起点
- 并行环境是 on-policy 方法样本效率的关键
用学到的 替代蒙特卡洛回报,得到 Actor-Critic;广义优势估计(GAE)用 在偏差与方差之间插值。本章讲 A2C/A3C 的同步/异步实现、GAE 的推导与 、 的选择。