向量化环境与分布式采样
on-policy 方法靠并行环境获得样本,off-policy 方法靠分布式 actor 填充回放缓冲。本章讲向量化环境的同步/异步实现、IMPALA 的 V-trace 修正策略滞后、Ape-X 的分布式优先回放,以及 SEED RL 的集中推理架构。
- V-trace 让 off-policy 数据可用于 on-policy 算法
- 采样与学习的比例(replay ratio)是关键超参
- Ray RLlib 等框架封装了这些架构
on-policy 方法靠并行环境获得样本,off-policy 方法靠分布式 actor 填充回放缓冲。本章讲向量化环境的同步/异步实现、IMPALA 的 V-trace 修正策略滞后、Ape-X 的分布式优先回放,以及 SEED RL 的集中推理架构。