分布式 RL:C51、QR-DQN 与 IQN
把 换成回报的分布 ,用分布 Bellman 算子更新。本章介绍分类表示(C51)、分位数表示(QR-DQN、IQN),解释为何学分布能改善表示学习并支持风险敏感决策。
- 分布 Bellman 算子在 Wasserstein 距离下是压缩
- 分位数回归避免了固定支撑集
- 风险敏感策略可直接从分位数导出
把 换成回报的分布 ,用分布 Bellman 算子更新。本章介绍分类表示(C51)、分位数表示(QR-DQN、IQN),解释为何学分布能改善表示学习并支持风险敏感决策。