跳转到内容

分布式 RL:C51、QR-DQN 与 IQN

Q(s,a)Q(s,a) 换成回报的分布 Z(s,a)Z(s,a),用分布 Bellman 算子更新。本章介绍分类表示(C51)、分位数表示(QR-DQN、IQN),解释为何学分布能改善表示学习并支持风险敏感决策。

  • 分布 Bellman 算子在 Wasserstein 距离下是压缩
  • 分位数回归避免了固定支撑集
  • 风险敏感策略可直接从分位数导出