跳转到内容

蒙特卡洛方法

不需要模型,用采样回报的平均估计 VVQQ。本章讨论首次访问与每次访问、on-policy 与 off-policy(重要性采样)的蒙特卡洛控制,以及方差问题。

  • 无偏但高方差,需要回合结束
  • 重要性采样的方差可能无界
  • 加权重要性采样以偏差换方差