跳转到内容

策略迭代与值迭代

策略迭代交替进行策略评估与贪心改进;值迭代直接迭代 Bellman 最优算子。本章给出两者的收敛性、复杂度,以及广义策略迭代(GPI)这一统一视角。

  • 策略迭代步数少但每步贵,值迭代反之
  • GPI:评估与改进交替进行、不必做到收敛
  • 异步 DP 与优先级扫描