跳转到内容

目标条件 RL 与 HER

目标条件策略 π(as,g)\pi(a|s,g) 用一个网络解决一族任务;事后经验回放(HER)把未达成目标的轨迹重新标注为达成了实际到达的状态,把稀疏奖励变稠密。本章讲 HER 的实现与目标采样策略,以及目标条件价值函数与距离学习的联系。

  • HER 是稀疏奖励机械臂任务的标准解法
  • 目标表示(状态/图像/语言)决定泛化
  • 与第六卷目标导向探索衔接