跳转到内容

元强化学习

元 RL 在任务分布上训练,使智能体能在新任务中用少量经验快速适应。本章比较基于梯度(MAML)、基于记忆/上下文(RL²、上下文学习)与基于任务推断(PEARL)的三类方法,并讨论大模型的上下文学习与元 RL 的关系。

  • RL² 把适应过程本身变成 RNN 的前向传播
  • 任务分布的设计决定元学习能否成立
  • Transformer 的上下文学习是隐式元 RL