元强化学习
元 RL 在任务分布上训练,使智能体能在新任务中用少量经验快速适应。本章比较基于梯度(MAML)、基于记忆/上下文(RL²、上下文学习)与基于任务推断(PEARL)的三类方法,并讨论大模型的上下文学习与元 RL 的关系。
- RL² 把适应过程本身变成 RNN 的前向传播
- 任务分布的设计决定元学习能否成立
- Transformer 的上下文学习是隐式元 RL
元 RL 在任务分布上训练,使智能体能在新任务中用少量经验快速适应。本章比较基于梯度(MAML)、基于记忆/上下文(RL²、上下文学习)与基于任务推断(PEARL)的三类方法,并讨论大模型的上下文学习与元 RL 的关系。