跳转到内容

奖励模型

奖励模型用 Bradley–Terry 模型从成对比较中学习标量奖励。本章讨论其表达能力限制(非传递偏好)、对分布外样本的过度自信、集成与不确定性估计,以及过程奖励模型(PRM)与结果奖励模型(ORM)的区别。

  • 奖励模型是被优化的对象,因此其错误会被放大(Goodhart)
  • PRM 对多步推理提供更密集的信号但标注昂贵
  • 奖励模型规模与策略规模的匹配