奖励模型
奖励模型用 Bradley–Terry 模型从成对比较中学习标量奖励。本章讨论其表达能力限制(非传递偏好)、对分布外样本的过度自信、集成与不确定性估计,以及过程奖励模型(PRM)与结果奖励模型(ORM)的区别。
- 奖励模型是被优化的对象,因此其错误会被放大(Goodhart)
- PRM 对多步推理提供更密集的信号但标注昂贵
- 奖励模型规模与策略规模的匹配
奖励模型用 Bradley–Terry 模型从成对比较中学习标量奖励。本章讨论其表达能力限制(非传递偏好)、对分布外样本的过度自信、集成与不确定性估计,以及过程奖励模型(PRM)与结果奖励模型(ORM)的区别。