GRPO 与可验证奖励:推理模型的训练
对数学、代码等可自动验证的任务,用规则奖励替代奖励模型;GRPO 去掉价值网络,用同一提示下多次采样的组内相对优势作为基线。本章讲 GRPO 的目标函数、与 REINFORCE 基线方法的关系、长思维链的涌现,以及 DAPO 等后续改进。
- 组内归一化优势 = 每个提示自己的基线
- 可验证奖励绕过了奖励黑客的主要来源
- 训练长度增长与”aha moment”的争议
对数学、代码等可自动验证的任务,用规则奖励替代奖励模型;GRPO 去掉价值网络,用同一提示下多次采样的组内相对优势作为基线。本章讲 GRPO 的目标函数、与 REINFORCE 基线方法的关系、长思维链的涌现,以及 DAPO 等后续改进。