跳转到内容

PPO for LLM

把生成视为每个 token 一步的 MDP,奖励只在序列末尾给出并加上逐 token 的 KL 惩罚。本章讲价值网络的初始化、优势估计、四个模型(策略/参考/奖励/价值)的显存压力,以及实现细节对结果的巨大影响。

  • 稀疏的末端奖励 + 逐 token KL 是标准构造
  • 价值网络通常从奖励模型初始化
  • 四模型并存使 RLHF 的基础设施成本远高于 SFT