跳转到内容

第九卷 · RL 与大语言模型

RLHF 让 RL 成为大模型时代最重要的后训练技术。本卷从偏好数据讲到推理模型的可验证奖励训练,重点是”哪些经典 RL 结论在这里仍然成立、哪些被改写了”。

  • 第一部分 · RLHF:RLHF 全流程、奖励模型、PPO for LLM。
  • 第二部分 · PPO 之后:DPO 与无奖励模型方法、GRPO 与可验证奖励:推理模型的训练、奖励黑客与对齐税。

第四卷第一部分;语言模型基础。