跳转到内容

库与框架对比

单文件实现(CleanRL)适合学习与研究,Stable-Baselines3 适合可靠基线,RLlib 适合大规模分布式,TorchRL 提供可组合原语;LLM 后训练有 TRL、OpenRLHF、veRL 等。本章给出选型建议与各自的坑。

  • 单文件实现最容易对照论文核对细节
  • LLM 后训练框架的核心是多模型的显存与调度
  • 不同库的默认超参差异导致结果不可比