跳转到内容

多臂老虎机

老虎机是探索问题的最纯净形式。本章介绍 ϵ\epsilon-greedy、UCB1、Thompson 采样及其遗憾界,上下文老虎机与推荐系统的联系,以及它作为 RLHF 中偏好学习基础的角色。

  • UCB 的遗憾为 O(logT)O(\log T)
  • Thompson 采样在实践中常优于 UCB
  • 上下文老虎机是推荐/广告的主力模型