DPO(直接偏好优化)

跳过Reward Model阶段,直接用人类偏好数据优化语言模型的对齐方法。相比RLHF的三阶段流程更简洁稳定,Claude和LLaMA 2等模型采用了DPO或其变体。

DPO(直接偏好优化)

一句话理解

把 RLHF 的三步简化成一步——不需要单独训练 Reward Model,直接用偏好数据优化语言模型。

与 RLHF 的区别

RLHF 需要三个阶段:SFT → 训练 Reward Model → PPO 优化。其中 Reward Model 的训练和 PPO 的稳定性调优都很复杂。

DPO 的核心洞察是:Reward Model 的最优解可以用数学推导直接表示为策略模型本身的函数。这意味着不需要单独训练一个 RM,只需要一个分类损失函数就能直接从偏好数据中学习对齐。

优势

  • 流程简洁:去掉 RM 训练和 PPO 的复杂性,一步到位
  • 训练稳定:不依赖强化学习,避免 PPO 的超参数调优难题
  • 效果可比:在多个基准上与 RLHF 效果持平甚至更优

应用现状

Claude(Anthropic)和 LLaMA 2(Meta)等主流模型采用了 DPO 或其变体作为对齐训练方法。DPO 正在成为 RLHF 的主流替代方案。