PPO(近端策略优化)
OpenAI提出的强化学习算法,RLHF三阶段的最后一步。用Reward Model的评分作为奖励信号优化语言模型,同时用KL散度惩罚防止模型偏离预训练能力太远。
PPO(近端策略优化)
一句话理解
一种"小步快跑"的强化学习算法——每次只允许策略做有限幅度的更新,保证训练稳定。
什么是 PPO
PPO(Proximal Policy Optimization)是 OpenAI 于 2017 年提出的强化学习算法,因为实现简单、训练稳定而成为 RLHF 中最常用的优化方法。
核心思想是限制每次策略更新的幅度:如果新策略和旧策略差异太大,就裁剪掉过大的更新。这避免了传统策略梯度方法中"一步走太远导致崩溃"的问题。
在 RLHF 中的角色
PPO 是 RLHF 三阶段的最后一步:
- SFT 教会模型对话格式
- Reward Model 学会评估回答质量
- PPO 用 RM 的评分当奖励,优化模型的回答策略
在这个过程中,KL 散度惩罚作为"缰绳"约束模型不能偏离 SFT 阶段学到的能力太远——否则模型可能为了讨好 RM 而产生流利但无意义的回答。
为什么不直接用梯度下降
因为 RLHF 的奖励信号(RM 评分)不是可微分的标签,不能直接用交叉熵损失反向传播。强化学习框架让模型通过"试错-反馈"循环来优化不可微分的目标。
引用本术语的文章