RLHF(人类反馈强化学习)
通过人类偏好反馈训练AI的三阶段方法:SFT教格式、Reward Model建裁判、PPO优化策略。ChatGPT的核心训练方法,让1.3B参数的InstructGPT在人类评估中碾压175B的GPT-3。
RLHF(人类反馈强化学习)
一句话理解
用人类的"喜好"当奖励信号,训练模型学会"怎样回答人类才满意"。
核心问题
预训练语言模型的优化目标是"预测下一个 token",但这不等于"给出对用户有帮助的回答"。一个完美的 next-token 预测器可能会输出有害内容、编造事实、或用冗长废话回应简单问题——因为这些在训练数据中都有大量样本。
RLHF 的本质就是在预训练之后,用人类的偏好判断重新校准模型的行为。
三阶段流程
第一阶段:SFT(监督微调)
用人工标注的高质量问答数据微调预训练模型,教会它"对话的基本格式和礼仪"。这一步的数据量不大(几千到几万条),但质量要求极高。
第二阶段:Reward Model(奖励模型)
让标注员对同一个问题的多个回答(通常 4–9 个)进行排序,训练一个"裁判模型"来预测人类的偏好。用排序而非绝对评分,是因为人与人之间的评分标准差异大,但排序的一致性高。
第三阶段:PPO(近端策略优化)
用 Reward Model 的评分作为奖励信号,通过强化学习优化语言模型。同时用 KL 散度惩罚作为"缰绳"——防止模型为了讨好裁判而偏离预训练学到的语言能力。
为什么重要
InstructGPT(1.3B 参数)通过 RLHF 在人类评估中打败了 GPT-3(175B 参数)——参数量差 135 倍,但对齐后的小模型反而更受用户欢迎。这证明了"怎么教"和"教多大"一样重要。
实际影响
调用大模型 API 时感受到的 system prompt 遵从性、temperature 控制、安全拒绝、模型"人格"——这些都是 RLHF 的产物。理解 RLHF,就理解了为什么不同模型的 API 行为差异那么大。