RLHF(人类反馈强化学习)

通过人类偏好反馈训练AI的三阶段方法:SFT教格式、Reward Model建裁判、PPO优化策略。ChatGPT的核心训练方法,让1.3B参数的InstructGPT在人类评估中碾压175B的GPT-3。

RLHF(人类反馈强化学习)

一句话理解

用人类的"喜好"当奖励信号,训练模型学会"怎样回答人类才满意"。

核心问题

预训练语言模型的优化目标是"预测下一个 token",但这不等于"给出对用户有帮助的回答"。一个完美的 next-token 预测器可能会输出有害内容、编造事实、或用冗长废话回应简单问题——因为这些在训练数据中都有大量样本。

RLHF 的本质就是在预训练之后,用人类的偏好判断重新校准模型的行为

三阶段流程

第一阶段:SFT(监督微调)

用人工标注的高质量问答数据微调预训练模型,教会它"对话的基本格式和礼仪"。这一步的数据量不大(几千到几万条),但质量要求极高。

第二阶段:Reward Model(奖励模型)

让标注员对同一个问题的多个回答(通常 4–9 个)进行排序,训练一个"裁判模型"来预测人类的偏好。用排序而非绝对评分,是因为人与人之间的评分标准差异大,但排序的一致性高。

第三阶段:PPO(近端策略优化)

用 Reward Model 的评分作为奖励信号,通过强化学习优化语言模型。同时用 KL 散度惩罚作为"缰绳"——防止模型为了讨好裁判而偏离预训练学到的语言能力。

为什么重要

InstructGPT(1.3B 参数)通过 RLHF 在人类评估中打败了 GPT-3(175B 参数)——参数量差 135 倍,但对齐后的小模型反而更受用户欢迎。这证明了"怎么教"和"教多大"一样重要。

实际影响

调用大模型 API 时感受到的 system prompt 遵从性、temperature 控制、安全拒绝、模型"人格"——这些都是 RLHF 的产物。理解 RLHF,就理解了为什么不同模型的 API 行为差异那么大。