对齐税(Alignment Tax)

同一模型经过对齐训练(RLHF/DPO)后,在标准 NLP 基准测试上出现的性能回退。本质是对齐优化了"行为模式"(听话、安全),但可能以牺牲部分原始能力为代价。InstructGPT 论文提出 PPO-ptx 混合训练来缓解此问题。

对齐税(Alignment Tax)

一句话理解

让模型"听话"是有代价的——对齐训练在改善行为的同时,可能让模型在某些原始能力基准上变差。

精确定义

对齐税指的是同一模型在经过对齐训练(RLHF、DPO 等)后,在标准 NLP 基准测试(如闭卷问答、阅读理解、翻译等)上出现的性能下降。

关键区分:

  • 是对齐税:175B GPT-3 做完 RLHF 后,在某些 NLP 基准上分数下降 → 对齐训练导致的回退
  • 不是对齐税:1.3B InstructGPT 在知识任务上输给 175B GPT-3 → 这是参数规模差异,不做对齐也会输

为什么会有对齐税

对齐训练(特别是 RLHF 的 PPO 阶段)会修改模型的权重分布,使其偏向"人类偏好的输出风格"。这种修改可能与预训练阶段学到的某些能力产生冲突:

  • 模型学会了"拒绝回答"→ 在某些基准测试中拒绝本应回答的问题
  • 模型学会了"简洁回答"→ 在需要详细展开的任务上丢分
  • PPO 优化过程中的 KL 散度约束如果不够强,模型可能"遗忘"部分预训练能力

缓解方案:PPO-ptx

InstructGPT 论文(Ouyang et al. 2022)提出了 PPO-ptx(PPO + pretraining mix):在 PPO 优化的同时混入一部分预训练数据的梯度更新,防止模型在对齐过程中偏离预训练能力太远。

实验结果表明,PPO-ptx 在保持对齐效果的同时,显著减少了在 NLP 基准上的性能回退。

现实意义

对齐税提醒我们:对齐不是免费的午餐。每一次对齐训练都是在"行为改善"和"原始能力保留"之间做权衡。这也是为什么各模型厂商持续迭代对齐方法——目标是在提升安全性和有用性的同时,把对齐税降到最低。