Alignment(AI 对齐)

让AI系统的行为符合人类意图和价值观的研究方向。核心问题:预训练目标(预测下一个token)≠ 用户真实需求。RLHF是当前最主流的对齐技术路线。

Alignment(AI 对齐)

一句话理解

让 AI 做人类真正想要它做的事,而不只是它"被训练去做的事"。

为什么需要对齐

大语言模型的预训练目标是"预测下一个 token"——这是一个统计目标,不是一个价值目标。一个完美的预测器可能会:

  • 编造看似合理但完全错误的事实(幻觉)
  • 生成有害、歧视或违法的内容
  • 用冗长废话回应简单问题
  • 对需要拒绝的请求照做不误

这些行为在训练数据中都有大量样本,模型学会了"像人一样说话",但没学会"像好的助手一样回应"。

对齐的三个层次

  1. 有帮助(Helpful):回答准确、信息量大、格式清晰
  2. 无害(Harmless):拒绝有害请求、不输出偏见内容
  3. 诚实(Honest):不编造事实、对不确定的事情表达不确定

这就是 Anthropic 提出的 HHH 框架。

主流对齐方法

  • RLHF:用人类偏好反馈做强化学习,ChatGPT / GPT-4 的核心方法
  • DPO:跳过 Reward Model,直接用偏好数据优化,Claude / LLaMA 2 采用
  • Constitutional AI:Anthropic 提出,用 AI 自我批评代替部分人类标注

实际影响

调用大模型 API 时体验到的 system prompt 遵从性、安全拒绝行为、回答风格——这些全是对齐的产物。不同模型的对齐策略不同,直接影响 API 调用的行为差异和应用设计。

引用本术语的文章