Alignment(AI 对齐)
让AI系统的行为符合人类意图和价值观的研究方向。核心问题:预训练目标(预测下一个token)≠ 用户真实需求。RLHF是当前最主流的对齐技术路线。
Alignment(AI 对齐)
一句话理解
让 AI 做人类真正想要它做的事,而不只是它"被训练去做的事"。
为什么需要对齐
大语言模型的预训练目标是"预测下一个 token"——这是一个统计目标,不是一个价值目标。一个完美的预测器可能会:
- 编造看似合理但完全错误的事实(幻觉)
- 生成有害、歧视或违法的内容
- 用冗长废话回应简单问题
- 对需要拒绝的请求照做不误
这些行为在训练数据中都有大量样本,模型学会了"像人一样说话",但没学会"像好的助手一样回应"。
对齐的三个层次
- 有帮助(Helpful):回答准确、信息量大、格式清晰
- 无害(Harmless):拒绝有害请求、不输出偏见内容
- 诚实(Honest):不编造事实、对不确定的事情表达不确定
这就是 Anthropic 提出的 HHH 框架。
主流对齐方法
- RLHF:用人类偏好反馈做强化学习,ChatGPT / GPT-4 的核心方法
- DPO:跳过 Reward Model,直接用偏好数据优化,Claude / LLaMA 2 采用
- Constitutional AI:Anthropic 提出,用 AI 自我批评代替部分人类标注
实际影响
调用大模型 API 时体验到的 system prompt 遵从性、安全拒绝行为、回答风格——这些全是对齐的产物。不同模型的对齐策略不同,直接影响 API 调用的行为差异和应用设计。
引用本术语的文章