SFT(监督微调)

RLHF三阶段的第一步:用人工标注的高质量问答对微调预训练模型,教会模型"对话的格式和基本礼仪"。数据量不大(几千到几万条)但质量要求极高。

SFT(监督微调)

一句话理解

用精选的"标准答案"教会预训练模型如何像人一样对话。

什么是 SFT

预训练模型学会了语言的统计规律,但它不知道如何以对话格式回应用户。SFT 用人工标注的高质量问答对(instruction-response pairs)微调模型,让它学会:

  • 格式:收到问题后给出结构化回答,而不是继续补全文本
  • 风格:礼貌、简洁、有帮助
  • 拒绝:对有害请求说"不"

数据特点

SFT 的数据量相对较少(几千到几万条),但每条数据都由专业标注员精心编写。质量远比数量重要——一条高质量标注数据的价值超过一千条自动生成的数据。

在 RLHF 中的位置

SFT 是 RLHF 三阶段的第一步,为后续的 Reward Model 训练和 PPO 优化奠定基础。没有 SFT,模型连对话格式都不会,后面的强化学习无从谈起。

与 FLAN / Instruction Tuning 的关系

Google 的 FLAN 系列研究表明,在大量多样化任务上做指令微调可以显著提升模型的泛化能力。SFT 和 Instruction Tuning 在方法上一致,只是 SFT 通常特指 RLHF 流程中的第一步。