SFT(监督微调)
RLHF三阶段的第一步:用人工标注的高质量问答对微调预训练模型,教会模型"对话的格式和基本礼仪"。数据量不大(几千到几万条)但质量要求极高。
SFT(监督微调)
一句话理解
用精选的"标准答案"教会预训练模型如何像人一样对话。
什么是 SFT
预训练模型学会了语言的统计规律,但它不知道如何以对话格式回应用户。SFT 用人工标注的高质量问答对(instruction-response pairs)微调模型,让它学会:
- 格式:收到问题后给出结构化回答,而不是继续补全文本
- 风格:礼貌、简洁、有帮助
- 拒绝:对有害请求说"不"
数据特点
SFT 的数据量相对较少(几千到几万条),但每条数据都由专业标注员精心编写。质量远比数量重要——一条高质量标注数据的价值超过一千条自动生成的数据。
在 RLHF 中的位置
SFT 是 RLHF 三阶段的第一步,为后续的 Reward Model 训练和 PPO 优化奠定基础。没有 SFT,模型连对话格式都不会,后面的强化学习无从谈起。
与 FLAN / Instruction Tuning 的关系
Google 的 FLAN 系列研究表明,在大量多样化任务上做指令微调可以显著提升模型的泛化能力。SFT 和 Instruction Tuning 在方法上一致,只是 SFT 通常特指 RLHF 流程中的第一步。