Few-shot / Zero-shot(少样本/零样本学习)
大模型无需微调,仅通过提示中的少量示例(Few-shot)或纯指令(Zero-shot)即可完成新任务的能力。GPT-3首次大规模展示了这种"涌现能力",是Scaling Law的关键验证。
Few-shot / Zero-shot(少样本/零样本学习)
一句话理解
不用重新训练模型,只在提示词里给几个例子(Few-shot)甚至不给例子(Zero-shot),模型就能完成新任务。
三种模式
Zero-shot(零样本)
只给指令,不给示例:
"把下面的英文翻译成中文:Hello world"
One-shot(单样本)
给一个示例:
"英文→中文示例:Good morning → 早上好。请翻译:Hello world"
Few-shot(少样本)
给几个示例(通常 3–5 个):
"Good morning → 早上好;Thank you → 谢谢;Hello world → ?"
为什么重要
GPT-3 的论文标题就叫"Language Models are Few-Shot Learners"。它首次在大规模上证明:模型大到一定程度后,无需微调就能通过提示完成各种任务。这种能力被称为"涌现能力"(Emergent Ability),是 Scaling Law 的关键验证——参数量跨过某个阈值后,模型突然"学会"了 few-shot 推理。
与 In-context Learning 的关系
Few-shot 学习的本质是 In-context Learning(上下文学习):模型并没有更新参数,而是在推理时利用提示中的上下文来"临时学会"新任务的模式。这种能力的机制仍在研究中,但主流假说认为它与 Transformer 的注意力机制直接相关。
实际应用
编写 prompt 时的每一个示例,本质上就是在做 few-shot learning。示例的数量、顺序、格式都会影响模型输出质量——这也是 prompt engineering 的核心技巧之一。