Next Token Prediction
Next Token Prediction 是现代大语言模型的核心训练范式:给定前面的所有 token,预测下一个最可能的 token。GPT 系列的全部能力都源于这一简单目标。
Next Token Prediction
直觉理解
有人跟你说:"床前明月___",你几乎不假思索就能接出"光"。这就是 Next Token Prediction 的本质:根据已有的上下文,预测接下来最可能出现的内容。
大语言模型的所有能力——写作、翻译、推理、编程——都建立在这同一个训练目标上。
形式化定义
给定一个 token 序列 x1,x2,…,xt−1,模型的目标是最大化下一个 token xt 的条件概率:
P(xt∣x1,x2,…,xt−1)对于整个训练语料,优化目标是最大化所有位置的对数似然之和:
L=t=1∑TlogP(xt∣x1,…,xt−1;θ)其中 θ 是模型参数。
为什么这个目标有效
一个常见的疑问是:只是预测下一个词,怎么就能产生"智能"?
关键在于,要准确预测下一个 token,模型必须隐式地学会:
| 要预测的场景 | 模型需要学会的能力 |
|---|---|
| "The capital of France is ___" | 事实知识 |
| "他很高兴,因为他 ___" | 因果推理 |
| "def fibonacci(n): ___" | 编程逻辑 |
| "1, 1, 2, 3, 5, ___" | 模式识别 |
| "Translate to French: 'hello' → ___" | 跨语言映射 |
预测下一个 token 是表面目标,但达到高准确率所需的内部表示,涵盖了语法、语义、逻辑、世界知识等多个维度。
训练过程
在 Transformer 架构中,Next Token Prediction 的训练非常高效:
输入: [The] [cat] [sat] [on] [the]
目标: [cat] [sat] [on] [the] [mat]
通过 Causal Mask(因果掩码),模型在预测每个位置时只能看到该位置之前的 token,不能"偷看"后面的答案。这意味着一个训练样本可以同时产生 T 个预测任务,训练效率极高。
生成过程
训练好的模型通过自回归(Autoregressive)方式生成文本:
x1predictx2predictx3predict⋯每一步:
- 将已生成的所有 token 输入模型
- 获取下一个 token 的概率分布(Logits → Softmax)
- 从分布中采样一个 token(受 Temperature、Top-k、Top-p 控制)
- 将新 token 追加到序列,重复上述过程
直到生成结束标记 <EOS> 或达到最大长度。
与其他训练范式的对比
| 范式 | 代表模型 | 预测目标 | 特点 |
|---|---|---|---|
| Next Token Prediction (CLM) | GPT 系列 | 下一个 token | 天然适合文本生成 |
| Masked Language Modeling (MLM) | BERT | 被遮盖的 token | 双向上下文,适合理解任务 |
| Sequence-to-Sequence | T5, BART | 目标序列 | 适合翻译、摘要等转换任务 |
GPT 路线的成功证明了一个反直觉的结论:单一的、看似简单的训练目标,在足够大的数据和模型规模下,可以涌现出通用的语言能力。
小结
Next Token Prediction 是当前 AI 最重要的训练范式之一。它的优雅之处在于:不需要人工标注、不需要任务特定的设计,只需要大量文本和一个朴素的目标——预测下一个词。剩下的,交给规模。
引用本术语的文章