Next Token Prediction

Next Token Prediction 是现代大语言模型的核心训练范式:给定前面的所有 token,预测下一个最可能的 token。GPT 系列的全部能力都源于这一简单目标。

Next Token Prediction

直觉理解

有人跟你说:"床前明月___",你几乎不假思索就能接出"光"。这就是 Next Token Prediction 的本质:根据已有的上下文,预测接下来最可能出现的内容

大语言模型的所有能力——写作、翻译、推理、编程——都建立在这同一个训练目标上。

形式化定义

给定一个 token 序列 x1,x2,,xt1x_1, x_2, \ldots, x_{t-1}x1,x2,,xt1,模型的目标是最大化下一个 token xtx_txt 的条件概率:

P(xtx1,x2,,xt1)P(x_t | x_1, x_2, \ldots, x_{t-1})P(xtx1,x2,,xt1)

对于整个训练语料,优化目标是最大化所有位置的对数似然之和:

L=t=1TlogP(xtx1,,xt1;θ)\mathcal{L} = \sum_{t=1}^{T} \log P(x_t | x_1, \ldots, x_{t-1}; \theta)L=t=1TlogP(xtx1,,xt1;θ)

其中 θ\thetaθ 是模型参数。

为什么这个目标有效

一个常见的疑问是:只是预测下一个词,怎么就能产生"智能"?

关键在于,要准确预测下一个 token,模型必须隐式地学会:

要预测的场景模型需要学会的能力
"The capital of France is ___"事实知识
"他很高兴,因为他 ___"因果推理
"def fibonacci(n): ___"编程逻辑
"1, 1, 2, 3, 5, ___"模式识别
"Translate to French: 'hello' → ___"跨语言映射

预测下一个 token 是表面目标,但达到高准确率所需的内部表示,涵盖了语法、语义、逻辑、世界知识等多个维度。

训练过程

在 Transformer 架构中,Next Token Prediction 的训练非常高效:

text
输入:  [The] [cat] [sat] [on]  [the]
目标:  [cat] [sat] [on]  [the] [mat]

通过 Causal Mask(因果掩码),模型在预测每个位置时只能看到该位置之前的 token,不能"偷看"后面的答案。这意味着一个训练样本可以同时产生 T 个预测任务,训练效率极高。

生成过程

训练好的模型通过自回归(Autoregressive)方式生成文本:

x1predictx2predictx3predictx_1 \xrightarrow{\text{predict}} x_2 \xrightarrow{\text{predict}} x_3 \xrightarrow{\text{predict}} \cdotsx1predictx2predictx3predict

每一步:

  1. 将已生成的所有 token 输入模型
  2. 获取下一个 token 的概率分布(Logits → Softmax)
  3. 从分布中采样一个 token(受 Temperature、Top-k、Top-p 控制)
  4. 将新 token 追加到序列,重复上述过程

直到生成结束标记 <EOS> 或达到最大长度。

与其他训练范式的对比

范式代表模型预测目标特点
Next Token Prediction (CLM)GPT 系列下一个 token天然适合文本生成
Masked Language Modeling (MLM)BERT被遮盖的 token双向上下文,适合理解任务
Sequence-to-SequenceT5, BART目标序列适合翻译、摘要等转换任务

GPT 路线的成功证明了一个反直觉的结论:单一的、看似简单的训练目标,在足够大的数据和模型规模下,可以涌现出通用的语言能力

小结

Next Token Prediction 是当前 AI 最重要的训练范式之一。它的优雅之处在于:不需要人工标注、不需要任务特定的设计,只需要大量文本和一个朴素的目标——预测下一个词。剩下的,交给规模。

引用本术语的文章