Transformer

2017年由Google提出的神经网络架构,完全基于注意力机制,抛弃了RNN的循环结构。凭借并行计算能力和对长距离依赖的高效建模,成为GPT、BERT等所有现代大语言模型的基础架构。

Transformer

一句话理解

Transformer 是一种完全基于注意力机制的神经网络架构——它让序列中的每个元素都能直接"看到"所有其他元素,不需要像 RNN 那样逐步传递信息。

为什么需要 Transformer

2017 年之前,处理序列数据(文本、语音等)的主流架构是 RNN/LSTM。它们有两个致命瓶颈:

  1. 顺序处理:token 必须一个接一个处理,无法并行,训练极慢
  2. 长距离遗忘:句子越长,早期信息越容易在传递过程中衰减

Transformer 的核心创新是完全抛弃循环结构,用 Self-Attention 让任意两个 token 之间的距离变成 O(1),同时天然支持并行计算。

核心组件

组件职责
Self-Attention让每个 token "看到"所有其他 token,计算关注度权重
Multi-Head Attention多组注意力并行,捕捉不同维度的关系
FFN(前馈网络)对每个 token 独立做非线性变换,负责"信息加工"
位置编码注入位置信息,弥补注意力机制的顺序无关性
残差连接 + LayerNorm保持梯度稳定,支持深层堆叠

架构分化

原始 Transformer 是 Encoder-Decoder 结构(用于机器翻译),后来分化为:

  • Encoder-only(BERT)→ 擅长理解任务(分类、问答)
  • Decoder-only(GPT 系列)→ 擅长生成任务(对话、写作)
  • Encoder-Decoder(T5、BART)→ 兼顾理解和生成

现代大语言模型(GPT-4、Claude、LLaMA)几乎都采用 Decoder-only 架构。

影响

Transformer 不仅统一了 NLP,还扩展到了计算机视觉(ViT)、语音(Whisper)、蛋白质结构预测(AlphaFold 2)等领域,成为深度学习的通用骨架

论文:Vaswani et al., "Attention Is All You Need", 2017

引用本术语的文章