Transformer
2017年由Google提出的神经网络架构,完全基于注意力机制,抛弃了RNN的循环结构。凭借并行计算能力和对长距离依赖的高效建模,成为GPT、BERT等所有现代大语言模型的基础架构。
Transformer
一句话理解
Transformer 是一种完全基于注意力机制的神经网络架构——它让序列中的每个元素都能直接"看到"所有其他元素,不需要像 RNN 那样逐步传递信息。
为什么需要 Transformer
2017 年之前,处理序列数据(文本、语音等)的主流架构是 RNN/LSTM。它们有两个致命瓶颈:
- 顺序处理:token 必须一个接一个处理,无法并行,训练极慢
- 长距离遗忘:句子越长,早期信息越容易在传递过程中衰减
Transformer 的核心创新是完全抛弃循环结构,用 Self-Attention 让任意两个 token 之间的距离变成 O(1),同时天然支持并行计算。
核心组件
| 组件 | 职责 |
|---|---|
| Self-Attention | 让每个 token "看到"所有其他 token,计算关注度权重 |
| Multi-Head Attention | 多组注意力并行,捕捉不同维度的关系 |
| FFN(前馈网络) | 对每个 token 独立做非线性变换,负责"信息加工" |
| 位置编码 | 注入位置信息,弥补注意力机制的顺序无关性 |
| 残差连接 + LayerNorm | 保持梯度稳定,支持深层堆叠 |
架构分化
原始 Transformer 是 Encoder-Decoder 结构(用于机器翻译),后来分化为:
- Encoder-only(BERT)→ 擅长理解任务(分类、问答)
- Decoder-only(GPT 系列)→ 擅长生成任务(对话、写作)
- Encoder-Decoder(T5、BART)→ 兼顾理解和生成
现代大语言模型(GPT-4、Claude、LLaMA)几乎都采用 Decoder-only 架构。
影响
Transformer 不仅统一了 NLP,还扩展到了计算机视觉(ViT)、语音(Whisper)、蛋白质结构预测(AlphaFold 2)等领域,成为深度学习的通用骨架。
论文:Vaswani et al., "Attention Is All You Need", 2017
引用本术语的文章