Word2Vec
2013年由Google提出的词嵌入模型,首次大规模证明了"词可以变成向量且语义关系可以通过向量运算表达"。经典案例:king - man + woman ≈ queen。是现代Embedding技术的先驱。
Word2Vec
一句话理解
Word2Vec 是第一个让人们意识到 词的语义可以被编码为向量 的模型——它证明了"国王 - 男人 + 女人 ≈ 女王"这种向量算术是可行的。
核心思想
Word2Vec 的训练目标基于一个简单的语言学假设:
一个词的含义由它周围的词决定。("You shall know a word by the company it keeps.")
如果"猫"和"狗"经常出现在相似的上下文中("我养了一只 "、" 在沙发上睡觉"),那么它们的向量应该接近。
两种架构
| 架构 | 训练方式 | 特点 |
|---|---|---|
| Skip-gram | 给定中心词,预测周围的词 | 对低频词效果更好 |
| CBOW | 给定周围的词,预测中心词 | 训练更快 |
最震撼的发现
训练出的词向量居然能做 语义算术:
king−man+woman≈queen Paris−France+Japan≈Tokyo这说明向量空间中编码了真实的语义关系——"性别"、"首都"等概念成为了向量空间中的方向。
历史地位
Word2Vec (2013) 是 NLP 从传统特征工程转向分布式表示学习的分水岭:
| 时期 | 方法 | 特点 |
|---|---|---|
| Word2Vec 之前 | One-hot / TF-IDF | 稀疏、无语义信息 |
| Word2Vec (2013) | 静态词嵌入 | 稠密、编码语义 |
| ELMo (2018) | 上下文相关嵌入 | 同一个词在不同语境中有不同向量 |
| BERT/GPT (2018-) | Transformer 嵌入 | 更深层的上下文理解 |
局限性
Word2Vec 给每个词一个 固定向量——"苹果"不管出现在"吃苹果"还是"苹果公司"中,都是同一个向量。这个问题后来被 ELMo 和 Transformer 的上下文嵌入解决了。
尽管如此,Word2Vec 证明的核心洞见——语义可以用向量运算表达——至今仍是所有现代 Embedding 技术的基石。
引用本术语的文章