Word2Vec

2013年由Google提出的词嵌入模型,首次大规模证明了"词可以变成向量且语义关系可以通过向量运算表达"。经典案例:king - man + woman ≈ queen。是现代Embedding技术的先驱。

Word2Vec

一句话理解

Word2Vec 是第一个让人们意识到 词的语义可以被编码为向量 的模型——它证明了"国王 - 男人 + 女人 ≈ 女王"这种向量算术是可行的。

核心思想

Word2Vec 的训练目标基于一个简单的语言学假设:

一个词的含义由它周围的词决定。("You shall know a word by the company it keeps.")

如果"猫"和"狗"经常出现在相似的上下文中("我养了一只 "、" 在沙发上睡觉"),那么它们的向量应该接近。

两种架构

架构训练方式特点
Skip-gram给定中心词,预测周围的词对低频词效果更好
CBOW给定周围的词,预测中心词训练更快

最震撼的发现

训练出的词向量居然能做 语义算术

kingman+womanqueen\vec{\text{king}} - \vec{\text{man}} + \vec{\text{woman}} \approx \vec{\text{queen}}kingman+womanqueen ParisFrance+JapanTokyo\vec{\text{Paris}} - \vec{\text{France}} + \vec{\text{Japan}} \approx \vec{\text{Tokyo}}ParisFrance+JapanTokyo

这说明向量空间中编码了真实的语义关系——"性别"、"首都"等概念成为了向量空间中的方向。

历史地位

Word2Vec (2013) 是 NLP 从传统特征工程转向分布式表示学习的分水岭:

时期方法特点
Word2Vec 之前One-hot / TF-IDF稀疏、无语义信息
Word2Vec (2013)静态词嵌入稠密、编码语义
ELMo (2018)上下文相关嵌入同一个词在不同语境中有不同向量
BERT/GPT (2018-)Transformer 嵌入更深层的上下文理解

局限性

Word2Vec 给每个词一个 固定向量——"苹果"不管出现在"吃苹果"还是"苹果公司"中,都是同一个向量。这个问题后来被 ELMo 和 Transformer 的上下文嵌入解决了。

尽管如此,Word2Vec 证明的核心洞见——语义可以用向量运算表达——至今仍是所有现代 Embedding 技术的基石。

引用本术语的文章