word2vec 现代版
Word2vec 模型现在仍然存在,而且仍然可以使用。但是它在现代 NLP(自然语言处理)中的地位已经发生了变化:
Word2vec 没有消失,它从“主流语言模型”退居为“基础词向量工具”。
现在它主要用于学习 Embedding、教学、一些传统 NLP 任务和资源受限场景。(维基百科)
1. Word2vec 现在还有哪些形式?
现在常见有三种:
① 原始 Google Word2vec
这是 2013 年 Google 发布的版本。
经典模型:
Google News Word2vec
特点:
-
训练数据:
- Google News
- 大约 1000 亿词
-
词向量维度:
- 词汇量:
约:
包含:
- 单词
- 短语
例如:
king
queen
man
woman
computer
都有对应:
这个经典模型今天仍然有人使用。(GitHub)
2. Python 中还能直接训练 Word2vec 吗?
可以。
最常用的是:
Gensim
安装:
pip install gensim
代码:
from gensim.models import Word2Vec
sentences = [
["I", "like", "cat"],
["I", "like", "dog"],
["cat", "eat", "fish"]
]
model = Word2Vec(
sentences,
vector_size=100,
window=5,
min_count=1
)
vector = model.wv["cat"]
print(vector)
输出类似:
[
0.023,
-0.134,
0.562,
...
]
也就是:
cat 的 100 维语义向量。
Gensim 目前仍维护 Word2Vec 实现,包括 Skip-gram 和 CBOW。(GitHub)
3. 现在还能下载预训练 Word2vec 吗?
可以。
例如:
Google News Word2vec
文件:
GoogleNews-vectors-negative300.bin.gz
大小:
约:
加载:
from gensim.models import KeyedVectors
model = KeyedVectors.load_word2vec_format(
"GoogleNews-vectors-negative300.bin.gz",
binary=True
)
model.most_similar("king")
可能输出:
queen
prince
monarch
kingdom
...
(GitHub)
4. 为什么现在 GPT 出来了,Word2vec 还存在?
因为它们解决的问题不同。
比较:
| Word2vec | GPT | |
|---|---|---|
| 出现时间 | 2013 | 2018以后 |
| 目标 | 学习词向量 | 生成和理解语言 |
| 输入 | 单词 | 上下文 |
| 输出 | 固定向量 | 动态语义表示 |
| 模型规模 | 百万参数级 | 十亿/千亿参数级 |
| 训练方式 | 预测上下文 | 预测下一个 token |
| 是否理解上下文 | 弱 | 强 |
5. 最大区别:固定向量 vs 上下文向量
这是 Word2vec 和 GPT 最大区别。
Word2vec
一个词只有一个向量:
永远:
例如:
I go to the bank.
银行。
river bank
河岸。
Word2vec:
两个 bank:
一样。
GPT
同一个词:
根据上下文生成不同向量。
例如:
句子:
I deposited money in the bank
bank:
可能:
表示:
银行。
句子:
I sit near the river bank
bank:
表示:
河岸。
所以 GPT 使用:
Contextual Embedding(上下文嵌入)。
6. Word2vec 现在还有什么用途?
用途1:学习 Embedding 原理
非常重要。
因为 Word2vec 结构简单:
输入词
|
神经网络
|
输出附近词
|
隐藏层权重
|
词向量
非常容易理解:
为什么:
- 向量表示意义
- 方向表示关系
- 余弦相似度有效
用途2:小型 NLP 项目
例如:
- 文本分类
- 新闻聚类
- 推荐系统
- 搜索排序
如果数据量不大:
Word2vec 仍然够用。
用途3:领域词向量
例如:
医学:
癌症
肿瘤
基因
蛋白质
金融:
股票
债券
基金
利率
可以使用自己的语料训练:
得到专业语义空间。
7. 为什么 Word2vec 没有成为主流?
主要三个原因。
原因1:无法处理多义词
例如:
苹果
可以:
水果
或者:
公司
Word2vec:
一个苹果向量。
GPT:
根据上下文改变。
原因2:没有真正理解句子结构
例如:
狗咬人
和:
人咬狗
Word2vec 看:
狗、人、咬
这些词。
但是不知道:
主宾关系。
原因3:表达能力有限
Word2vec:
几十万到几百万参数。
GPT:
几十亿到千亿参数。
规模完全不同。
8. 学习路线中 Word2vec 的位置
如果你现在学习 LLM,我建议理解顺序:
One-hot
↓
TF-IDF
↓
Word2vec ← 这里
↓
GloVe
↓
RNN/LSTM
↓
Attention
↓
Transformer
↓
GPT
为什么?
因为:
Word2vec 是理解现代 LLM Embedding 的桥梁。
你前面问:
为什么方向代表意义?
这个答案最早就是从 Word2vec 的实验现象中被广泛认识的。
9. 一个总结性的定位
可以这样理解:
Word2vec 相当于:
第一代成功把“语言意义”转换成数学空间的技术。
它证明:
而 GPT 做的是:
在 Word2vec 的基础上,引入上下文、注意力和巨大规模,把静态语义空间升级为动态语义空间。
所以:
- 学 Embedding 原理 → 必学 Word2vec
- 做现代 LLM 应用 → 不会直接用 Word2vec
- 理解 GPT 内部机制 → Word2vec 是重要历史起点
可以把它看成:
Word2vec 是“语义向量时代”的牛顿力学,Transformer/GPT 是后来的相对论。

浙公网安备 33010602011771号