word2vec 现代版

Word2vec 模型现在仍然存在,而且仍然可以使用。但是它在现代 NLP(自然语言处理)中的地位已经发生了变化:

Word2vec 没有消失,它从“主流语言模型”退居为“基础词向量工具”。

现在它主要用于学习 Embedding、教学、一些传统 NLP 任务和资源受限场景。(维基百科)


1. Word2vec 现在还有哪些形式?

现在常见有三种:


① 原始 Google Word2vec

这是 2013 年 Google 发布的版本。

经典模型:

Google News Word2vec

特点:

  • 训练数据:

    • Google News
    • 大约 1000 亿词
  • 词向量维度:

\[300 \]

  • 词汇量:

约:

\[300万 \]

包含:

  • 单词
  • 短语

例如:

king
queen
man
woman
computer

都有对应:

\[300维向量 \]

这个经典模型今天仍然有人使用。(GitHub)


2. Python 中还能直接训练 Word2vec 吗?

可以。

最常用的是:

Gensim

安装:

pip install gensim

代码:

from gensim.models import Word2Vec


sentences = [
    ["I", "like", "cat"],
    ["I", "like", "dog"],
    ["cat", "eat", "fish"]
]


model = Word2Vec(
    sentences,
    vector_size=100,
    window=5,
    min_count=1
)


vector = model.wv["cat"]

print(vector)

输出类似:

[
0.023,
-0.134,
0.562,
...
]

也就是:

cat 的 100 维语义向量。

Gensim 目前仍维护 Word2Vec 实现,包括 Skip-gram 和 CBOW。(GitHub)


3. 现在还能下载预训练 Word2vec 吗?

可以。

例如:

Google News Word2vec

文件:

GoogleNews-vectors-negative300.bin.gz

大小:

约:

\[1.5GB \]

加载:

from gensim.models import KeyedVectors


model = KeyedVectors.load_word2vec_format(
    "GoogleNews-vectors-negative300.bin.gz",
    binary=True
)


model.most_similar("king")

可能输出:

queen
prince
monarch
kingdom
...

(GitHub)


4. 为什么现在 GPT 出来了,Word2vec 还存在?

因为它们解决的问题不同。

比较:

Word2vec GPT
出现时间 2013 2018以后
目标 学习词向量 生成和理解语言
输入 单词 上下文
输出 固定向量 动态语义表示
模型规模 百万参数级 十亿/千亿参数级
训练方式 预测上下文 预测下一个 token
是否理解上下文

5. 最大区别:固定向量 vs 上下文向量

这是 Word2vec 和 GPT 最大区别。


Word2vec

一个词只有一个向量:

\[bank \]

永远:

\[vector(bank) \]

例如:

I go to the bank.

银行。

river bank

河岸。

Word2vec:

两个 bank:

一样。


GPT

同一个词:

根据上下文生成不同向量。

例如:

句子:

I deposited money in the bank

bank:

可能:

\[vector(bank|money) \]

表示:

银行。


句子:

I sit near the river bank

bank:

\[vector(bank|river) \]

表示:

河岸。

所以 GPT 使用:

Contextual Embedding(上下文嵌入)。


6. Word2vec 现在还有什么用途?

用途1:学习 Embedding 原理

非常重要。

因为 Word2vec 结构简单:

输入词
 |
神经网络
 |
输出附近词
 |
隐藏层权重
 |
词向量

非常容易理解:

为什么:

  • 向量表示意义
  • 方向表示关系
  • 余弦相似度有效

用途2:小型 NLP 项目

例如:

  • 文本分类
  • 新闻聚类
  • 推荐系统
  • 搜索排序

如果数据量不大:

Word2vec 仍然够用。


用途3:领域词向量

例如:

医学:

癌症
肿瘤
基因
蛋白质

金融:

股票
债券
基金
利率

可以使用自己的语料训练:

\[Word2vec_{medical} \]

得到专业语义空间。


7. 为什么 Word2vec 没有成为主流?

主要三个原因。


原因1:无法处理多义词

例如:

苹果

可以:

水果

或者:

公司

Word2vec:

一个苹果向量。

GPT:

根据上下文改变。


原因2:没有真正理解句子结构

例如:

狗咬人

和:

人咬狗

Word2vec 看:

狗、人、咬

这些词。

但是不知道:

主宾关系。


原因3:表达能力有限

Word2vec:

几十万到几百万参数。

GPT:

几十亿到千亿参数。

规模完全不同。


8. 学习路线中 Word2vec 的位置

如果你现在学习 LLM,我建议理解顺序:

One-hot
   ↓
TF-IDF
   ↓
Word2vec   ← 这里
   ↓
GloVe
   ↓
RNN/LSTM
   ↓
Attention
   ↓
Transformer
   ↓
GPT

为什么?

因为:

Word2vec 是理解现代 LLM Embedding 的桥梁。

你前面问:

为什么方向代表意义?

这个答案最早就是从 Word2vec 的实验现象中被广泛认识的。


9. 一个总结性的定位

可以这样理解:

Word2vec 相当于:

第一代成功把“语言意义”转换成数学空间的技术。

它证明:

\[\text{意义} \approx \text{向量空间中的关系} \]

而 GPT 做的是:

在 Word2vec 的基础上,引入上下文、注意力和巨大规模,把静态语义空间升级为动态语义空间。

所以:

  • 学 Embedding 原理 → 必学 Word2vec
  • 做现代 LLM 应用 → 不会直接用 Word2vec
  • 理解 GPT 内部机制 → Word2vec 是重要历史起点

可以把它看成:

Word2vec 是“语义向量时代”的牛顿力学,Transformer/GPT 是后来的相对论。

posted @ 2026-08-26 16:15  立体风  阅读(13)  评论(0)    收藏  举报