0Pricing
Learn AI with Python · 课时

Word2Vec:Skip-gram 与 CBOW

Word2Vec 理论、gensim 实现、向量运算(king - man + woman = queen)。

Word2Vec:Skip-gram 与 CBOW 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 4 节课。

从词语到向量

机器学习需要数字,但词语是符号。词嵌入会将每个词映射为一个稠密向量,使相似的词在向量空间中彼此接近。

分布假说

Word2Vec 建立在这样一个观点之上:出现在相似语境中的词具有相似的含义。模型通过学习预测语境,将含义捕捉到向量中。

两种架构

Word2Vec 有两种训练方案:

  • CBOW 根据目标词周围的语境预测目标词
  • 跳字模型 根据目标词预测其周围的语境

CBOW 与跳字模型

CBOW 速度更快,对高频词效果良好。跳字模型速度较慢,但对稀有词和小型数据集的处理效果更好。在追求质量时,跳字模型通常是默认选择。

使用 gensim 训练

gensim 库让 Word2Vec 变得易于使用。您只需传入经过标记化的 sentences(由词列表组成的列表),并设置嵌入配置。

from gensim.models import Word2Vec

sentences = [["the", "cat", "sat"], ["the", "dog", "ran"]]
model = Word2Vec(sentences=sentences, vector_size=100, window=5, min_count=1)

关键参数

主要的调节参数包括:

  • vector_size 嵌入维度(例如 100-300)
  • window 每个词周围的语境宽度
  • min_count 忽略出现次数少于此值的词
from gensim.models import Word2Vec

model = Word2Vec(
    sentences,
    vector_size=200,
    window=5,
    min_count=5,
)

使用 sg=1 选择跳字模型

sg 参数用于选择架构:sg=0 使用 CBOW(默认值),sg=1 使用跳字模型。

from gensim.models import Word2Vec

model = Word2Vec(sentences, vector_size=100, window=5, min_count=1, sg=1)
# sg=1 -> skip-gram

访问词向量

训练好的向量存储在 model.wv 中。以某个词作为索引即可获取该词的向量。

vec = model.wv["cat"]
print(vec.shape)   # (vector_size,)
print("dog" in model.wv)

查找相似词

wv.most_similar 会返回向量最接近的词,是快速查看嵌入所学内容的一种方法。

print(model.wv.most_similar("cat", topn=5))
# returns list of (word, similarity) pairs

词向量运算

一个著名的特性是:向量运算能够捕捉关系。国王 - 男人 + 女人 的结果接近女王,说明嵌入编码了类比关系。

result = model.wv.most_similar(
    positive=["king", "woman"],
    negative=["man"],
    topn=1,
)
print(result)   # often [("queen", 0.7...)]

在下游任务中使用嵌入

要表示一个句子,请先对其词向量求平均,再将结果输入任意分类器。当您的数据较少时,预训练的 Word2Vec 嵌入也能提供良好的起点。

import numpy as np

def sentence_vector(words, model):
    vecs = [model.wv[w] for w in words if w in model.wv]
    return np.mean(vecs, axis=0) if vecs else np.zeros(model.vector_size)

快速检查

测试您对 Word2Vec 的了解。

总结

总结:Word2Vec 从语境中学习稠密词向量。CBOW 根据语境预测词(速度快);跳字模型(sg=1)根据词预测语境(更适合稀有词)。在 gensim 中设置 vector_size、window 和 min_count,然后使用 wv.most_similar 以及国王 - 男人 + 女人这样的类比。

常见问题解答

「Word2Vec:Skip-gram 与 CBOW」课时是免费的吗?

是的 — 「Word2Vec:Skip-gram 与 CBOW」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 4 节课。

「Word2Vec:Skip-gram 与 CBOW」这节课中我会学到什么?

Word2Vec 理论、gensim 实现、向量运算(king - man + woman = queen)。 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Learn AI with Python 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「Word2Vec:Skip-gram 与 CBOW」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Learn AI with Python 课中编写并运行代码吗?

能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. Word2Vec:Skip-gram 与 CBOW
  2. GloVe 与 FastText 嵌入
  3. 使用 BERT 进行文本分类
  4. 语义相似度与句子嵌入
← 返回 Learn AI with Python