Word2Vec:Skip-gram 与 CBOW
Word2Vec 理论、gensim 实现、向量运算(king - man + woman = queen)。
Word2Vec:Skip-gram 与 CBOW 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 4 节课。
从词语到向量
机器学习需要数字,但词语是符号。词嵌入会将每个词映射为一个稠密向量,使相似的词在向量空间中彼此接近。
分布假说
Word2Vec 建立在这样一个观点之上:出现在相似语境中的词具有相似的含义。模型通过学习预测语境,将含义捕捉到向量中。
两种架构
Word2Vec 有两种训练方案:
- CBOW 根据目标词周围的语境预测目标词
- 跳字模型 根据目标词预测其周围的语境
CBOW 与跳字模型
CBOW 速度更快,对高频词效果良好。跳字模型速度较慢,但对稀有词和小型数据集的处理效果更好。在追求质量时,跳字模型通常是默认选择。
使用 gensim 训练
gensim 库让 Word2Vec 变得易于使用。您只需传入经过标记化的 sentences(由词列表组成的列表),并设置嵌入配置。
from gensim.models import Word2Vec
sentences = [["the", "cat", "sat"], ["the", "dog", "ran"]]
model = Word2Vec(sentences=sentences, vector_size=100, window=5, min_count=1)关键参数
主要的调节参数包括:
vector_size嵌入维度(例如 100-300)window每个词周围的语境宽度min_count忽略出现次数少于此值的词
from gensim.models import Word2Vec
model = Word2Vec(
sentences,
vector_size=200,
window=5,
min_count=5,
)使用 sg=1 选择跳字模型
sg 参数用于选择架构:sg=0 使用 CBOW(默认值),sg=1 使用跳字模型。
from gensim.models import Word2Vec
model = Word2Vec(sentences, vector_size=100, window=5, min_count=1, sg=1)
# sg=1 -> skip-gram访问词向量
训练好的向量存储在 model.wv 中。以某个词作为索引即可获取该词的向量。
vec = model.wv["cat"]
print(vec.shape) # (vector_size,)
print("dog" in model.wv)查找相似词
wv.most_similar 会返回向量最接近的词,是快速查看嵌入所学内容的一种方法。
print(model.wv.most_similar("cat", topn=5))
# returns list of (word, similarity) pairs词向量运算
一个著名的特性是:向量运算能够捕捉关系。国王 - 男人 + 女人 的结果接近女王,说明嵌入编码了类比关系。
result = model.wv.most_similar(
positive=["king", "woman"],
negative=["man"],
topn=1,
)
print(result) # often [("queen", 0.7...)]在下游任务中使用嵌入
要表示一个句子,请先对其词向量求平均,再将结果输入任意分类器。当您的数据较少时,预训练的 Word2Vec 嵌入也能提供良好的起点。
import numpy as np
def sentence_vector(words, model):
vecs = [model.wv[w] for w in words if w in model.wv]
return np.mean(vecs, axis=0) if vecs else np.zeros(model.vector_size)快速检查
测试您对 Word2Vec 的了解。
总结
总结:Word2Vec 从语境中学习稠密词向量。CBOW 根据语境预测词(速度快);跳字模型(sg=1)根据词预测语境(更适合稀有词)。在 gensim 中设置 vector_size、window 和 min_count,然后使用 wv.most_similar 以及国王 - 男人 + 女人这样的类比。
常见问题解答
「Word2Vec:Skip-gram 与 CBOW」课时是免费的吗?
是的 — 「Word2Vec:Skip-gram 与 CBOW」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 4 节课。
「Word2Vec:Skip-gram 与 CBOW」这节课中我会学到什么?
Word2Vec 理论、gensim 实现、向量运算(king - man + woman = queen)。 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Learn AI with Python 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。
「Word2Vec:Skip-gram 与 CBOW」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Learn AI with Python 课中编写并运行代码吗?
能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- Word2Vec:Skip-gram 与 CBOW
- GloVe 与 FastText 嵌入
- 使用 BERT 进行文本分类
- 语义相似度与句子嵌入