从稀疏计数到稠密向量
理解嵌入为何优于词袋模型
从稀疏计数到稠密向量 是 CoddyKit 上的免费 NLP Academy 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 NLP Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 NLP Academy 课程共包含 4 节课。
快速回顾
词袋模型和 TF-IDF 将文本转换成长长的计数向量。它们确实有效,但这些稀疏向量隐藏着一个您即将看到的真实弱点。
几乎全是零
词袋向量为词汇表中的每个词各留出一个位置,因此短句几乎全是零。我们称这种表示为稀疏表示。
庞大且浪费
如果词汇表中有 50,000 个词,每篇文档都会变成一个长度为 50,000 的向量。仅仅表示少数真实信号,却需要这么多维度。
词语之间没有关联
在词袋模型中,cat 和 kitten 位于完全不同的位置。模型完全看不出它们之间的相似性,尽管我们能看出来。
核心盲点
稀疏向量把每个词都视为与其他词毫无关联。它们能捕捉词语是否出现,却完全忽略了含义和词语之间的关系。
稠密向量登场
嵌入会将每个词表示为一小列实数,例如 100 个数值。这种紧凑形式就是稠密向量。
cat = [0.21, -0.44, 0.10, 0.88]
kitten = [0.19, -0.40, 0.13, 0.85]维度更少,含义更丰富
您不再面对 50,000 个大多为零的位置,而是得到大约 100 个紧凑排列的数值。每个维度都会以不易察觉的方式编码某个学到的含义方面。✨
相似的词彼此接近
神奇之处在于几何关系:含义相近的词会落在空间中彼此接近的位置。在这个空间中的接近程度,如今就代表着含义的接近程度。
衡量接近程度
我们使用余弦相似度比较两个稠密向量,它会对向量方向的一致程度进行评分。分数越高,含义越相近。
从数据中学习
这些数值不是由人手动编写的。算法会读取海量文本,并根据词语实际使用的方式学习每个词的向量。
这为何是一次飞跃
稠密向量更小、更智能,还能捕捉稀疏计数永远无法捕捉的关系。这一改变推动了现代自然语言处理的大部分发展。
快速检查
稠密词向量相比稀疏计数的关键优势是什么?
回顾
稀疏计数规模庞大,并且将词语视为互不相关。稠密嵌入通过紧凑的向量解决了这一问题,使相似的词彼此接近。✅
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「从稀疏计数到稠密向量」课时是免费的吗?
是的 — 「从稀疏计数到稠密向量」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 NLP Academy 课程的其余内容,请升级到 CoddyKit PRO。 NLP Academy 课程共包含 4 节课。
「从稀疏计数到稠密向量」这节课中我会学到什么?
理解嵌入为何优于词袋模型 你通过在浏览器中直接运行的动手代码来练习 NLP Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 NLP Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 NLP Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。
「从稀疏计数到稠密向量」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 NLP Academy 课中编写并运行代码吗?
能。每节 NLP Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。