NLP Academy · 课时

分块与嵌入文档

准备可搜索的知识库

第 2 / 4 课13 个步骤

分块与嵌入文档 是 CoddyKit 上的免费 NLP Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 NLP Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 NLP Academy 课程共包含 4 节课。

文档太大,无法整体搜索

一份较长的 PDF 往往同时包含许多主题。为了实现精准检索,您需要先将它拆分成较小的部分,称为文本块。

什么样的文本块才算好

好的文本块表达一个连贯的想法:通常是一到两段。太大会掩盖答案,太小则会丢失周围的上下文。

按大小拆分

最简单的方法是每隔固定数量的字符或词元切分文本。这种方法很快,但可能会把一个句子从中间截断。

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

重叠文本块

为了避免把一个想法拆开,可以让文本块之间保留重叠部分。重复保留末尾几行,可以让上下文跨越边界保持连贯。

按结构拆分

更智能的拆分器会优先按照段落或标题进行切分。遵循结构可以让每个文本块只围绕一个清晰的主题。

从文本到向量

搜索需要数字,而不是文字。嵌入会将每个文本块转换为能够捕捉其含义的稠密向量。

含义体现在距离中

嵌入会将相似文本放在彼此靠近的位置。讨论相同想法的两个文本块,在向量空间中会彼此接近。

调用嵌入模型

将文本传给嵌入模型,即可得到一个浮点数列表。同一个模型必须同时对文本块和查询进行编码。

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

对文本块进行编码

让每个文本块经过模型,以构建对应的向量。为提高速度,一次调用就可以对整个列表进行encode。

vectors = model.encode(chunks)

向量维度

每个向量都有固定的长度,即它的维度。较小的模型可能生成 384 个数字,而更大的模型会生成 768 个或更多。

print(vectors.shape)  # (n_chunks, 384)

将文本块与向量一起存储

让每个向量与其原始文本和来源保持关联。之后您可以通过向量进行检索,但向用户展示易于阅读的文本块。

快速检查

想一想,拆分文档时我们为什么要加入重叠部分。

总结

您可以将文档拆分成文本块,并根据需要让它们彼此重叠,然后将每个文本块嵌入为向量。将文本和向量一起存储,以便进行检索。✅

免费开始

用 AI 导师学习 Python — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「分块与嵌入文档」课时是免费的吗?

是的 — 「分块与嵌入文档」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 NLP Academy 课程的其余内容,请升级到 CoddyKit PRO。 NLP Academy 课程共包含 4 节课。

「分块与嵌入文档」这节课中我会学到什么?

准备可搜索的知识库 你通过在浏览器中直接运行的动手代码来练习 NLP Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 NLP Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 NLP Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「分块与嵌入文档」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 NLP Academy 课中编写并运行代码吗?

能。每节 NLP Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. LLM 为何需要检索
  2. 分块与嵌入文档
  3. 使用向量存储进行向量搜索
  4. 将检索接入提示
← 返回 NLP Academy