分块与嵌入文档
准备可搜索的知识库
分块与嵌入文档 是 CoddyKit 上的免费 NLP Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 NLP Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 NLP Academy 课程共包含 4 节课。
文档太大,无法整体搜索
一份较长的 PDF 往往同时包含许多主题。为了实现精准检索,您需要先将它拆分成较小的部分,称为文本块。
什么样的文本块才算好
好的文本块表达一个连贯的想法:通常是一到两段。太大会掩盖答案,太小则会丢失周围的上下文。
按大小拆分
最简单的方法是每隔固定数量的字符或词元切分文本。这种方法很快,但可能会把一个句子从中间截断。
chunks = [text[i:i+500] for i in range(0, len(text), 500)]重叠文本块
为了避免把一个想法拆开,可以让文本块之间保留重叠部分。重复保留末尾几行,可以让上下文跨越边界保持连贯。
按结构拆分
更智能的拆分器会优先按照段落或标题进行切分。遵循结构可以让每个文本块只围绕一个清晰的主题。
从文本到向量
搜索需要数字,而不是文字。嵌入会将每个文本块转换为能够捕捉其含义的稠密向量。
含义体现在距离中
嵌入会将相似文本放在彼此靠近的位置。讨论相同想法的两个文本块,在向量空间中会彼此接近。
调用嵌入模型
将文本传给嵌入模型,即可得到一个浮点数列表。同一个模型必须同时对文本块和查询进行编码。
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")对文本块进行编码
让每个文本块经过模型,以构建对应的向量。为提高速度,一次调用就可以对整个列表进行encode。
vectors = model.encode(chunks)向量维度
每个向量都有固定的长度,即它的维度。较小的模型可能生成 384 个数字,而更大的模型会生成 768 个或更多。
print(vectors.shape) # (n_chunks, 384)将文本块与向量一起存储
让每个向量与其原始文本和来源保持关联。之后您可以通过向量进行检索,但向用户展示易于阅读的文本块。
快速检查
想一想,拆分文档时我们为什么要加入重叠部分。
总结
您可以将文档拆分成文本块,并根据需要让它们彼此重叠,然后将每个文本块嵌入为向量。将文本和向量一起存储,以便进行检索。✅
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「分块与嵌入文档」课时是免费的吗?
是的 — 「分块与嵌入文档」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 NLP Academy 课程的其余内容,请升级到 CoddyKit PRO。 NLP Academy 课程共包含 4 节课。
「分块与嵌入文档」这节课中我会学到什么?
准备可搜索的知识库 你通过在浏览器中直接运行的动手代码来练习 NLP Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 NLP Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 NLP Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「分块与嵌入文档」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 NLP Academy 课中编写并运行代码吗?
能。每节 NLP Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。