Token、Span 与 Doc 对象
掌握 spaCy 的数据结构
Token、Span 与 Doc 对象 是 CoddyKit 上的免费 NLP Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 NLP Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 NLP Academy 课程共包含 4 节课。
三个核心对象
spaCy 为您提供三个构建模块:文档、词元和片段。掌握它们,整个库就会变得清晰易懂。
文档容器
文档是经过完整处理的文档。它包含原始文本、每个词元,以及 spaCy 生成的全部分析结果。
doc = nlp("Maria leads the data team.")像列表一样使用索引
由于文档支持索引,您可以按位置取出其中的一个项目。索引操作会返回单个词元,就像 Python 列表一样。
first = doc[0]词元包含什么
词元是文本中的一个单元,同时带有丰富的元数据:词性、词元原形,以及它是否为标点符号。
print(doc[0].text, doc[0].pos_)实用的词元标记
词元带有 is_stop、is_alpha 和 is_punct 等实用标记。借助它们,您无需编写自己的检查逻辑就能筛选词语。
for t in doc:
print(t.text, t.is_stop)切片获取片段
对文档进行切片后,您会得到一个片段,也就是一段连续的词元。它非常适合表示人名或地点等短语。
phrase = doc[0:2]片段保留上下文
片段并不是副本。它仍然指向文档中的原位置,因此知道自己的位置,并共享原始分析结果。
实体就是片段
命名实体会以片段的形式出现在 doc.ents 中。每个片段都包含相应词语以及 PERSON 或 ORG 等标签。
for ent in doc.ents:
print(ent.text, ent.label_)名词短语块
spaCy 还提供 noun_chunks,它会将基本名词短语作为片段返回。这是提取句子所谈论事物的快捷方式。
list(doc.noun_chunks)以片段表示句子
需要获取句子吗?请遍历 doc.sents。每个句子都会以片段形式返回,因此分句工作已经由系统为您完成。
for sent in doc.sents:
print(sent.text)保留原始文本
在整个过程中,原始字符串都会保存在 doc.text 中。词元和片段只是视图,不会破坏性地修改原文。
快速检查
使用 doc[0:3] 对文档切片后会得到什么?
回顾
文档包含所有内容,索引操作得到一个词元,切片操作得到一个片段。实体、名词短语块和句子都会以片段形式返回。🧩
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「Token、Span 与 Doc 对象」课时是免费的吗?
是的 — 「Token、Span 与 Doc 对象」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 NLP Academy 课程的其余内容,请升级到 CoddyKit PRO。 NLP Academy 课程共包含 4 节课。
「Token、Span 与 Doc 对象」这节课中我会学到什么?
掌握 spaCy 的数据结构 你通过在浏览器中直接运行的动手代码来练习 NLP Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 NLP Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 NLP Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「Token、Span 与 Doc 对象」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 NLP Academy 课中编写并运行代码吗?
能。每节 NLP Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 真实项目为何选择 spaCy
- 加载模型并处理文档
- Token、Span 与 Doc 对象
- 自定义流水线