按标签模式提取短语
提取名词短语与动词
按标签模式提取短语 是 CoddyKit 上的免费 NLP Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 NLP Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 NLP Academy 课程共包含 4 节课。
从标签到短语
单个标签很有用,但含义通常存在于一组单词中。标签模式可以提取完整短语,而不是孤立的词元。🧩
什么是名词短语块?
名词短语块是名词及其修饰词组成的短语,例如 the fluffy cat。这些短语通常指明句子所描述的关键事物。
直接获取名词短语块
spaCy 会为您查找名词短语块。遍历 doc.noun_chunks,即可将每个短语作为一个跨度获取,而无需编写任何规则。
for chunk in doc.noun_chunks:
print(chunk.text)短语块就是跨度
每个名词短语块都是一个 Span,也就是 Doc 的一段切片。跨度知道自身的文本、起始位置和结束位置,因此您可以像使用其他词元组一样重复使用它。
chunk = list(doc.noun_chunks)[0]
print(chunk.start, chunk.end)提取所有动词
要收集动作词,请保留 pos_ 为 VERB 的词元。列表推导式可以在一行易读的代码中将它们全部收集起来。
verbs = [t.text for t in doc if t.pos_ == "VERB"]匹配自定义模式
如需定义自己的规则,请使用 Matcher。您描述一组词元属性的序列,spaCy 就会找出该序列出现的每个位置。
from spacy.matcher import Matcher
matcher = Matcher(nlp.vocab)定义标签序列
模式是一个字典列表,每个词元对应一个字典。此模式会匹配一个形容词后面紧跟一个名词的情况,例如 fluffy cat。
pattern = [{"POS": "ADJ"}, {"POS": "NOUN"}]添加模式
使用 matcher.add(),以一个名称注册您的模式。这个名称可以帮助您将相关规则归为一组,并在之后识别匹配结果。
matcher.add("ADJ_NOUN", [pattern])运行匹配器
对 Doc 调用匹配器即可获得匹配结果。每个结果都是一个元组,包含匹配 ID 以及起始和结束词元位置。
matches = matcher(doc)读取每个匹配结果
使用起始位置和结束位置切取 Doc,即可将匹配结果转换为易读的文本。这段切片就是模式捕获到的短语。
for mid, start, end in matches:
print(doc[start:end].text)这里标签模式优于正则表达式
标签模式能够理解语法,因此可以捕获正则表达式可能遗漏的短语。根据 POS 进行匹配,比追踪精确的字母序列简洁得多。
快速检查
想一想如何提取成组的名词。
回顾
您通过两种方式提取了短语:使用内置的 noun_chunks,以及使用 Matcher 自定义标签模式。现在,您可以挖掘语法信息,而不只是单词。🎉
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「按标签模式提取短语」课时是免费的吗?
是的 — 「按标签模式提取短语」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 NLP Academy 课程的其余内容,请升级到 CoddyKit PRO。 NLP Academy 课程共包含 4 节课。
「按标签模式提取短语」这节课中我会学到什么?
提取名词短语与动词 你通过在浏览器中直接运行的动手代码来练习 NLP Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 NLP Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 NLP Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「按标签模式提取短语」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 NLP Academy 课中编写并运行代码吗?
能。每节 NLP Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。