0Pricing
Learn AI with Python · 课时

分词与规范化

文本预处理技术

分词与规范化 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 2 节课,共 5 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 5 节课。

文本预处理基础

分词与规范化

文本预处理是自然语言处理中的关键步骤。它包括将原始文本转换为适合分析的结构化格式。主要的预处理步骤包括分词和规范化。

分词与规范化 — 插图 1

什么是分词

什么是分词

分词是将文本拆分为较小单元(称为词元)的过程。词元可以是 words、句子或字符。

例如:

文本:"NLP is amazing!"

词元:["NLP", "is", "amazing", "!"]

Python 中的分词示例

Python 中的分词示例

使用 NLTK 库,我们可以将文本分成 words 或句子:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

什么是规范化

什么是规范化

规范化包括清理和统一文本格式。常见的规范化技术包括:

  • 小写化:将所有文本转换为小写。
  • 移除标点:删除标点符号。
  • 词干提取:将 words 还原为词根形式(例如,“跑步” → “跑”)。
  • 词形还原:利用上下文将 words 还原为有意义的基本形式(例如,“更好” → “好”)。

小写化和移除标点

小写化和移除标点

下面介绍如何将文本转换为小写并移除标点,从而实现文本规范化:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

词干提取和词形还原

词干提取和词形还原

词干提取:通过去除后缀将 words 还原为词根。它基于规则,因此不一定总能生成有效的单词。

词形还原:利用词汇表和语法规则,将 words 还原为有意义的基本形式。

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

移除停用词

移除停用词

停用词是常见的词语(例如“是”、“和”、“这”),通常不包含重要含义。移除停用词可以简化文本分析:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

文本预处理中的挑战

文本预处理中的挑战

文本预处理可能面临以下挑战:

  • 歧义:有些词语可能具有多种含义。
  • 上下文:词形还原需要理解词语所处的上下文。
  • 语言差异:需要处理不同的语言和方言。

总结与下一步

总结与下一步

本课中,我们:

  • 学习了分词和规范化。
  • 探索了词干提取、词形还原和停用词移除等技术。
  • 练习了使用 Python 进行文本预处理。

接下来,我们将使用 N 元语法模型分析文本模式。

分词与规范化 — 插图 10

常见问题解答

「分词与规范化」课时是免费的吗?

是的 — 「分词与规范化」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 5 节课。

「分词与规范化」这节课中我会学到什么?

文本预处理技术 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Learn AI with Python 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 5 节。

「分词与规范化」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Learn AI with Python 课中编写并运行代码吗?

能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 处理文本数据
  2. 分词与规范化
  3. N 元语法模型
  4. 情感分析概念
  5. 基于 Transformer 的模型
← 返回 Learn AI with Python