分词与规范化
文本预处理技术
分词与规范化 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 2 节课,共 5 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 5 节课。
文本预处理基础
分词与规范化
文本预处理是自然语言处理中的关键步骤。它包括将原始文本转换为适合分析的结构化格式。主要的预处理步骤包括分词和规范化。

什么是分词
什么是分词
分词是将文本拆分为较小单元(称为词元)的过程。词元可以是 words、句子或字符。
例如:
文本:"NLP is amazing!"
词元:["NLP", "is", "amazing", "!"]
Python 中的分词示例
Python 中的分词示例
使用 NLTK 库,我们可以将文本分成 words 或句子:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)什么是规范化
什么是规范化
规范化包括清理和统一文本格式。常见的规范化技术包括:
- 小写化:将所有文本转换为小写。
- 移除标点:删除标点符号。
- 词干提取:将 words 还原为词根形式(例如,“跑步” → “跑”)。
- 词形还原:利用上下文将 words 还原为有意义的基本形式(例如,“更好” → “好”)。
小写化和移除标点
小写化和移除标点
下面介绍如何将文本转换为小写并移除标点,从而实现文本规范化:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)词干提取和词形还原
词干提取和词形还原
词干提取:通过去除后缀将 words 还原为词根。它基于规则,因此不一定总能生成有效的单词。
词形还原:利用词汇表和语法规则,将 words 还原为有意义的基本形式。
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))移除停用词
移除停用词
停用词是常见的词语(例如“是”、“和”、“这”),通常不包含重要含义。移除停用词可以简化文本分析:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)文本预处理中的挑战
文本预处理中的挑战
文本预处理可能面临以下挑战:
- 歧义:有些词语可能具有多种含义。
- 上下文:词形还原需要理解词语所处的上下文。
- 语言差异:需要处理不同的语言和方言。
总结与下一步
总结与下一步
本课中,我们:
- 学习了分词和规范化。
- 探索了词干提取、词形还原和停用词移除等技术。
- 练习了使用 Python 进行文本预处理。
接下来,我们将使用 N 元语法模型分析文本模式。

常见问题解答
「分词与规范化」课时是免费的吗?
是的 — 「分词与规范化」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 5 节课。
「分词与规范化」这节课中我会学到什么?
文本预处理技术 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Learn AI with Python 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 5 节。
「分词与规范化」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Learn AI with Python 课中编写并运行代码吗?
能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。