分词与规范化
文本预处理技术
分词与规范化 是 CoddyKit 上的免费 Python Academy 课时。 这是第 2 节课,共 5 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Python Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Python Academy 课程共包含 5 节课。
文本预处理基础
分词与规范化
文本预处理是自然语言处理中的关键步骤。它包括将原始文本转换为用于分析的结构化格式。关键的预处理步骤包括分词和规范化。

什么是分词?
什么是分词?
分词是将文本拆分为更小单元的过程,这些单元称为词元。词元可以是单词、句子或字符。
例如:
文本:"NLP is amazing!"
词元:["NLP", "is", "amazing", "!"]
Python 中的分词示例
Python 中的分词示例
使用 NLTK 库,我们可以将文本分词为单词或句子:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)什么是规范化?
什么是规范化?
规范化包括清理文本并统一其格式。常见的规范化技术包括:
- 转换为小写:将所有文本转换为小写。
- 移除标点:删除标点符号。
- 词干提取:将单词还原为词根形式(例如,“running”→“run”)。
- 词形还原:结合上下文将单词还原为其基本形式(例如,“better”→“good”)。
转换为小写并移除标点
转换为小写并移除标点
以下是通过将文本转换为小写并移除标点来进行规范化的方法:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)词干提取与词形还原
词干提取与词形还原
词干提取:通过截去后缀,将单词还原为词根。它基于规则,因此不一定总能生成有效单词。
词形还原:利用词汇表和语法规则,将单词还原为有实际意义的基本形式。
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))移除停用词
移除停用词
停用词是一些常见单词(例如“是”“和”“这”),通常不承载重要含义。移除这些词可以简化文本分析:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)文本预处理中的挑战
文本预处理中的挑战
文本预处理之所以具有挑战性,是因为:
- 歧义:同一个词可能有多种含义。
- 上下文:词形还原需要理解单词所在的上下文。
- 语言差异:需要处理不同的语言和方言。
总结与后续步骤
总结与后续步骤
在本课中,我们:
- 学习了分词和规范化。
- 探讨了词干提取、词形还原和移除停用词等技术。
- 使用 Python 练习了文本预处理。
接下来,我们将使用 N元语法模型分析文本模式。

常见问题解答
「分词与规范化」课时是免费的吗?
是的 — 「分词与规范化」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Python Academy 课程的其余内容,请升级到 CoddyKit PRO。 Python Academy 课程共包含 5 节课。
「分词与规范化」这节课中我会学到什么?
文本预处理技术 你通过在浏览器中直接运行的动手代码来练习 Python Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Python Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Python Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 5 节。
「分词与规范化」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Python Academy 课中编写并运行代码吗?
能。每节 Python Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。