Токенизация и нормализация
Методы предварительной обработки текста
«Токенизация и нормализация» — бесплатный урок Learn AI with Python на CoddyKit. Это урок 2 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Learn AI with Python, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Learn AI with Python содержит 5 уроков всего.
Основы предварительной обработки текста
Токенизация и нормализация
Предварительная обработка текста — важный этап NLP. Она включает преобразование исходного текста в структурированный формат для анализа. Ключевые этапы предварительной обработки — токенизация и нормализация.

Что такое токенизация
Что такое токенизация?
Токенизация — это процесс разбиения текста на более мелкие единицы, называемые токенами. Токенами могут быть слова, предложения или символы.
Например:
Текст: "NLP is amazing!"
Токены: ["NLP", "is", "amazing", "!"]
Пример токенизации на Python
С помощью библиотеки NLTK можно разбивать текст на токены-слова или токены-предложения:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Что такое нормализация
Что такое нормализация?
Нормализация включает очистку и стандартизацию текста. К распространённым методам нормализации относятся:
- Приведение к нижнему регистру: Преобразование всего текста в нижний регистр.
- Удаление знаков препинания: Устранение знаков препинания.
- Стемминг: Сведение слов к их основе (например, "running" → "run").
- Лемматизация: Сведение слов к начальной форме с учётом контекста (например, "better" → "good").
Приведение к нижнему регистру и удаление знаков препинания
Ниже показано, как нормализовать текст, преобразовав его в нижний регистр и удалив знаки препинания:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Стемминг и лемматизация
Стемминг: Сводит слова к их основе, отбрасывая суффиксы. Он основан на правилах и не всегда позволяет получить существующие слова.
Лемматизация: Использует словарь и грамматические правила, чтобы свести слова к их осмысленной начальной форме.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Удаление стоп-слов
Стоп-слова — это распространённые слова (например, "is", "and", "the"), которые часто не несут существенного смысла. Их удаление может упростить анализ текста:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Проблемы предварительной обработки текста
Предварительная обработка текста может быть сложной из-за следующих факторов:
- Неоднозначность: Такие слова, как "lead", могут иметь несколько значений.
- Контекст: Для лемматизации необходимо понимать контекст слова.
- Языковое разнообразие: Необходимо учитывать разные языки и диалекты.
Итоги и следующие шаги
В этом уроке мы:
- узнали о токенизации и нормализации;
- изучили такие методы, как стемминг, лемматизация и удаление стоп-слов;
- потренировались выполнять предварительную обработку текста с помощью Python.
Далее мы проанализируем закономерности текста с помощью моделей N-грамм.

Изучай Python с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 53
- Уроки
- 225
Часто задаваемые вопросы
Урок «Токенизация и нормализация» бесплатный?
Да — полный текст урока «Токенизация и нормализация» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Learn AI with Python, подпишись на CoddyKit PRO. Курс Learn AI with Python содержит 5 уроков всего.
Чему я научусь в уроке «Токенизация и нормализация»?
Методы предварительной обработки текста Ты практикуешь Learn AI with Python с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Learn AI with Python?
Предыдущий опыт не требуется. Learn AI with Python на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 5.
Сколько времени занимает урок «Токенизация и нормализация»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Learn AI with Python?
Да. Каждый урок Learn AI with Python включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Работа с текстовыми данными
- Токенизация и нормализация
- N-граммные модели
- Основы анализа тональности
- Модели на основе трансформеров