Токенизация и нормализация
Методы предварительной обработки текста
«Токенизация и нормализация» — бесплатный урок Python Academy на CoddyKit. Это урок 2 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 5 уроков всего.
Основы предварительной обработки текста
Токенизация и нормализация
Предварительная обработка текста — важнейший этап обработки естественного языка. Она включает преобразование исходного текста в структурированный формат для анализа. Ключевые этапы предварительной обработки — токенизация и нормализация.

Что такое токенизация?
Что такое токенизация?
Токенизация — это процесс разбиения текста на небольшие единицы, называемые токенами. Токенами могут быть слова, предложения или символы.
Например:
Текст: "NLP is amazing!"
Токены: ["NLP", "is", "amazing", "!"]
Пример токенизации на Python
Пример токенизации на Python
С помощью библиотеки NLTK мы можем разбивать текст на слова или предложения:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Что такое нормализация?
Что такое нормализация?
Нормализация включает очистку и стандартизацию текста. К распространенным методам нормализации относятся:
- Приведение к нижнему регистру: преобразование всего текста в нижний регистр.
- Удаление знаков препинания: удаление знаков пунктуации.
- Стемминг: приведение слов к основе, например «бегущий» → «бег».
- Лемматизация: приведение слов к начальной форме с учетом контекста, например «лучше» → «хороший».
Приведение к нижнему регистру и удаление знаков препинания
Приведение к нижнему регистру и удаление знаков препинания
Вот как нормализовать текст, переведя его в нижний регистр и удалив знаки препинания:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Стемминг и лемматизация
Стемминг и лемматизация
Стемминг: сводит слова к основе путем отсечения суффиксов. Этот метод основан на правилах и не всегда позволяет получить настоящие слова.
Лемматизация: использует словарь и грамматические правила, чтобы привести слова к осмысленной начальной форме.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Удаление стоп-слов
Удаление стоп-слов
Стоп-слова — это распространенные слова, например «и», «в» и «на», которые часто не несут существенного смысла. Их удаление может упростить анализ текста:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Проблемы предварительной обработки текста
Проблемы предварительной обработки текста
Предварительная обработка текста может быть сложной по следующим причинам:
- Неоднозначность: такие слова, как «ключ», могут иметь несколько значений.
- Контекст: для лемматизации необходимо понимать контекст слова.
- Языковая вариативность: необходимость работать с разными языками и диалектами.
Итоги и следующие шаги
Итоги и следующие шаги
На этом уроке мы:
- Изучили токенизацию и нормализацию.
- Рассмотрели такие методы, как стемминг, лемматизация и удаление стоп-слов.
- Потренировались выполнять предварительную обработку текста с помощью Python.
Далее мы проанализируем закономерности текста с помощью моделей N-грамм.

Часто задаваемые вопросы
Урок «Токенизация и нормализация» бесплатный?
Да — полный текст урока «Токенизация и нормализация» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 5 уроков всего.
Чему я научусь в уроке «Токенизация и нормализация»?
Методы предварительной обработки текста Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Python Academy?
Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 5.
Сколько времени занимает урок «Токенизация и нормализация»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Python Academy?
Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Работа с текстовыми данными
- Токенизация и нормализация
- N-граммные модели
- Основы анализа тональности
- Модели на основе трансформеров