0Pricing
Python Academy · Урок

Токенизация и нормализация

Методы предварительной обработки текста

«Токенизация и нормализация» — бесплатный урок Python Academy на CoddyKit. Это урок 2 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 5 уроков всего.

Основы предварительной обработки текста

Токенизация и нормализация

Предварительная обработка текста — важнейший этап обработки естественного языка. Она включает преобразование исходного текста в структурированный формат для анализа. Ключевые этапы предварительной обработки — токенизация и нормализация.

Токенизация и нормализация — иллюстрация 1

Что такое токенизация?

Что такое токенизация?

Токенизация — это процесс разбиения текста на небольшие единицы, называемые токенами. Токенами могут быть слова, предложения или символы.

Например:

Текст: "NLP is amazing!"

Токены: ["NLP", "is", "amazing", "!"]

Пример токенизации на Python

Пример токенизации на Python

С помощью библиотеки NLTK мы можем разбивать текст на слова или предложения:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Что такое нормализация?

Что такое нормализация?

Нормализация включает очистку и стандартизацию текста. К распространенным методам нормализации относятся:

  • Приведение к нижнему регистру: преобразование всего текста в нижний регистр.
  • Удаление знаков препинания: удаление знаков пунктуации.
  • Стемминг: приведение слов к основе, например «бегущий» → «бег».
  • Лемматизация: приведение слов к начальной форме с учетом контекста, например «лучше» → «хороший».

Приведение к нижнему регистру и удаление знаков препинания

Приведение к нижнему регистру и удаление знаков препинания

Вот как нормализовать текст, переведя его в нижний регистр и удалив знаки препинания:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Стемминг и лемматизация

Стемминг и лемматизация

Стемминг: сводит слова к основе путем отсечения суффиксов. Этот метод основан на правилах и не всегда позволяет получить настоящие слова.

Лемматизация: использует словарь и грамматические правила, чтобы привести слова к осмысленной начальной форме.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Удаление стоп-слов

Удаление стоп-слов

Стоп-слова — это распространенные слова, например «и», «в» и «на», которые часто не несут существенного смысла. Их удаление может упростить анализ текста:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Проблемы предварительной обработки текста

Проблемы предварительной обработки текста

Предварительная обработка текста может быть сложной по следующим причинам:

  • Неоднозначность: такие слова, как «ключ», могут иметь несколько значений.
  • Контекст: для лемматизации необходимо понимать контекст слова.
  • Языковая вариативность: необходимость работать с разными языками и диалектами.

Итоги и следующие шаги

Итоги и следующие шаги

На этом уроке мы:

  • Изучили токенизацию и нормализацию.
  • Рассмотрели такие методы, как стемминг, лемматизация и удаление стоп-слов.
  • Потренировались выполнять предварительную обработку текста с помощью Python.

Далее мы проанализируем закономерности текста с помощью моделей N-грамм.

Токенизация и нормализация — иллюстрация 10

Часто задаваемые вопросы

Урок «Токенизация и нормализация» бесплатный?

Да — полный текст урока «Токенизация и нормализация» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 5 уроков всего.

Чему я научусь в уроке «Токенизация и нормализация»?

Методы предварительной обработки текста Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Python Academy?

Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 5.

Сколько времени занимает урок «Токенизация и нормализация»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Python Academy?

Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Работа с текстовыми данными
  2. Токенизация и нормализация
  3. N-граммные модели
  4. Основы анализа тональности
  5. Модели на основе трансформеров
← Назад к Python Academy