Создание словаря
Сопоставьте каждому слову фиксированный индекс
«Создание словаря» — бесплатный урок NLP Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Что такое словарь?
Словарь — это полный набор уникальных слов, известных модели. Каждому слову соответствует одна фиксированная позиция в векторе каждого документа. 📖
Соберите все уникальные слова
Чтобы создать словарь, соберите все слова из документов и оставьте только различающиеся, удалив повторы.
words = set("the cat sat the mat".split())Назначьте каждому слову индекс
Отсортируйте уникальные слова и назначьте каждому число. Это отображение слов в индексы — Ваш словарь для поиска.
vocab = {w: i for i, w in enumerate(sorted(words))}Индекс определяет позицию
Индекс указывает, какую позицию слово занимает в каждом векторе, поэтому cat всегда оказывается в одном и том же столбце.
Словарь задаёт длину вектора
Если в словаре 5000 слов, каждый документ превращается в вектор из 5000 чисел, по одной позиции на слово.
Порядок должен оставаться неизменным
После создания отображение нельзя менять. Стабильный порядок гарантирует, что столбец 3 означает одно и то же слово для каждого документа.
Слова вне словаря
Слово, которого нет в словаре, называется словом вне словаря. Проще всего игнорировать его при подсчёте.
Удаление редких слов
Слова, встречающиеся один раз, добавляют шум и увеличивают размер. Удаление очень редких терминов делает словарь меньше и чище.
Удаление очень распространённых слов
Можно также удалить слова, встречающиеся почти в каждом документе. Такие стоп-слова редко помогают отличать документы друг от друга.
Поиск индекса
Когда отображение создано, найти позицию слова можно мгновенно. Просто обратитесь к словарю по нужному слову.
print(vocab["cat"]) # the column index for catСловарь обеспечивает подсчёт
Это отображение — основа векторизации. Далее Вы заполняете каждую позицию количеством вхождений этого слова в документе.
Быстрая проверка
Что обозначает индекс слова?
Повторение: Ваш словарь
Вы создали словарь уникальных слов, сопоставили каждому фиксированный индекс и увидели, как удаление лишних слов делает его компактным и полезным. 🎉
Изучай Python с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 30
- Уроки
- 120
Часто задаваемые вопросы
Урок «Создание словаря» бесплатный?
Да — полный текст урока «Создание словаря» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Создание словаря»?
Сопоставьте каждому слову фиксированный индекс Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Создание словаря»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему моделям нужны числа, а не слова
- Создание словаря
- Подсчёт с помощью CountVectorizer
- Чтение матрицы «документы—термы»