0Pricing
NLP Academy · Урок

Чтение матрицы «документы—термы»

Разберитесь со строками, столбцами и разреженностью

«Чтение матрицы «документы—термы»» — бесплатный урок NLP Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.

Что такое DTM?

Матрица документов и терминов — это таблица подсчётов. Каждая строка представляет документ, а каждый столбец — слово из словаря. 🧮

Строки — это документы

Одна строка содержит полный вектор подсчётов для одного документа и показывает, сколько раз в нём встретилось каждое слово.

Столбцы — это термины

Каждый столбец отслеживает одно слово во всех документах, поэтому при просмотре столбца сверху вниз видно, где встречается это слово.

Ячейка содержит подсчёт

Значение в строке i и столбце j — это количество вхождений слова j в документе i, то есть один подсчёт.

Проверьте размерность

Размерность матрицы показывает, со сколькими документами и уникальными словами Вы работаете.

print(X.shape)  # (n_documents, n_words)

Большинство ячеек содержат нули

Один документ использует лишь небольшую часть из тысяч слов, поэтому матрица в основном состоит из нулей и называется разреженной.

Почему разреженность важна

Хранение только ненулевых значений позволяет размещать огромные матрицы в памяти. Поэтому scikit-learn возвращает разреженный формат.

Добавьте названия столбцов

Объедините массив с названиями признаков, чтобы сделать его понятным. DataFrame превращает необработанные подсчёты в наглядную таблицу.

import pandas as pd
df = pd.DataFrame(X.toarray(), columns=names)

Прочитайте один документ

Посмотрите на одну строку, чтобы увидеть профиль документа: какие слова он использует и как часто. Эта строка — его отпечаток.

Сравнение двух документов

У похожих документов похожие строки. Сравнение векторов позволяет измерить, насколько близки два текста по содержанию.

От матрицы к модели

Эта матрица служит входными данными для классификатора. DTM содержит признаки, а Ваши метки — целевые значения.

Быстрая проверка

Что содержит одна ячейка матрицы документов и терминов?

Повторение: DTM

Вы изучили матрицу документов и терминов: строки представляют документы, столбцы — слова, ячейки — подсчёты, а сама матрица является разреженной. 🎉

Часто задаваемые вопросы

Урок «Чтение матрицы «документы—термы»» бесплатный?

Да — полный текст урока «Чтение матрицы «документы—термы»» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.

Чему я научусь в уроке «Чтение матрицы «документы—термы»»?

Разберитесь со строками, столбцами и разреженностью Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать NLP Academy?

Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Чтение матрицы «документы—термы»»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке NLP Academy?

Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Почему моделям нужны числа, а не слова
  2. Создание словаря
  3. Подсчёт с помощью CountVectorizer
  4. Чтение матрицы «документы—термы»
← Назад к NLP Academy