Извлечение признаков из данных
Основы конструирования признаков
«Извлечение признаков из данных» — бесплатный урок Python Academy на CoddyKit. Это урок 5 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 5 уроков всего.
Извлечение признаков из данных
Извлечение признаков из данных
Извлечение признаков включает преобразование исходных данных в набор признаков, которые могут использоваться моделями машинного обучения. В этом уроке рассматриваются основы создания признаков и распространённые методы извлечения полезных признаков из данных.

Что такое извлечение признаков?
Что такое извлечение признаков?
Извлечение признаков упрощает исходные данные, выделяя ключевые атрибуты, наиболее важные для анализа. Это уменьшает сложность данных и повышает эффективность модели.
Пример:
- Извлечение
monthиdayиз столбцаdate. - Подсчёт
word countв текстовых данных.
Извлечение признаков из дат
Извлечение признаков из дат
С помощью Pandas из столбца с датами можно получить новые признаки, такие как year, month или day.
Пример:
df['Year'] = pd.to_datetime(df['Date']).dt.yearТекстовые признаки
Текстовые признаки
Для текстовых данных можно извлечь такие признаки, как:
- Количество слов: общее количество слов.
- Количество символов: общее количество символов.
- Уникальные слова: количество уникальных слов.
Пример:
df['WordCount'] = df['Text'].apply(lambda x: len(x.split()))Кодирование категориальных признаков
Кодирование категориальных признаков
Преобразуйте категориальные данные в числовую форму для анализа. Распространённые методы:
- Однократное кодирование: создаёт двоичные столбцы для каждой категории.
- Кодирование метками: присваивает каждой категории уникальное число.
Пример:
from sklearn.preprocessing import OneHotEncoder
encoder = OneHotEncoder()
encoded = encoder.fit_transform(df[['Category']])Масштабирование признаков
Масштабирование признаков
Масштабирование обеспечивает сопоставимый масштаб всех признаков, что крайне важно для многих алгоритмов машинного обучения. Методы включают:
- Стандартизация: масштабирование данных со средним значением 0 и стандартным отклонением 1.
- Масштабирование по методу минимума и максимума: преобразование данных к диапазону [0, 1].
Отбор признаков
Отбор признаков
Отбор признаков включает выбор наиболее важных признаков для модели. Методы включают:
- Корреляционный анализ: выявление признаков с высокой корреляцией.
- Рекурсивное исключение признаков (RFE): последовательное удаление наименее значимых признаков.
Повторение
Повторение
В этом уроке Вы узнали о следующем:
- Извлечение признаков: преобразование исходных данных в полезные признаки.
- Методы: признаки дат, текстовые признаки и кодирование категориальных данных.
- Масштабирование признаков: обеспечение сопоставимого масштаба признаков.
- Отбор признаков: выявление наиболее релевантных признаков.
Поздравляем!
Поздравляем!
Вы завершили урок об извлечении признаков из данных. Перейдите к следующей категории, чтобы глубже изучить более продвинутые концепции ИИ.

Часто задаваемые вопросы
Урок «Извлечение признаков из данных» бесплатный?
Да — полный текст урока «Извлечение признаков из данных» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 5 уроков всего.
Чему я научусь в уроке «Извлечение признаков из данных»?
Основы конструирования признаков Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Python Academy?
Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 5 из 5.
Сколько времени занимает урок «Извлечение признаков из данных»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Python Academy?
Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Типы данных
- Обработка пропущенных данных
- Нормализация данных
- Объединение данных в Python
- Извлечение признаков из данных