Очистка и предварительная обработка данных
Разберитесь, как обрабатывать пропущенные данные, удалять дубликаты и подготавливать исходные данные к анализу
«Очистка и предварительная обработка данных» — бесплатный урок Python Academy на CoddyKit. Это урок 4 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 5 уроков всего.
Обзор очистки данных
Очистка и предварительная обработка данных
Необработанные данные часто бывают неструктурированными и требуют очистки и предварительной обработки перед анализом. Эти этапы необходимы для обеспечения качества и точности Вашего анализа.
В этом уроке Вы изучите методы обработки пропущенных данных, удаления дубликатов и предварительной обработки данных перед анализом.

Что такое очистка данных?
Что такое очистка данных?
Очистка данных включает выявление и исправление ошибок в наборе данных. К распространённым задачам относятся:
- обработка пропущенных значений;
- удаление дубликатов;
- приведение форматов к единому виду.
Обработка пропущенных данных
Обработка пропущенных данных
Пропущенные данные могут появляться по разным причинам. Их можно обрабатывать следующим образом:
- заполнять пропущенные значения значением по умолчанию, mean или медианой;
- удалять строки или столбцы, содержащие слишком много пропущенных значений.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Удаление дубликатов
Удаление дубликатов
Дублирующиеся данные могут исказить результаты анализа. Используйте Pandas, чтобы удалить дубликаты:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Приведение данных к единому виду
Приведение данных к единому виду
Стандартизация данных обеспечивает согласованность. Например, можно привести к единому виду форматы дат или регистр текста:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Преобразование данных
Преобразование данных
Масштабирование и кодирование относятся к предварительной обработке:
- Масштабирование: приведение числовых значений к единому масштабу.
- Кодирование: преобразование категориальных данных в числовую форму.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Масштабирование данных
Масштабирование данных
Масштабирование позволяет привести числовые данные к одному масштабу, что крайне важно для алгоритмов машинного обучения:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Проверка данных
Проверка данных
Проверка позволяет убедиться, что данные соответствуют стандартам качества. Например, проверьте наличие выбросов или недопустимых значений:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Распространённые ошибки при очистке данных
Распространённые ошибки при очистке данных
Вот некоторых ошибок, которых следует избегать:
- Игнорирование пропущенных данных, что приводит к неточному анализу.
- Отсутствие стандартизации форматов, вызывающее несогласованность данных.
- Недостаточная проверка данных, что приводит к ошибкам в последующих задачах.
Что мы узнали
Что мы узнали
В этом уроке Вы узнали:
- Как обрабатывать пропущенные данные и удалять дубликаты.
- Как стандартизировать, преобразовывать и масштабировать данные для анализа.
- Как проверять качество данных и выявлять выбросы.
- О важности очистки данных для точного анализа.
Отличная работа! Перейдём к следующей теме.

Часто задаваемые вопросы
Урок «Очистка и предварительная обработка данных» бесплатный?
Да — полный текст урока «Очистка и предварительная обработка данных» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 5 уроков всего.
Чему я научусь в уроке «Очистка и предварительная обработка данных»?
Разберитесь, как обрабатывать пропущенные данные, удалять дубликаты и подготавливать исходные данные к анализу Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Python Academy?
Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 5.
Сколько времени занимает урок «Очистка и предварительная обработка данных»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Python Academy?
Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Что такое наука о данных
- Роль Python в науке о данных
- Структуры данных для науки о данных
- Очистка и предварительная обработка данных
- Разведочный анализ данных (EDA)