Очистка и предварительная обработка данных
Разберитесь, как обрабатывать пропущенные данные, удалять дубликаты и подготавливать исходные данные к анализу
«Очистка и предварительная обработка данных» — бесплатный урок Python For Kids на CoddyKit. Это урок 4 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python For Kids, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python For Kids содержит 5 уроков всего.
Обзор очистки данных
Очистка и предварительная обработка данных
Необработанные данные часто содержат много несоответствий, поэтому перед анализом их необходимо очистить и предварительно обработать. Эти шаги крайне важны для обеспечения качества и точности анализа.
В этом уроке Вы изучите методы работы с пропущенными данными, удаления дубликатов и предварительной обработки данных для анализа.

Что такое очистка данных
Очистка данных включает выявление и исправление ошибок в наборе данных. К распространённым задачам относятся:
- обработка пропущенных значений;
- удаление дубликатов;
- приведение форматов к единому виду.
Работа с пропущенными данными
Пропущенные данные могут появляться по разным причинам. С ними можно работать следующим образом:
- Заполнить пропущенные значения значением по умолчанию или средним/медианным значением.
- Удалить строки или столбцы, в которых слишком много пропущенных значений.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Удаление дубликатов
Дубликаты данных могут исказить результаты анализа. Используйте Pandas, чтобы удалить дубликаты:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Стандартизация данных
Стандартизация данных обеспечивает согласованность. Например, можно привести к единому виду форматы дат или регистр текста:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Преобразование данных
Преобразования, такие как масштабирование и кодирование, являются частью предварительной обработки:
- Масштабирование: приведение числовых значений к единому масштабу.
- Кодирование: преобразование категориальных данных в числовую форму.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Масштабирование данных
Масштабирование приводит числовые данные к единому масштабу, что необходимо для алгоритмов машинного обучения:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Проверка данных
Проверка гарантирует, что данные соответствуют стандартам качества. Например, проверьте наличие выбросов или недопустимых значений:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Распространённые ошибки при очистке данных
Вот каких ошибок следует избегать:
- Игнорирование пропущенных данных, что приводит к неточному анализу.
- Отсутствие стандартизации форматов, вызывающее несогласованность данных.
- Пренебрежение проверкой, что приводит к ошибкам на последующих этапах.
Что мы узнали?
В этом уроке Вы узнали:
- Как работать с пропущенными данными и удалять дубликаты.
- Как стандартизировать, преобразовывать и масштабировать данные для анализа.
- Как проверять качество данных и выявлять выбросы.
- Почему очистка данных важна для точного анализа.
Отличная работа! Перейдём к следующей теме.

Часто задаваемые вопросы
Урок «Очистка и предварительная обработка данных» бесплатный?
Да — полный текст урока «Очистка и предварительная обработка данных» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python For Kids, подпишись на CoddyKit PRO. Курс Python For Kids содержит 5 уроков всего.
Чему я научусь в уроке «Очистка и предварительная обработка данных»?
Разберитесь, как обрабатывать пропущенные данные, удалять дубликаты и подготавливать исходные данные к анализу Ты практикуешь Python For Kids с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Python For Kids?
Предыдущий опыт не требуется. Python For Kids на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 5.
Сколько времени занимает урок «Очистка и предварительная обработка данных»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Python For Kids?
Да. Каждый урок Python For Kids включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Что такое Data Science
- Роль Python в Data Science
- Структуры данных для Data Science
- Очистка и предварительная обработка данных
- Исследовательский анализ данных (EDA)