0Pricing
Python Academy · レッスン

データクリーニングと前処理

欠損データの処理、重複データの削除、分析に向けた生データの前処理方法を学びます。

「データクリーニングと前処理」はCoddyKit上の無料Python Academyレッスンです。 これはレッスン4/5です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはPython Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 Python Academyコースには全5レッスンが含まれています。

データクリーニングの概要

データクリーニングと前処理

生データは不完全なことが多く、分析する前にクリーニングと前処理が必要です。これらの手順は、分析の品質と正確性を確保するために重要です。

このレッスンでは、欠損データの処理、重複の削除、分析に向けたデータの前処理の手法を学びます。

データクリーニングと前処理 — イラスト1

データクリーニングとは

データクリーニングとは

データクリーニングでは、データセット内のエラーを特定して修正します。一般的な作業には、次のようなものがあります。

  • 欠損値を処理する。
  • 重複を削除する。
  • 形式を統一する。

欠損データの処理

欠損データの処理

欠損データはさまざまな理由で発生します。次の方法で処理できます。

  • 欠損値をデフォルト値や平均値・中央値で埋める。
  • 欠損値が多すぎる行や列を削除する。
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

重複の削除

重複の削除

重複データがあると、分析結果に偏りが生じる可能性があります。Pandasを使って重複を削除します。

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

データの標準化

データの標準化

データの標準化によって一貫性を保てます。たとえば、日付形式やテキストの大文字・小文字を統一できます。

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

データの変換

データの変換

スケーリングやエンコーディングなどの変換は、前処理の一部です。

  • スケーリング:数値を標準化します。
  • エンコーディング:カテゴリデータを数値形式に変換します。
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

データのスケーリング

データのスケーリング

スケーリングによって数値データの尺度をそろえます。これは機械学習アルゴリズムにとって不可欠です。

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

データの検証

データの検証

検証によって、データが品質基準を満たしていることを確認します。たとえば、外れ値や無効な値がないかを確認します。

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

データクレンジングでよくある間違い

データクレンジングでよくある間違い

次のような間違いを避けてください。

  • 欠損データを無視すると、分析結果が不正確になります。
  • 形式を標準化しないと、データに不整合が生じます。
  • 検証を見落とすと、後続の処理でエラーが発生します。

何を学びましたか?

何を学びましたか?

このレッスンでは、次のことを学びました。

  • 欠損データを処理し、重複を削除する方法
  • 分析のためにデータを標準化、変換、スケーリングする方法
  • データの品質を検証し、外れ値を特定する方法
  • 正確な分析におけるデータクレンジングの重要性

よくできました。次のトピックに進みましょう。

データクリーニングと前処理 — イラスト11

よくある質問

「データクリーニングと前処理」レッスンは無料ですか?

はい。「データクリーニングと前処理」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、Python Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 Python Academyコースには全5レッスンが含まれています。

「データクリーニングと前処理」で何を学びますか?

欠損データの処理、重複データの削除、分析に向けた生データの前処理方法を学びます。 ブラウザで直接実行するハンズオンコードでPython Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

Python Academyを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのPython Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/5です。

「データクリーニングと前処理」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このPython Academyレッスンでコードを書いて実行できますか?

はい。すべてのPython Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. データサイエンスとは
  2. データサイエンスにおけるPythonの役割
  3. データサイエンスのためのデータ構造
  4. データクリーニングと前処理
  5. 探索的データ分析(EDA)
← Python Academyに戻る