データクリーニングと前処理
欠損データの処理、重複データの削除、分析に向けた生データの前処理方法を学びます。
「データクリーニングと前処理」はCoddyKit上の無料Python Academyレッスンです。 これはレッスン4/5です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはPython Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 Python Academyコースには全5レッスンが含まれています。
データクリーニングの概要
データクリーニングと前処理
生データは不完全なことが多く、分析する前にクリーニングと前処理が必要です。これらの手順は、分析の品質と正確性を確保するために重要です。
このレッスンでは、欠損データの処理、重複の削除、分析に向けたデータの前処理の手法を学びます。

データクリーニングとは
データクリーニングとは
データクリーニングでは、データセット内のエラーを特定して修正します。一般的な作業には、次のようなものがあります。
- 欠損値を処理する。
- 重複を削除する。
- 形式を統一する。
欠損データの処理
欠損データの処理
欠損データはさまざまな理由で発生します。次の方法で処理できます。
- 欠損値をデフォルト値や平均値・中央値で埋める。
- 欠損値が多すぎる行や列を削除する。
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)重複の削除
重複の削除
重複データがあると、分析結果に偏りが生じる可能性があります。Pandasを使って重複を削除します。
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)データの標準化
データの標準化
データの標準化によって一貫性を保てます。たとえば、日付形式やテキストの大文字・小文字を統一できます。
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)データの変換
データの変換
スケーリングやエンコーディングなどの変換は、前処理の一部です。
- スケーリング:数値を標準化します。
- エンコーディング:カテゴリデータを数値形式に変換します。
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)データのスケーリング
データのスケーリング
スケーリングによって数値データの尺度をそろえます。これは機械学習アルゴリズムにとって不可欠です。
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)データの検証
データの検証
検証によって、データが品質基準を満たしていることを確認します。たとえば、外れ値や無効な値がないかを確認します。
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)データクレンジングでよくある間違い
データクレンジングでよくある間違い
次のような間違いを避けてください。
- 欠損データを無視すると、分析結果が不正確になります。
- 形式を標準化しないと、データに不整合が生じます。
- 検証を見落とすと、後続の処理でエラーが発生します。
何を学びましたか?
何を学びましたか?
このレッスンでは、次のことを学びました。
- 欠損データを処理し、重複を削除する方法
- 分析のためにデータを標準化、変換、スケーリングする方法
- データの品質を検証し、外れ値を特定する方法
- 正確な分析におけるデータクレンジングの重要性
よくできました。次のトピックに進みましょう。

よくある質問
「データクリーニングと前処理」レッスンは無料ですか?
はい。「データクリーニングと前処理」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、Python Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 Python Academyコースには全5レッスンが含まれています。
「データクリーニングと前処理」で何を学びますか?
欠損データの処理、重複データの削除、分析に向けた生データの前処理方法を学びます。 ブラウザで直接実行するハンズオンコードでPython Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
Python Academyを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのPython Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/5です。
「データクリーニングと前処理」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このPython Academyレッスンでコードを書いて実行できますか?
はい。すべてのPython Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。