0Pricing
Python For Kids · レッスン

データのクリーニングと前処理

欠損データの扱い、重複の削除、分析に向けた生データの前処理を学びます。

「データのクリーニングと前処理」はCoddyKit上の無料Python For Kidsレッスンです。 これはレッスン4/5です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはPython For Kids学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 Python For Kidsコースには全5レッスンが含まれています。

データクリーニングの概要

データクリーニングと前処理

生データは整理されていないことが多く、分析する前にクリーニングと前処理が必要です。これらの手順は、分析の品質と正確性を確保するうえで重要です。

このレッスンでは、欠損データの扱い、重複データの削除、分析に向けたデータの前処理の手法を学びます。

データのクリーニングと前処理 — イラスト1

データクリーニングとは?

データクリーニングでは、データセット内のエラーを特定して修正します。一般的なタスクには、次のようなものがあります。

  • 欠損値の処理
  • 重複の削除
  • 形式の標準化

欠損データの処理

欠損データはさまざまな理由で発生します。次の方法で処理できます。

  • 欠損値をデフォルト値、平均値、または中央値で補完します。
  • 欠損値が多すぎる行または列を削除します。
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

重複の削除

重複データは分析結果に偏りを生じさせる可能性があります。Pandasを使って重複を削除します。

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

データの標準化

データを標準化すると、一貫性を確保できます。たとえば、日付形式やテキストの大文字・小文字を統一できます。

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

データの変換

スケーリングやエンコーディングなどの変換は、前処理の一部です。

  • スケーリング: 数値を標準化します。
  • エンコーディング: カテゴリデータを数値形式に変換します。
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

データのスケーリング

スケーリングにより数値データの尺度をそろえます。これは機械学習アルゴリズムに不可欠です。

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

データの検証

検証により、データが品質基準を満たしていることを確認します。たとえば、外れ値や無効な値がないかを確認します。

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

データクリーニングでよくある間違い

次のような間違いを避けてください。

  • 欠損データを無視し、不正確な分析につながる。
  • 形式を標準化せず、不整合を引き起こす。
  • 検証を怠り、後続の処理でエラーにつながる。

学んだこと

このレッスンでは、次のことを学びました。

  • 欠損データを処理し、重複を削除する方法。
  • 分析のためにデータを標準化、変換、スケーリングする方法。
  • データ品質を検証し、外れ値を特定する方法。
  • 正確な分析におけるデータクリーニングの重要性。

よくできました。次のトピックに進みましょう。

データのクリーニングと前処理 — イラスト11

よくある質問

「データのクリーニングと前処理」レッスンは無料ですか?

はい。「データのクリーニングと前処理」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、Python For Kidsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 Python For Kidsコースには全5レッスンが含まれています。

「データのクリーニングと前処理」で何を学びますか?

欠損データの扱い、重複の削除、分析に向けた生データの前処理を学びます。 ブラウザで直接実行するハンズオンコードでPython For Kidsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

Python For Kidsを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのPython For Kidsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/5です。

「データのクリーニングと前処理」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このPython For Kidsレッスンでコードを書いて実行できますか?

はい。すべてのPython For Kidsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. データサイエンスとは
  2. データサイエンスにおける Python の役割
  3. データサイエンスのためのデータ構造
  4. データのクリーニングと前処理
  5. 探索的データ分析(EDA)
← Python For Kidsに戻る