Czyszczenie i wstępne przetwarzanie danych
Dowiedz się, jak obsługiwać brakujące dane, usuwać duplikaty i przygotowywać surowe dane do analizy.
Czyszczenie i wstępne przetwarzanie danych to bezpłatna lekcja Python For Kids na CoddyKit. To lekcja 4 z 5. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Python For Kids, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Python For Kids zawiera 5 lekcji w sumie.
Przegląd czyszczenia danych
Czyszczenie i wstępne przetwarzanie danych
Dane surowe często są nieuporządkowane i przed analizą wymagają oczyszczenia oraz wstępnego przetworzenia. Te kroki mają kluczowe znaczenie dla zapewnienia jakości i dokładności analizy.
W tej lekcji poznasz techniki obsługi brakujących danych, usuwania duplikatów i wstępnego przetwarzania danych na potrzeby analizy.

Czym jest czyszczenie danych?
Czyszczenie danych polega na identyfikowaniu i naprawianiu błędów w zbiorze danych. Typowe zadania obejmują:
- Obsługę brakujących wartości.
- Usuwanie duplikatów.
- Standaryzowanie formatów.
Obsługa brakujących danych
Brakujące dane mogą pojawiać się z różnych powodów. Można je obsłużyć na kilka sposobów:
- Uzupełnienie brakujących wartości wartością domyślną albo średnią lub medianą.
- Usunięcie wierszy lub kolumn zawierających zbyt wiele brakujących wartości.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Usuwanie duplikatów
Zduplikowane dane mogą zniekształcać analizę. Do usuwania duplikatów należy użyć Pandas:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Standaryzacja danych
Standaryzacja danych zapewnia spójność. Można na przykład ujednolicić formaty dat lub wielkość liter w tekście:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Przekształcanie danych
Przekształcenia, takie jak skalowanie i kodowanie, są częścią wstępnego przetwarzania danych:
- Skalowanie: Standaryzowanie wartości liczbowych.
- Kodowanie: Konwertowanie danych kategorialnych do postaci liczbowej.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Skalowanie danych
Skalowanie zapewnia, że dane liczbowe są przedstawione w tej samej skali, co ma kluczowe znaczenie dla algorytmów uczenia maszynowego:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Walidacja danych
Walidacja sprawdza, czy dane spełniają standardy jakości. Należy na przykład sprawdzić, czy nie zawierają wartości odstających lub nieprawidłowych:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Częste błędy podczas czyszczenia danych
Oto błędy, których należy unikać:
- Ignorowanie brakujących danych, co prowadzi do niedokładnej analizy.
- Brak standaryzacji formatów, powodujący niespójności.
- Pomijanie walidacji, co prowadzi do błędów w kolejnych zadaniach.
Czego się nauczyliśmy?
W tej lekcji nauczyli się Państwo:
- Jak obsługiwać brakujące dane i usuwać duplikaty.
- Jak standaryzować, przekształcać i skalować dane na potrzeby analizy.
- Jak sprawdzać jakość danych i identyfikować wartości odstające.
- Jakie znaczenie ma czyszczenie danych dla dokładnej analizy.
Świetna praca! Przejdźmy do następnego tematu.

Często zadawane pytania
Czy lekcja „Czyszczenie i wstępne przetwarzanie danych” jest bezpłatna?
Tak — pełny tekst „Czyszczenie i wstępne przetwarzanie danych” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Python For Kids, przejdź na CoddyKit PRO. Kurs Python For Kids zawiera 5 lekcji w sumie.
Co nauczysz się w „Czyszczenie i wstępne przetwarzanie danych”?
Dowiedz się, jak obsługiwać brakujące dane, usuwać duplikaty i przygotowywać surowe dane do analizy. Ćwiczysz Python For Kids z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Python For Kids?
Nie wymagamy żadnego doświadczenia. Python For Kids w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 5.
Ile czasu zajmuje lekcja „Czyszczenie i wstępne przetwarzanie danych”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Python For Kids?
Tak. Każda lekcja Python For Kids zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Czym jest data science?
- Rola Pythona w data science
- Struktury danych w data science
- Czyszczenie i wstępne przetwarzanie danych
- Eksploracyjna analiza danych (EDA)