0Pricing
Python Academy · Lekcja

Czyszczenie i wstępne przetwarzanie danych

Poznaj sposoby obsługi brakujących danych, usuwania duplikatów i wstępnego przetwarzania surowych danych do analizy

Czyszczenie i wstępne przetwarzanie danych to bezpłatna lekcja Python Academy na CoddyKit. To lekcja 4 z 5. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Python Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Python Academy zawiera 5 lekcji w sumie.

Wprowadzenie do czyszczenia danych

Czyszczenie i wstępne przetwarzanie danych

Surowe dane często są nieuporządkowane i wymagają czyszczenia oraz wstępnego przetworzenia, zanim będzie można je przeanalizować. Etapy te mają kluczowe znaczenie dla zapewnienia jakości i dokładności analizy.

W tej lekcji poznają Państwo techniki obsługi brakujących danych, usuwania duplikatów i wstępnego przetwarzania danych przed analizą.

Czyszczenie i wstępne przetwarzanie danych — ilustracja 1

Na czym polega czyszczenie danych?

Na czym polega czyszczenie danych?

Czyszczenie danych polega na identyfikowaniu i naprawianiu błędów w zbiorze danych. Typowe zadania obejmują:

  • Obsługę brakujących wartości.
  • Usuwanie duplikatów.
  • Standaryzowanie formatów.

Obsługa brakujących danych

Obsługa brakujących danych

Brakujące dane mogą pojawiać się z różnych powodów. Można je obsługiwać poprzez:

  • Uzupełnianie brakujących wartości wartością domyślną, średnią lub medianą.
  • Usuwanie wierszy lub kolumn, w których brakuje zbyt wielu wartości.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Usuwanie duplikatów

Usuwanie duplikatów

Duplikaty danych mogą zniekształcać wyniki analizy. Do ich usuwania należy używać Pandas:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Standaryzowanie danych

Standaryzowanie danych

Standaryzacja danych zapewnia spójność. Można na przykład ujednolicić formaty dat lub wielkość liter w tekście:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Przekształcanie danych

Przekształcanie danych

Skalowanie i kodowanie to przykłady przekształceń stosowanych podczas wstępnego przetwarzania:

  • Skalowanie: Standaryzowanie wartości liczbowych.
  • Kodowanie: Przekształcanie danych kategorycznych do postaci liczbowej.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Skalowanie danych

Skalowanie danych

Skalowanie zapewnia, że dane numeryczne są przedstawione w tej samej skali, co ma kluczowe znaczenie dla algorytmów uczenia maszynowego:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Walidacja danych

Walidacja danych

Walidacja zapewnia, że dane spełniają standardy jakości. Należy na przykład sprawdzić, czy nie zawierają wartości odstających lub nieprawidłowych:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Częste błędy podczas czyszczenia danych

Częste błędy podczas czyszczenia danych

Oto kilka błędów, których należy unikać:

  • Ignorowanie brakujących danych, co prowadzi do niedokładnej analizy.
  • Nieujednolicanie formatów, co powoduje niespójności.
  • Pomijanie walidacji, co prowadzi do błędów w kolejnych etapach przetwarzania.

Czego się nauczyliśmy?

Czego się nauczyliśmy?

W tej lekcji nauczyli się Państwo:

  • Jak obsługiwać brakujące dane i usuwać duplikaty.
  • Jak standaryzować, przekształcać i skalować dane na potrzeby analizy.
  • Jak weryfikować jakość danych i identyfikować wartości odstające.
  • Jakie znaczenie ma czyszczenie danych dla dokładnej analizy.

Świetnie! Przejdźmy do kolejnego tematu.

Czyszczenie i wstępne przetwarzanie danych — ilustracja 11

Często zadawane pytania

Czy lekcja „Czyszczenie i wstępne przetwarzanie danych” jest bezpłatna?

Tak — pełny tekst „Czyszczenie i wstępne przetwarzanie danych” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Python Academy, przejdź na CoddyKit PRO. Kurs Python Academy zawiera 5 lekcji w sumie.

Co nauczysz się w „Czyszczenie i wstępne przetwarzanie danych”?

Poznaj sposoby obsługi brakujących danych, usuwania duplikatów i wstępnego przetwarzania surowych danych do analizy Ćwiczysz Python Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Python Academy?

Nie wymagamy żadnego doświadczenia. Python Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 5.

Ile czasu zajmuje lekcja „Czyszczenie i wstępne przetwarzanie danych”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Python Academy?

Tak. Każda lekcja Python Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Czym jest data science?
  2. Rola Pythona w data science
  3. Struktury danych w data science
  4. Czyszczenie i wstępne przetwarzanie danych
  5. Eksploracyjna analiza danych (EDA)
← Powrót do Python Academy