Usuwać czy uzupełniać: mądry wybór
Kiedy usuwać dane, a kiedy je imputować
Usuwać czy uzupełniać: mądry wybór to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Dwie drogi przy brakujących danych
Gdy pojawiają się brakujące dane, trzeba podjąć ważną decyzję: usunąć dotknięte nimi wiersze czy je uzupełnić. Właściwy wybór zależy od tego, ile danych utracą Państwo w każdym przypadku. 🛣️
Usuwanie wierszy
Metoda dropna() usuwa każdy wiersz zawierający co najmniej jedną brakującą wartość. To proste i przejrzyste rozwiązanie, ale może po cichu usunąć dużą część danych.
clean = df.dropna()Zamiast tego usuwanie kolumn
Jeśli jedna kolumna jest w większości pusta, można usunąć całą kolumnę za pomocą axis=1. Czasem jedna wadliwa kolumna powoduje więcej szkód niż wiersze, w których występuje.
df.dropna(axis=1)Kiedy usuwanie jest bezpieczne
Usuwanie sprawdza się, gdy braki są rzadkie i rozproszone. Utrata niewielkiej części dużego zbioru danych rzadko zmienia wnioski.
Kiedy usuwanie szkodzi
Jeśli wiele wierszy zawiera choć jeden brak, usuwanie może drastycznie zmniejszyć zbiór danych. Co gorsza, tracone wiersze mogą nie być losowe, co prowadzi do obciążenia wyników.
Uzupełnianie braków
Alternatywą jest uzupełnienie brakujących komórek rozsądną wartością za pomocą fillna(). Zachowują Państwo wszystkie wiersze, ale kosztem wprowadzenia pewnych wymyślonych liczb.
df.fillna(0)Uzupełnienie jest szacunkiem
Warto pamiętać, że każda uzupełniona wartość jest oszacowaniem. Dobre uzupełnienie jest uzasadnione i udokumentowane; nieprzemyślane ukrywa brak i zniekształca statystyki.
Kompromis z parametrem thresh
Za pomocą thresh można zachować wiersze zawierające wystarczającą ilość rzeczywistych danych. Parametr określa minimalną liczbę niebrakujących wartości, które musi zawierać wiersz, aby pozostać w zbiorze.
df.dropna(thresh=3)Wybór jednej kolumny
Użyj subset, aby usuwać wiersze tylko wtedy, gdy brakuje określonej, kluczowej kolumny. Chroni to pozostałe dane przed niepotrzebnym usuwaniem.
df.dropna(subset=['price'])Zapytaj, dlaczego brakuje wartości
Przed podjęciem decyzji należy zastanowić się, dlaczego brakuje danej wartości. Dane brakujące losowo można bezpiecznie uzupełnić, ale systematyczny brak może sam w sobie być istotnym sygnałem.
Prosta praktyczna zasada
Praktyczna wskazówka: należy usuwać, gdy braków jest niewiele, a uzupełniać, gdy wiersze są cenne. Przed podjęciem decyzji zawsze trzeba ocenić, jak każda opcja zmieni Państwa rozkład.
Szybkie sprawdzenie
Kolumna jest pusta w 80%, ale każdy wiersz zawiera przydatne dane w innych miejscach. Jakie rozwiązanie jest zwykle najrozsądniejsze?
Podsumowanie: wybieraj świadomie
Potrafią już Państwo oceniać wybór między usuwaniem a uzupełnianiem na podstawie ilości traconych danych i przyczyny braków. Polecenia dropna, thresh i subset pozwalają usuwać dane z rozwagą.
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Usuwać czy uzupełniać: mądry wybór” jest bezpłatna?
Tak — pełny tekst „Usuwać czy uzupełniać: mądry wybór” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Usuwać czy uzupełniać: mądry wybór”?
Kiedy usuwać dane, a kiedy je imputować Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?
Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Usuwać czy uzupełniać: mądry wybór”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?
Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Wyszukiwanie ukrytych NaN w tabeli
- Usuwać czy uzupełniać: mądry wybór
- Imputacja średnią, medianą lub modą
- Naprawianie dtypes i zduplikowanych wierszy