0Pricing
Data Science Academy · Lekcja

Naprawianie dtypes i zduplikowanych wierszy

Konwersja typów i usuwanie powtórzeń

Naprawianie dtypes i zduplikowanych wierszy to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Czyste dane to coś więcej niż brak luk

Uzupełnianie brakujących wartości to dopiero połowa zadania. Czyste dane wymagają także prawidłowych dtypes i braku przypadkowo zduplikowanych wierszy, które zakłócają wyniki zliczeń. 🧹

Czym jest dtype

Każda kolumna ma dtype, czyli typ danych, taki jak int, float, object lub datetime. Typ dtype określa, jakie operacje można wykonywać na kolumnie.

df.dtypes

Liczby zapisane jako tekst

Częsty problem to liczby wczytane jako tekst typu object, ponieważ do danych wkradł się pojedynczy niepasujący symbol. Dopóki typ nie zostanie poprawiony, nie można wykonywać na nich obliczeń.

Konwersja za pomocą to_numeric

Kolumnę tekstową można przekonwertować na liczby za pomocą to_numeric. Przekazanie errors='coerce' zamienia wszystkie wartości, których nie można przeanalizować, na NaN zamiast powodować błąd.

df['price'] = pd.to_numeric(df['price'], errors='coerce')

Rzutowanie za pomocą astype

Gdy kolumna jest już czysta, astype bezpośrednio zmienia jej typ, na przykład zamieniając liczby zmiennoprzecinkowe reprezentujące liczby całkowite z powrotem na zwarte liczby całkowite.

df['count'] = df['count'].astype(int)

Naprawianie kolumn z datami

Daty często są wczytywane jako tekst. Należy przekonwertować je za pomocą to_datetime, aby później móc je sortować, filtrować według zakresu i wyodrębniać z nich takie części jak miesiąc.

df['date'] = pd.to_datetime(df['date'])

Category oszczędza pamięć

Kolumny zawierające niewiele powtarzających się wartości tekstowych stają się znacznie mniejsze po zmianie na typ category, który przechowuje każdą etykietę tylko raz i odwołuje się do niej.

df['city'] = df['city'].astype('category')

Wykrywanie zduplikowanych wierszy

Powtarzające się rekordy zawyżają sumy i średnie. Można je znaleźć za pomocą duplicated(), które oznacza wartością True każdy wiersz występujący wcześniej.

df.duplicated().sum()

Usuwanie duplikatów

Powtórzenia można usunąć za pomocą drop_duplicates(). Domyślnie metoda zachowuje pierwsze wystąpienie każdego wiersza i odrzuca pozostałe.

df = df.drop_duplicates()

Duplikaty według kluczowych kolumn

Czasem duplikat definiują tylko określone kolumny. Przekaż subset, aby wykrywać powtórzenia na podstawie klucza, takiego jak id, z pominięciem pozostałych kolumn.

df.drop_duplicates(subset=['user_id'])

Sprawdź przed przejściem dalej

Po poprawieniu typów i usunięciu powtórzeń uruchom ponownie info(). Sprawdzenie typów dtype i liczby wierszy chroni przed przedostaniem się błędów czyszczenia do dalszych etapów.

df.info()

Szybkie sprawdzenie

Kolumna cen została wczytana jako tekst typu object. Które wywołanie bezpiecznie zamieni nieprawidłowe wpisy na NaN?

Podsumowanie: typy i duplikaty pod kontrolą

Potrafią już Państwo poprawiać dtypes za pomocą to_numeric, astype i to_datetime oraz usuwać powtórzenia za pomocą drop_duplicates. Tabela jest wreszcie gotowa do analizy.

Często zadawane pytania

Czy lekcja „Naprawianie dtypes i zduplikowanych wierszy” jest bezpłatna?

Tak — pełny tekst „Naprawianie dtypes i zduplikowanych wierszy” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Naprawianie dtypes i zduplikowanych wierszy”?

Konwersja typów i usuwanie powtórzeń Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?

Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Naprawianie dtypes i zduplikowanych wierszy”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?

Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Wyszukiwanie ukrytych NaN w tabeli
  2. Usuwać czy uzupełniać: mądry wybór
  3. Imputacja średnią, medianą lub modą
  4. Naprawianie dtypes i zduplikowanych wierszy
← Powrót do Data Science Academy