Python Academy · Oppitunti

Datan puhdistus ja esikäsittely

Ymmärtäkää, miten puuttuvia tietoja käsitellään, kaksoiskappaleet poistetaan ja raakadata esikäsitellään analyysia varten.

Oppitunti 4/511 vaihetta

Datan puhdistus ja esikäsittely on ilmainen Python Academy-oppitunti CoddyKitissä. Tämä on oppitunti 4/5. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Python Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Python Academy-kurssilla on yhteensä 5 oppituntia.

Datan puhdistuksen yleiskatsaus

Datan puhdistus ja esikäsittely

Raakadata on usein epäsiistiä, ja se on puhdistettava ja esikäsiteltävä ennen analysointia. Nämä vaiheet ovat ratkaisevan tärkeitä analyysin laadun ja tarkkuuden varmistamiseksi.

Tässä oppitunnissa opitte tekniikoita puuttuvan datan käsittelyyn, kaksoiskappaleiden poistamiseen ja datan esikäsittelyyn analyysia varten.

Datan puhdistus ja esikäsittely — kuvitus 1

Mitä datan puhdistus on?

Datan puhdistuksessa tunnistetaan data-aineiston virheet ja korjataan ne. Yleisiä tehtäviä ovat:

  • Puuttuvien arvojen käsittely.
  • Kaksoiskappaleiden poistaminen.
  • Muotojen yhdenmukaistaminen.

Puuttuvan datan käsittely

Dataa voi puuttua monista eri syistä. Voitte käsitellä puuttuvaa dataa seuraavasti:

  • Täyttäkää puuttuvat arvot oletusarvolla tai keskiarvolla/ mediaanilla.
  • Poistakaa rivit tai sarakkeet, joissa on liikaa puuttuvia arvoja.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Kaksoiskappaleiden poistaminen

Kaksoiskappaleet voivat vääristää analyysia. Poistakaa kaksoiskappaleet Pandas-kirjaston avulla:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Datan yhdenmukaistaminen

Datan yhdenmukaistaminen varmistaa yhtenäisyyden. Voitte esimerkiksi yhdenmukaistaa päivämäärämuodot tai tekstin kirjainkoon:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Datan muuntaminen

Muunnokset, kuten skaalaus ja koodaus, ovat osa esikäsittelyä:

  • Skaalaus: Numeeristen arvojen yhdenmukaistaminen.
  • Koodaus: Kategorisen datan muuntaminen numeeriseen muotoon.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Datan skaalaus

Skaalauksella varmistetaan, että numeerinen data on samalla asteikolla, mikä on olennaista koneoppimisalgoritmeille:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Datan validointi

Validointi varmistaa, että data täyttää laatuvaatimukset. Tarkistakaa esimerkiksi poikkeavat havainnot tai virheelliset arvot:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Yleisiä virheitä datan puhdistuksessa

Välttäkää seuraavia virheitä:

  • Puuttuvien tietojen huomiotta jättäminen, mikä johtaa epätarkkaan analyysiin.
  • Muotojen yhdenmukaistamatta jättäminen, mikä aiheuttaa epäjohdonmukaisuuksia.
  • Validoinnin laiminlyönti, mikä johtaa virheisiin myöhemmissä tehtävissä.

Mitä opitte?

Tässä oppitunnissa opitte:

  • Miten puuttuvia tietoja käsitellään ja kaksoiskappaleet poistetaan.
  • Miten data yhdenmukaistetaan, muunnetaan ja skaalataan analyysia varten.
  • Miten datan laatu validoidaan ja poikkeavat havainnot tunnistetaan.
  • Miksi datan puhdistaminen on tärkeää tarkan analyysin kannalta.

Hienoa työtä! Siirrytään seuraavaan aiheeseen.

Datan puhdistus ja esikäsittely — kuvitus 11
Aloita maksutta

Opi Python tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
76
Oppitunnit
320

Usein kysytyt kysymykset

Onko oppitunti ”Datan puhdistus ja esikäsittely” ilmainen?

Kyllä – oppitunnin ”Datan puhdistus ja esikäsittely” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Python Academy-kurssin, päivitä CoddyKit PROhon. Python Academy-kurssilla on yhteensä 5 oppituntia.

Mitä opin oppitunnilla ”Datan puhdistus ja esikäsittely”?

Ymmärtäkää, miten puuttuvia tietoja käsitellään, kaksoiskappaleet poistetaan ja raakadata esikäsitellään analyysia varten. Harjoittelet Python Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Python Academy-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Python Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 4/5.

Kuinka kauan ”Datan puhdistus ja esikäsittely”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Python Academy-oppitunnilla?

Kyllä. Jokainen Python Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. Mitä datatiede on?
  2. Pythonin rooli datatieteessä
  3. Datatieteen tietorakenteet
  4. Datan puhdistus ja esikäsittely
  5. Eksploratiivinen data-analyysi (EDA)
← Takaisin: Python Academy