Datan puhdistus ja esikäsittely
Ymmärtäkää, miten puuttuvia tietoja käsitellään, kaksoiskappaleet poistetaan ja raakadata esikäsitellään analyysia varten.
Datan puhdistus ja esikäsittely on ilmainen Python Academy-oppitunti CoddyKitissä. Tämä on oppitunti 4/5. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Python Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Python Academy-kurssilla on yhteensä 5 oppituntia.
Datan puhdistuksen yleiskatsaus
Datan puhdistus ja esikäsittely
Raakadata on usein epäsiistiä, ja se on puhdistettava ja esikäsiteltävä ennen analysointia. Nämä vaiheet ovat ratkaisevan tärkeitä analyysin laadun ja tarkkuuden varmistamiseksi.
Tässä oppitunnissa opitte tekniikoita puuttuvan datan käsittelyyn, kaksoiskappaleiden poistamiseen ja datan esikäsittelyyn analyysia varten.

Mitä datan puhdistus on?
Datan puhdistuksessa tunnistetaan data-aineiston virheet ja korjataan ne. Yleisiä tehtäviä ovat:
- Puuttuvien arvojen käsittely.
- Kaksoiskappaleiden poistaminen.
- Muotojen yhdenmukaistaminen.
Puuttuvan datan käsittely
Dataa voi puuttua monista eri syistä. Voitte käsitellä puuttuvaa dataa seuraavasti:
- Täyttäkää puuttuvat arvot oletusarvolla tai keskiarvolla/ mediaanilla.
- Poistakaa rivit tai sarakkeet, joissa on liikaa puuttuvia arvoja.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Kaksoiskappaleiden poistaminen
Kaksoiskappaleet voivat vääristää analyysia. Poistakaa kaksoiskappaleet Pandas-kirjaston avulla:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Datan yhdenmukaistaminen
Datan yhdenmukaistaminen varmistaa yhtenäisyyden. Voitte esimerkiksi yhdenmukaistaa päivämäärämuodot tai tekstin kirjainkoon:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Datan muuntaminen
Muunnokset, kuten skaalaus ja koodaus, ovat osa esikäsittelyä:
- Skaalaus: Numeeristen arvojen yhdenmukaistaminen.
- Koodaus: Kategorisen datan muuntaminen numeeriseen muotoon.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Datan skaalaus
Skaalauksella varmistetaan, että numeerinen data on samalla asteikolla, mikä on olennaista koneoppimisalgoritmeille:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Datan validointi
Validointi varmistaa, että data täyttää laatuvaatimukset. Tarkistakaa esimerkiksi poikkeavat havainnot tai virheelliset arvot:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Yleisiä virheitä datan puhdistuksessa
Välttäkää seuraavia virheitä:
- Puuttuvien tietojen huomiotta jättäminen, mikä johtaa epätarkkaan analyysiin.
- Muotojen yhdenmukaistamatta jättäminen, mikä aiheuttaa epäjohdonmukaisuuksia.
- Validoinnin laiminlyönti, mikä johtaa virheisiin myöhemmissä tehtävissä.
Mitä opitte?
Tässä oppitunnissa opitte:
- Miten puuttuvia tietoja käsitellään ja kaksoiskappaleet poistetaan.
- Miten data yhdenmukaistetaan, muunnetaan ja skaalataan analyysia varten.
- Miten datan laatu validoidaan ja poikkeavat havainnot tunnistetaan.
- Miksi datan puhdistaminen on tärkeää tarkan analyysin kannalta.
Hienoa työtä! Siirrytään seuraavaan aiheeseen.

Opi Python tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 76
- Oppitunnit
- 320
Usein kysytyt kysymykset
Onko oppitunti ”Datan puhdistus ja esikäsittely” ilmainen?
Kyllä – oppitunnin ”Datan puhdistus ja esikäsittely” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Python Academy-kurssin, päivitä CoddyKit PROhon. Python Academy-kurssilla on yhteensä 5 oppituntia.
Mitä opin oppitunnilla ”Datan puhdistus ja esikäsittely”?
Ymmärtäkää, miten puuttuvia tietoja käsitellään, kaksoiskappaleet poistetaan ja raakadata esikäsitellään analyysia varten. Harjoittelet Python Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni Python Academy-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin Python Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 4/5.
Kuinka kauan ”Datan puhdistus ja esikäsittely”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä Python Academy-oppitunnilla?
Kyllä. Jokainen Python Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- Mitä datatiede on?
- Pythonin rooli datatieteessä
- Datatieteen tietorakenteet
- Datan puhdistus ja esikäsittely
- Eksploratiivinen data-analyysi (EDA)