Data Science Academy · Oppitunti

Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä

Määritä tyypit oikein jo tuontivaiheessa

Oppitunti 3/413 vaihetta

Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä on ilmainen Data Science Academy-oppitunti CoddyKitissä. Tämä on oppitunti 3/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Data Science Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Data Science Academy-kurssilla on yhteensä 4 oppituntia.

Tyypeillä on merkitystä alusta alkaen

Kun pandas lukee tiedoston, se arvaa jokaisen sarakkeen dtype-tyypin. Kun tyypit ovat oikein jo latausvaiheessa, kaikki myöhemmät vaiheet helpottuvat. 🧱

Päivämäärät tulevat tekstinä

Päivämäärä 2024-03-01 näyttää teistä päivämäärältä, mutta pandas lukee sen tavallisena string-arvona, ellette pyydä muuta.

Päivämäärien jäsentäminen latauksen aikana

parse_dates-valinta muuntaa luetellut sarakkeet oikeiksi datetime-arvoiksi lukemisen aikana, joten erillistä vaihetta ei tarvita.

df = pd.read_csv("sales.csv",
  parse_dates=["order_date"])

Miksi siitä on hyötyä

Kun sarake on oikea datetime, voitte järjestää tiedot ajan mukaan, suodattaa päivämäärävälejä ja poimia kuukauden helposti.

Apua poikkeaviin muotoihin

Epätavallisissa muodoissa välittäkää format-merkkijono, jotta pandas jäsentää nopeasti eikä arvaa päivä- ja kuukausijärjestystä väärin.

df = pd.read_csv("eu.csv",
  parse_dates=["d"], date_format="%d/%m/%Y")

Tiettyjen dtype-tyyppien pakottaminen

dtype-valinnalla voitte ilmoittaa sarakkeen tyypin itse ja ohittaa pandas-arvaukset selkeällä sanakirjalla.

df = pd.read_csv("data.csv",
  dtype={"zip": "string"})

Alkunollien säilyttäminen

Tunnukset kuten 00123 menettävät nollansa, jos ne luetaan lukuina. Kun sarakkeen tyypiksi pakotetaan string, ne säilyvät täsmälleen alkuperäisessä muodossa.

df = pd.read_csv("ids.csv",
  dtype={"product_code": str})

Muistin säästäminen tyyppien avulla

Kokonaislukujen lukeminen int32-tyyppisinä oletusarvoisen int64-tyypin sijaan voi puolittaa suurten tiedostojen muistinkulutuksen. Valitkaa pienin sopiva tyyppi.

df = pd.read_csv("big.csv",
  dtype={"count": "int32"})

Toistuvaa tekstiä? Käyttäkää category-tyyppiä

Sarakkeet, joissa on vain muutama toistuva arvo, kuten tilakenttä, pienenevät huomattavasti, kun ne tallennetaan category-dtype-tyyppinä.

df = pd.read_csv("orders.csv",
  dtype={"status": "category"})

Tarkistaminen lataamisen jälkeen

Varmistakaa tulos aina. dtypes-tarkistus näyttää täsmälleen, minkä tyypin pandas määritti kullekin sarakkeelle, joten yllätykset eivät päädy analyysiin.

print(df.dtypes)

Tyyppien korjaaminen myöhemmin tarvittaessa

Unohtuiko yksi? Voitte muuntaa tyypin jälkikäteen astype-metodilla, mutta latauksen aikana tehtynä se on selkeämpää ja hieman nopeampaa.

df["count"] = df["count"].astype("int32")

Pikatarkistus

Päivämääräsarake latautuu tavallisena tekstinä. Mikä korjaa sen lukemisen aikana?

Kertaus: oikeat tyypit, vähemmän vaivaa

Osaatte nyt jäsentää päivämäärät, pakottaa merkkijono- ja numeeriset tyypit sekä käyttää category-tyyppiä toistuville arvoille jo latauksen aikana. Tarkistakaa dtypes-arvot ja jatkakaa. 🎉

Aloita maksutta

Opi Python tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
30
Oppitunnit
120

Usein kysytyt kysymykset

Onko oppitunti ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä” ilmainen?

Kyllä – oppitunnin ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Data Science Academy-kurssin, päivitä CoddyKit PROhon. Data Science Academy-kurssilla on yhteensä 4 oppituntia.

Mitä opin oppitunnilla ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä”?

Määritä tyypit oikein jo tuontivaiheessa Harjoittelet Data Science Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Data Science Academy-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Data Science Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 3/4.

Kuinka kauan ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Data Science Academy-oppitunnilla?

Kyllä. Jokainen Data Science Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. read_csv ja sen hyödylliset valinnat
  2. Avaa Excel-taulukot pandasissa
  3. Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä
  4. Tallenna tulokset CSV- ja Excel-tiedostoihin
← Takaisin: Data Science Academy