Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä
Määritä tyypit oikein jo tuontivaiheessa
Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä on ilmainen Data Science Academy-oppitunti CoddyKitissä. Tämä on oppitunti 3/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Data Science Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Data Science Academy-kurssilla on yhteensä 4 oppituntia.
Tyypeillä on merkitystä alusta alkaen
Kun pandas lukee tiedoston, se arvaa jokaisen sarakkeen dtype-tyypin. Kun tyypit ovat oikein jo latausvaiheessa, kaikki myöhemmät vaiheet helpottuvat. 🧱
Päivämäärät tulevat tekstinä
Päivämäärä 2024-03-01 näyttää teistä päivämäärältä, mutta pandas lukee sen tavallisena string-arvona, ellette pyydä muuta.
Päivämäärien jäsentäminen latauksen aikana
parse_dates-valinta muuntaa luetellut sarakkeet oikeiksi datetime-arvoiksi lukemisen aikana, joten erillistä vaihetta ei tarvita.
df = pd.read_csv("sales.csv",
parse_dates=["order_date"])Miksi siitä on hyötyä
Kun sarake on oikea datetime, voitte järjestää tiedot ajan mukaan, suodattaa päivämäärävälejä ja poimia kuukauden helposti.
Apua poikkeaviin muotoihin
Epätavallisissa muodoissa välittäkää format-merkkijono, jotta pandas jäsentää nopeasti eikä arvaa päivä- ja kuukausijärjestystä väärin.
df = pd.read_csv("eu.csv",
parse_dates=["d"], date_format="%d/%m/%Y")Tiettyjen dtype-tyyppien pakottaminen
dtype-valinnalla voitte ilmoittaa sarakkeen tyypin itse ja ohittaa pandas-arvaukset selkeällä sanakirjalla.
df = pd.read_csv("data.csv",
dtype={"zip": "string"})Alkunollien säilyttäminen
Tunnukset kuten 00123 menettävät nollansa, jos ne luetaan lukuina. Kun sarakkeen tyypiksi pakotetaan string, ne säilyvät täsmälleen alkuperäisessä muodossa.
df = pd.read_csv("ids.csv",
dtype={"product_code": str})Muistin säästäminen tyyppien avulla
Kokonaislukujen lukeminen int32-tyyppisinä oletusarvoisen int64-tyypin sijaan voi puolittaa suurten tiedostojen muistinkulutuksen. Valitkaa pienin sopiva tyyppi.
df = pd.read_csv("big.csv",
dtype={"count": "int32"})Toistuvaa tekstiä? Käyttäkää category-tyyppiä
Sarakkeet, joissa on vain muutama toistuva arvo, kuten tilakenttä, pienenevät huomattavasti, kun ne tallennetaan category-dtype-tyyppinä.
df = pd.read_csv("orders.csv",
dtype={"status": "category"})Tarkistaminen lataamisen jälkeen
Varmistakaa tulos aina. dtypes-tarkistus näyttää täsmälleen, minkä tyypin pandas määritti kullekin sarakkeelle, joten yllätykset eivät päädy analyysiin.
print(df.dtypes)Tyyppien korjaaminen myöhemmin tarvittaessa
Unohtuiko yksi? Voitte muuntaa tyypin jälkikäteen astype-metodilla, mutta latauksen aikana tehtynä se on selkeämpää ja hieman nopeampaa.
df["count"] = df["count"].astype("int32")Pikatarkistus
Päivämääräsarake latautuu tavallisena tekstinä. Mikä korjaa sen lukemisen aikana?
Kertaus: oikeat tyypit, vähemmän vaivaa
Osaatte nyt jäsentää päivämäärät, pakottaa merkkijono- ja numeeriset tyypit sekä käyttää category-tyyppiä toistuville arvoille jo latauksen aikana. Tarkistakaa dtypes-arvot ja jatkakaa. 🎉
Opi Python tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 30
- Oppitunnit
- 120
Usein kysytyt kysymykset
Onko oppitunti ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä” ilmainen?
Kyllä – oppitunnin ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Data Science Academy-kurssin, päivitä CoddyKit PROhon. Data Science Academy-kurssilla on yhteensä 4 oppituntia.
Mitä opin oppitunnilla ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä”?
Määritä tyypit oikein jo tuontivaiheessa Harjoittelet Data Science Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni Data Science Academy-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin Data Science Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 3/4.
Kuinka kauan ”Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä Data Science Academy-oppitunnilla?
Kyllä. Jokainen Data Science Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- read_csv ja sen hyödylliset valinnat
- Avaa Excel-taulukot pandasissa
- Päivämäärien jäsentäminen ja dtypes-arvojen määrittäminen latauksen yhteydessä
- Tallenna tulokset CSV- ja Excel-tiedostoihin