train_test_split oikein tehtynä
Stratify, random_state ja suhteet
train_test_split oikein tehtynä on ilmainen Data Science Academy-oppitunti CoddyKitissä. Tämä on oppitunti 2/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Data Science Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Data Science Academy-kurssilla on yhteensä 4 oppituntia.
Yksi apufunktio, kaksi joukkoa
Funktio train_test_split ottaa piirteenne ja kohteenne ja palauttaa opetus- ja testiosat yhdellä selkeällä kutsulla.
from sklearn.model_selection import train_test_splitNeljä asiaa palautuu
Se palauttaa neljä objektia kiinteässä järjestyksessä: opetuspiirteet, testipiirteet, opetuskohteen ja testikohteen. Purkakaa ne huolellisesti, jotta kukin päätyy oikeaan muuttujaan.
X_train, X_test, y_train, y_test = train_test_split(X, y)Määrittäkää testikoko
Valitkaa test_size-parametrilla, kuinka paljon dataa varataan testaukseen. Arvo 0.2 tarkoittaa, että 20 prosenttia menee testijoukkoon.
train_test_split(X, y, test_size=0.2)Sekoittaminen oletusarvoisesti
Rivit sekoitetaan oletusarvoisesti ennen jakoa. Näin tiedostossa mahdollisesti oleva piilossa oleva järjestys ei vääristä kumpaakaan joukkoa.
Tehkää tuloksesta toistettava
Antakaa random_state-parametrille arvo, joka lukitsee sekoituksen. Sama luku tuottaa saman jaon jokaisella ajokerralla, joten tulokset ovat toistettavissa. 🔁
train_test_split(X, y, test_size=0.2, random_state=42)Miksi toistettavuus on tärkeää
Ilman kiinteää siementä jokainen suoritus sekoittaa rivit uudelleen ja tulokset vaihtelevat. Lukittu random_state antaa työtovereillenne mahdollisuuden toistaa täsmälleen samat luvut.
Epätasapainon ongelma
Jos jokin luokka on harvinainen, tavallinen satunnaisjako saattaa sijoittaa suurimman osan siitä yhteen joukkoon. Tällöin opetus- ja testijoukko eivät enää kuvaa samaa luokkatasapainoa.
Stratifiointi apuun
Antakaa stratify-parametrille kohteenne, jotta molemmissa joukoissa säilyvät samat luokkien osuudet. Tämä on olennaista luokittelussa, kun luokat ovat epätasaisia.
train_test_split(X, y, test_size=0.2, stratify=y, random_state=42)Pitäkää X ja y kohdistettuina
Jako pitää kunkin rivin piirteet ja tunnisteen yhdessä. Rivin 7 piirteet kulkevat aina rivin 7 tunnisteen kanssa, eivätkä ne sekoitu erilleen.
Suhteen valitseminen
Yleisiä jakoja ovat 80/20 ja 70/30. Kun dataa on paljon, voitte varata pienemmän testiosan; kun dataa on vähän, antakaa testijoukolle hieman enemmän.
Jakakaa ennen kuin käsittelette dataa
Tehkää jako ensin, ennen skaalausta tai puuttuvien arvojen täyttämistä. Jos esikäsittelette koko joukon, testitietoa vuotaa takaisin opetukseen.
Pikatarkistus
Kohdeluokkasi ovat hyvin epätasapainossa. Mikä argumentti auttaa?
Kertaus
Purkaa neljä osaa, määrittäkää test_size, kiinnittäkää random_state toistettavuuden varmistamiseksi ja käyttäkää stratify-parametria, kun luokat ovat epätasaisia. Jakakaa ensin, esikäsitelkää myöhemmin. 🔁
Opi Python tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 30
- Oppitunnit
- 120
Usein kysytyt kysymykset
Onko oppitunti ”train_test_split oikein tehtynä” ilmainen?
Kyllä – oppitunnin ”train_test_split oikein tehtynä” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Data Science Academy-kurssin, päivitä CoddyKit PROhon. Data Science Academy-kurssilla on yhteensä 4 oppituntia.
Mitä opin oppitunnilla ”train_test_split oikein tehtynä”?
Stratify, random_state ja suhteet Harjoittelet Data Science Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni Data Science Academy-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin Data Science Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 2/4.
Kuinka kauan ”train_test_split oikein tehtynä”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä Data Science Academy-oppitunnilla?
Kyllä. Jokainen Data Science Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- Miksi testijoukko pidetään erillään
- train_test_split oikein tehtynä
- K-kertainen ristiinvalidointi
- Estä datavuoto ennen sen alkamista