NLP Academy · Oppitunti

TF-IDF-ominaisuuksilla kouluttaminen

Sovita luokitin scikit-learnilla

Oppitunti 2/413 vaihetta

TF-IDF-ominaisuuksilla kouluttaminen on ilmainen NLP Academy-oppitunti CoddyKitissä. Tämä on oppitunti 2/4. Voit lukea tästä oppimispolusta kokonaan mitkä tahansa 3 oppituntia ilmaiseksi — sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä käytännön harjoittelun sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppitunti kuuluu NLP Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. NLP Academy-kurssilla on yhteensä 4 oppituntia.

Teksti ensin luvuiksi

Malli ei pysty lukemaan raakalauseita. Muuntakaa dokumentit ensin TF-IDF-vektoreiksi ja kouluttakaa logistinen regressio sitten näillä luvuilla. 🔢

Sovittakaa vektoroija

TfidfVectorizer oppii sanaston ja painotukset harjoitusteksteistä. Yksi kutsu muuttaa merkkijonoluettelon piirrematriisiksi.

from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)

Luokat pidetään erillään

Piirteenne X tulevat tekstistä, mutta luokat y tulevat teiltä. Jokaiselle dokumentille tarvitaan oikea luokka, kuten roskaposti tai muu viesti.

Jakakaa ennen koulutusta

Jättäkää testiaineisto erilleen, jotta voitte arvioida mallia reilusti. train_test_split pitää osan datasta näkymättömissä arvioinnin loppuun asti.

from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)

Fit tarkoittaa oppimista

fit-kutsulla käskette logistista regressiota etsimään sanapainot, jotka erottelevat luokat parhaiten harjoitusdatassa.

from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)

Kasvattakaa max_iter-arvoa varoituksen ilmetessä

Tekstissä on paljon piirteitä, joten ratkaisija saattaa tarvita enemmän vaiheita. max_iter-arvon kasvattaminen poistaa yleisen konvergenssivaroituksen, jonka tulette näkemään.

Ennustakaa uusilla vektoreilla

Luokitellaksenne uutta tekstiä muuntakaa se samalla koulutetulla vektoroijalla ja kutsukaa sitten predict-menetelmää. Älkää koskaan sovittako vektoroijaa uudelleen testidataan.

preds = clf.predict(X_te)

Muunna, älä sovita, testidatalla

Testitekstissä käytetään transform-menetelmää, ei fit_transform-menetelmää. Uudelleensovittaminen vuotaisi testiaineiston tietoja ja kasvattaisi tuloksia huomaamatta.

Tarkistakaa tarkkuus

Nopea score-kutsu antaa erillään pidetyn aineiston tarkkuuden. Se on ensimmäinen merkki siitä, että koulutus todella onnistui.

print(clf.score(X_te, y_te))

Samat vaiheet pysyvät synkronoituina

Koulutuksessa ja ennustamisessa on käytettävä täsmälleen samaa sanastoa. Yhden koulutetun vektoroijan käyttäminen kaikkialla pitää piirresarakkeet kohdakkain.

Pipeline helpottaa työtä

Kun vektoroija ja malli kääritään Pipeline-rakenteeseen, transform- ja predict-vaiheet ketjutetaan automaattisesti, joten yksikään vaihe ei unohdu.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())

Pikatarkistus

Miten testiteksti pitäisi valmistella ennen ennustamista?

Kertaus: vektorisoikaa ja sovittakaa

Vektorisointitte teksti TF-IDF:n avulla, jakakaa aineisto ja kutsukaa sitten logistiselle regressiolle fit. Käyttäkää samaa vektoroijaa testidataan, mieluiten pipelinessä. ✅

Aloita maksutta

Opi Python tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
30
Oppitunnit
120

Usein kysytyt kysymykset

Onko oppitunti ”TF-IDF-ominaisuuksilla kouluttaminen” ilmainen?

Kyllä — voit lukea täällä verkossa kokonaan ilmaiseksi mitkä tahansa NLP Academy-oppimispolun 3 oppituntia, myös oppitunnin “TF-IDF-ominaisuuksilla kouluttaminen”. Sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä interaktiiviset harjoitukset sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. NLP Academy-kurssilla on yhteensä 4 oppituntia.

Mitä opin oppitunnilla ”TF-IDF-ominaisuuksilla kouluttaminen”?

Sovita luokitin scikit-learnilla Harjoittelet NLP Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni NLP Academy-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin NLP Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 2/4.

Kuinka kauan ”TF-IDF-ominaisuuksilla kouluttaminen”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä NLP Academy-oppitunnilla?

Kyllä. Jokainen NLP Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. Miksi logistinen regressio toimii tekstissä
  2. TF-IDF-ominaisuuksilla kouluttaminen
  3. Vahvimpien kertoimien tarkasteleminen
  4. Regularisoinnin voimakkuuden säätäminen
← Takaisin: NLP Academy