TF-IDF-ominaisuuksilla kouluttaminen
Sovita luokitin scikit-learnilla
TF-IDF-ominaisuuksilla kouluttaminen on ilmainen NLP Academy-oppitunti CoddyKitissä. Tämä on oppitunti 2/4. Voit lukea tästä oppimispolusta kokonaan mitkä tahansa 3 oppituntia ilmaiseksi — sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä käytännön harjoittelun sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppitunti kuuluu NLP Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. NLP Academy-kurssilla on yhteensä 4 oppituntia.
Teksti ensin luvuiksi
Malli ei pysty lukemaan raakalauseita. Muuntakaa dokumentit ensin TF-IDF-vektoreiksi ja kouluttakaa logistinen regressio sitten näillä luvuilla. 🔢
Sovittakaa vektoroija
TfidfVectorizer oppii sanaston ja painotukset harjoitusteksteistä. Yksi kutsu muuttaa merkkijonoluettelon piirrematriisiksi.
from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)Luokat pidetään erillään
Piirteenne X tulevat tekstistä, mutta luokat y tulevat teiltä. Jokaiselle dokumentille tarvitaan oikea luokka, kuten roskaposti tai muu viesti.
Jakakaa ennen koulutusta
Jättäkää testiaineisto erilleen, jotta voitte arvioida mallia reilusti. train_test_split pitää osan datasta näkymättömissä arvioinnin loppuun asti.
from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)Fit tarkoittaa oppimista
fit-kutsulla käskette logistista regressiota etsimään sanapainot, jotka erottelevat luokat parhaiten harjoitusdatassa.
from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)Kasvattakaa max_iter-arvoa varoituksen ilmetessä
Tekstissä on paljon piirteitä, joten ratkaisija saattaa tarvita enemmän vaiheita. max_iter-arvon kasvattaminen poistaa yleisen konvergenssivaroituksen, jonka tulette näkemään.
Ennustakaa uusilla vektoreilla
Luokitellaksenne uutta tekstiä muuntakaa se samalla koulutetulla vektoroijalla ja kutsukaa sitten predict-menetelmää. Älkää koskaan sovittako vektoroijaa uudelleen testidataan.
preds = clf.predict(X_te)Muunna, älä sovita, testidatalla
Testitekstissä käytetään transform-menetelmää, ei fit_transform-menetelmää. Uudelleensovittaminen vuotaisi testiaineiston tietoja ja kasvattaisi tuloksia huomaamatta.
Tarkistakaa tarkkuus
Nopea score-kutsu antaa erillään pidetyn aineiston tarkkuuden. Se on ensimmäinen merkki siitä, että koulutus todella onnistui.
print(clf.score(X_te, y_te))Samat vaiheet pysyvät synkronoituina
Koulutuksessa ja ennustamisessa on käytettävä täsmälleen samaa sanastoa. Yhden koulutetun vektoroijan käyttäminen kaikkialla pitää piirresarakkeet kohdakkain.
Pipeline helpottaa työtä
Kun vektoroija ja malli kääritään Pipeline-rakenteeseen, transform- ja predict-vaiheet ketjutetaan automaattisesti, joten yksikään vaihe ei unohdu.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())Pikatarkistus
Miten testiteksti pitäisi valmistella ennen ennustamista?
Kertaus: vektorisoikaa ja sovittakaa
Vektorisointitte teksti TF-IDF:n avulla, jakakaa aineisto ja kutsukaa sitten logistiselle regressiolle fit. Käyttäkää samaa vektoroijaa testidataan, mieluiten pipelinessä. ✅
Opi Python tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 30
- Oppitunnit
- 120
Usein kysytyt kysymykset
Onko oppitunti ”TF-IDF-ominaisuuksilla kouluttaminen” ilmainen?
Kyllä — voit lukea täällä verkossa kokonaan ilmaiseksi mitkä tahansa NLP Academy-oppimispolun 3 oppituntia, myös oppitunnin “TF-IDF-ominaisuuksilla kouluttaminen”. Sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä interaktiiviset harjoitukset sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. NLP Academy-kurssilla on yhteensä 4 oppituntia.
Mitä opin oppitunnilla ”TF-IDF-ominaisuuksilla kouluttaminen”?
Sovita luokitin scikit-learnilla Harjoittelet NLP Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni NLP Academy-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin NLP Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 2/4.
Kuinka kauan ”TF-IDF-ominaisuuksilla kouluttaminen”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä NLP Academy-oppitunnilla?
Kyllä. Jokainen NLP Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- Miksi logistinen regressio toimii tekstissä
- TF-IDF-ominaisuuksilla kouluttaminen
- Vahvimpien kertoimien tarkasteleminen
- Regularisoinnin voimakkuuden säätäminen