NLP Academy · leksjon

Helhetlig pipeline for ubalanserte data

Sett løsningene sammen på en ryddig måte

Leksjon 4 av 413 trinn

Helhetlig pipeline for ubalanserte data er en gratis leksjon i NLP Academy på CoddyKit. Dette er leksjon 4 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i NLP Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i NLP Academy inneholder totalt 4 leksjoner.

Sett alt sammen

Nå skal du sette alle tiltakene sammen i én ryddig arbeidsflyt. Én enkelt pipeline holder vektorisering, resampling og modellering i riktig rekkefølge.

Del opp først, alltid

Begynn med en stratifisert oppdeling, slik at trenings- og testdata beholder det samme forholdet mellom sjeldne klasser. Dette beskytter en ærlig evaluering.

X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)

Vektoriser teksten

Gjør råtekst om til tall med TF-IDF, slik at klassifikatoren får egenskaper den kan lære av.

tfidf = TfidfVectorizer()

Gjør resampling i pipelinen

Bruk en imblearn-Pipeline, slik at SMOTE bare kjører på treningsfoldene og aldri lekker inn i valideringen eller testen.

from imblearn.pipeline import Pipeline

Koble sammen trinnene

List opp trinnene i riktig rekkefølge: vektoriserer, deretter SMOTE, og til slutt modellen. Pipeline kjører dem som ett tilpasset objekt.

pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])

Tilpass alt på én ryddig måte

Kall fit på hele pipelinen. Hvert trinn trenes i rekkefølge og bruker bare treningsdataene dine.

pipe.fit(X_tr, y_tr)

Evaluer på riktig måte

Hopp over rå nøyaktighet. En klassifikasjonsrapport viser tydelig presisjon, gjenfinningsgrad og F1 for den sjeldne klassen.

from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))

Valider uten lekkasjer

Kombiner pipelinen med stratifisert cross-validation, slik at resampling utføres på nytt inne i hver fold.

Juster terskelen

Hent sannsynligheter fra pipelinen, og velg en terskel som oppnår ønsket gjenfinningsgrad på valideringsdata.

proba = pipe.predict_proba(X_te)[:, 1]

Lagre hele pipelinen

Lagre hele den tilpassede pipelinen med joblib, slik at prediksjon senere gjentar hvert trinn automatisk.

import joblib
joblib.dump(pipe, 'model.joblib')

Ett objekt, reproduserbart

Siden vektorisering, balansering og modellering hører sammen, forblir resultatene dine reproduserbare og fri for skjulte lekkasjer. 🚀

Rask sjekk

Én til om trygge pipelines.

Oppsummering

Stratifiser, vektoriser, gjør resampling i en pipeline, vurder etter F1 og gjenfinningsgrad, juster terskelen, og lagre alt. 🚀

Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
30
Leksjoner
120

Ofte stilte spørsmål

Er leksjonen «Helhetlig pipeline for ubalanserte data» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien NLP Academy, inkludert «Helhetlig pipeline for ubalanserte data», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i NLP Academy inneholder totalt 4 leksjoner.

Hva lærer jeg i «Helhetlig pipeline for ubalanserte data»?

Sett løsningene sammen på en ryddig måte Du øver på NLP Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med NLP Academy?

Ingen tidligere erfaring er nødvendig. NLP Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 4.

Hvor lang tid tar leksjonen «Helhetlig pipeline for ubalanserte data»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne NLP Academy-leksjonen?

Ja. Alle NLP Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Hvorfor sjeldne klasser ignoreres
  2. Resampling og klassevekter
  3. Velg terskel og måleparameter
  4. Helhetlig pipeline for ubalanserte data
← Tilbake til NLP Academy