Helhetlig pipeline for ubalanserte data
Sett løsningene sammen på en ryddig måte
Helhetlig pipeline for ubalanserte data er en gratis leksjon i NLP Academy på CoddyKit. Dette er leksjon 4 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i NLP Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i NLP Academy inneholder totalt 4 leksjoner.
Sett alt sammen
Nå skal du sette alle tiltakene sammen i én ryddig arbeidsflyt. Én enkelt pipeline holder vektorisering, resampling og modellering i riktig rekkefølge.
Del opp først, alltid
Begynn med en stratifisert oppdeling, slik at trenings- og testdata beholder det samme forholdet mellom sjeldne klasser. Dette beskytter en ærlig evaluering.
X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)Vektoriser teksten
Gjør råtekst om til tall med TF-IDF, slik at klassifikatoren får egenskaper den kan lære av.
tfidf = TfidfVectorizer()Gjør resampling i pipelinen
Bruk en imblearn-Pipeline, slik at SMOTE bare kjører på treningsfoldene og aldri lekker inn i valideringen eller testen.
from imblearn.pipeline import PipelineKoble sammen trinnene
List opp trinnene i riktig rekkefølge: vektoriserer, deretter SMOTE, og til slutt modellen. Pipeline kjører dem som ett tilpasset objekt.
pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])Tilpass alt på én ryddig måte
Kall fit på hele pipelinen. Hvert trinn trenes i rekkefølge og bruker bare treningsdataene dine.
pipe.fit(X_tr, y_tr)Evaluer på riktig måte
Hopp over rå nøyaktighet. En klassifikasjonsrapport viser tydelig presisjon, gjenfinningsgrad og F1 for den sjeldne klassen.
from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))Valider uten lekkasjer
Kombiner pipelinen med stratifisert cross-validation, slik at resampling utføres på nytt inne i hver fold.
Juster terskelen
Hent sannsynligheter fra pipelinen, og velg en terskel som oppnår ønsket gjenfinningsgrad på valideringsdata.
proba = pipe.predict_proba(X_te)[:, 1]Lagre hele pipelinen
Lagre hele den tilpassede pipelinen med joblib, slik at prediksjon senere gjentar hvert trinn automatisk.
import joblib
joblib.dump(pipe, 'model.joblib')Ett objekt, reproduserbart
Siden vektorisering, balansering og modellering hører sammen, forblir resultatene dine reproduserbare og fri for skjulte lekkasjer. 🚀
Rask sjekk
Én til om trygge pipelines.
Oppsummering
Stratifiser, vektoriser, gjør resampling i en pipeline, vurder etter F1 og gjenfinningsgrad, juster terskelen, og lagre alt. 🚀
Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 30
- Leksjoner
- 120
Ofte stilte spørsmål
Er leksjonen «Helhetlig pipeline for ubalanserte data» gratis?
Ja – du kan lese valgfritt 3 av leksjonene i læringsstien NLP Academy, inkludert «Helhetlig pipeline for ubalanserte data», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i NLP Academy inneholder totalt 4 leksjoner.
Hva lærer jeg i «Helhetlig pipeline for ubalanserte data»?
Sett løsningene sammen på en ryddig måte Du øver på NLP Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med NLP Academy?
Ingen tidligere erfaring er nødvendig. NLP Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 4.
Hvor lang tid tar leksjonen «Helhetlig pipeline for ubalanserte data»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne NLP Academy-leksjonen?
Ja. Alle NLP Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Hvorfor sjeldne klasser ignoreres
- Resampling og klassevekter
- Velg terskel og måleparameter
- Helhetlig pipeline for ubalanserte data