NLP Academy · Les

End-to-end-pipeline voor ongebalanceerde data

Voeg de oplossingen netjes samen

Les 4 van 413 stappen

End-to-end-pipeline voor ongebalanceerde data is een gratis NLP Academy-les op CoddyKit. Dit is les 4 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject NLP Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus NLP Academy bevat in totaal 4 lessen.

Breng alles samen

Nu verbind je elke oplossing in één overzichtelijke stroom. Eén pijplijn houdt vectoriseren, herverdelen en modelleren in de juiste volgorde.

Splits altijd eerst

Begin met een gestratificeerde splitsing, zodat de trainings- en testgegevens dezelfde verhouding van de zeldzame klasse behouden. Zo blijft je evaluatie eerlijk.

X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)

Vectoriseer de tekst

Zet onbewerkte tekst met TF-IDF om in getallen, zodat de classifier kenmerken heeft om van te leren.

tfidf = TfidfVectorizer()

Herverdeel binnen de pijplijn

Gebruik een imblearn-Pipeline, zodat SMOTE alleen op trainingsvouwen wordt uitgevoerd en nooit in de validatie- of testgegevens lekt.

from imblearn.pipeline import Pipeline

Verbind de stappen

Som de stappen in volgorde op: eerst de vectoriseerder, daarna SMOTE en vervolgens het model. De pijplijn voert ze uit als één getraind object.

pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])

Train één keer en netjes

Roep fit aan op de volledige pijplijn. Elke stap wordt achtereenvolgens getraind met alleen je trainingsgegevens.

pipe.fit(X_tr, y_tr)

Evalueer op de juiste manier

Sla onbewerkte nauwkeurigheid over. Een classificatierapport toont duidelijk de precisie, recall en F1 voor de zeldzame klasse.

from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))

Valideer zonder lekken

Combineer de pijplijn met gestratificeerde kruisvalidering, zodat de herverdeling in elke vouw opnieuw wordt uitgevoerd.

Stem de drempel af

Haal waarschijnlijkheden uit de pijplijn en kies een drempel waarmee je op validatiegegevens je gewenste recall bereikt.

proba = pipe.predict_proba(X_te)[:, 1]

Sla de volledige pijplijn op

Sla de volledige getrainde pijplijn op met joblib, zodat de gevolgtrekking later automatisch elke stap opnieuw uitvoert.

import joblib
joblib.dump(pipe, 'model.joblib')

Eén object, reproduceerbaar

Omdat vectoriseren, balanceren en modelleren samen zijn ondergebracht, blijven je resultaten reproduceerbaar en vrij van subtiele lekken. 🚀

Snelle controle

Nog één vraag over veilige pijplijnen.

Samenvatting

Stratificeer, vectoriseer, herverdeel binnen een pijplijn, beoordeel met F1 en recall, stem de drempel af en sla alles op. 🚀

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “End-to-end-pipeline voor ongebalanceerde data” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad NLP Academy, waaronder “End-to-end-pipeline voor ongebalanceerde data”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus NLP Academy bevat in totaal 4 lessen.

Wat leer ik in “End-to-end-pipeline voor ongebalanceerde data”?

Voeg de oplossingen netjes samen Je oefent met NLP Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met NLP Academy te beginnen?

Ervaring vooraf is niet nodig. NLP Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.

Hoe lang duurt de les “End-to-end-pipeline voor ongebalanceerde data”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over NLP Academy?

Ja. Elke les over NLP Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Waarom zeldzame klassen worden genegeerd
  2. Resampling en class weights
  3. Drempel en metriek kiezen
  4. End-to-end-pipeline voor ongebalanceerde data
← Terug naar NLP Academy