End-to-end-pipeline voor ongebalanceerde data
Voeg de oplossingen netjes samen
End-to-end-pipeline voor ongebalanceerde data is een gratis NLP Academy-les op CoddyKit. Dit is les 4 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject NLP Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus NLP Academy bevat in totaal 4 lessen.
Breng alles samen
Nu verbind je elke oplossing in één overzichtelijke stroom. Eén pijplijn houdt vectoriseren, herverdelen en modelleren in de juiste volgorde.
Splits altijd eerst
Begin met een gestratificeerde splitsing, zodat de trainings- en testgegevens dezelfde verhouding van de zeldzame klasse behouden. Zo blijft je evaluatie eerlijk.
X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)Vectoriseer de tekst
Zet onbewerkte tekst met TF-IDF om in getallen, zodat de classifier kenmerken heeft om van te leren.
tfidf = TfidfVectorizer()Herverdeel binnen de pijplijn
Gebruik een imblearn-Pipeline, zodat SMOTE alleen op trainingsvouwen wordt uitgevoerd en nooit in de validatie- of testgegevens lekt.
from imblearn.pipeline import PipelineVerbind de stappen
Som de stappen in volgorde op: eerst de vectoriseerder, daarna SMOTE en vervolgens het model. De pijplijn voert ze uit als één getraind object.
pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])Train één keer en netjes
Roep fit aan op de volledige pijplijn. Elke stap wordt achtereenvolgens getraind met alleen je trainingsgegevens.
pipe.fit(X_tr, y_tr)Evalueer op de juiste manier
Sla onbewerkte nauwkeurigheid over. Een classificatierapport toont duidelijk de precisie, recall en F1 voor de zeldzame klasse.
from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))Valideer zonder lekken
Combineer de pijplijn met gestratificeerde kruisvalidering, zodat de herverdeling in elke vouw opnieuw wordt uitgevoerd.
Stem de drempel af
Haal waarschijnlijkheden uit de pijplijn en kies een drempel waarmee je op validatiegegevens je gewenste recall bereikt.
proba = pipe.predict_proba(X_te)[:, 1]Sla de volledige pijplijn op
Sla de volledige getrainde pijplijn op met joblib, zodat de gevolgtrekking later automatisch elke stap opnieuw uitvoert.
import joblib
joblib.dump(pipe, 'model.joblib')Eén object, reproduceerbaar
Omdat vectoriseren, balanceren en modelleren samen zijn ondergebracht, blijven je resultaten reproduceerbaar en vrij van subtiele lekken. 🚀
Snelle controle
Nog één vraag over veilige pijplijnen.
Samenvatting
Stratificeer, vectoriseer, herverdeel binnen een pijplijn, beoordeel met F1 en recall, stem de drempel af en sla alles op. 🚀
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “End-to-end-pipeline voor ongebalanceerde data” gratis?
Ja — je kunt hier op het web alle 3 lessen van het leerpad NLP Academy, waaronder “End-to-end-pipeline voor ongebalanceerde data”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus NLP Academy bevat in totaal 4 lessen.
Wat leer ik in “End-to-end-pipeline voor ongebalanceerde data”?
Voeg de oplossingen netjes samen Je oefent met NLP Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met NLP Academy te beginnen?
Ervaring vooraf is niet nodig. NLP Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “End-to-end-pipeline voor ongebalanceerde data”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over NLP Academy?
Ja. Elke les over NLP Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Waarom zeldzame klassen worden genegeerd
- Resampling en class weights
- Drempel en metriek kiezen
- End-to-end-pipeline voor ongebalanceerde data