0Pricing
NLP Academy · Lezione

Pipeline completa per dati sbilanciati

Integrare le correzioni in modo ordinato

Pipeline completa per dati sbilanciati è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.

Unire tutti gli elementi

Ora collegherete ogni correzione in un unico flusso ordinato. Una sola pipeline mantiene vectorization, resampling e modellazione nella sequenza corretta.

Suddividere prima, sempre

Iniziate con una suddivisione stratificata, così training e test mantengono la stessa proporzione della classe rara. Questo protegge l'integrità della valutazione.

X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)

Vectorizzare il testo

Trasformate il testo grezzo in numeri con TF-IDF, così il classificatore dispone di feature da cui apprendere.

tfidf = TfidfVectorizer()

Eseguire il resampling nella pipeline

Usate una Pipeline di imblearn, in modo che SMOTE venga eseguito solo sui fold di training, senza alcun leakage nella validazione o nel test.

from imblearn.pipeline import Pipeline

Collegare le fasi

Elencate le fasi nell'ordine corretto: vectorizer, poi SMOTE e infine il modello. La pipeline le esegue come un unico oggetto sottoposto a fit.

pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])

Eseguire il fit in modo corretto

Chiamate fit sull'intera pipeline. Ogni passaggio viene addestrato in sequenza usando esclusivamente i dati di training.

pipe.fit(X_tr, y_tr)

Valutare nel modo corretto

Evitate l'accuracy grezza. Un classification report mostra chiaramente precision, recall e F1 della classe rara.

from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))

Validare senza leakage

Abbinate la pipeline a una cross-validation stratificata, così il resampling viene eseguito da zero all'interno di ogni fold.

Ottimizzare la soglia

Ottenete le probabilità dalla pipeline e scegliete una soglia che raggiunga il recall desiderato sui dati di validazione.

proba = pipe.predict_proba(X_te)[:, 1]

Salvare l'intera pipeline

Salvate l'intera pipeline sottoposta a fit con joblib, così in seguito l'inferenza ripeterà automaticamente ogni passaggio.

import joblib
joblib.dump(pipe, 'model.joblib')

Un oggetto, risultati riproducibili

Poiché vectorization, bilanciamento e modellazione sono riuniti nello stesso oggetto, i risultati restano riproducibili e privi di leakage nascosti. 🚀

Verifica rapida

Un'ultima verifica sulle pipeline sicure.

Riepilogo

Stratificate, eseguite la vectorization e il resampling all'interno di una pipeline, valutate usando F1 e recall, ottimizzate la soglia e infine salvate tutto. 🚀

Domande Frequenti

La lezione «Pipeline completa per dati sbilanciati» è gratuita?

Sì — il testo completo di «Pipeline completa per dati sbilanciati» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.

Cosa imparerò in «Pipeline completa per dati sbilanciati»?

Integrare le correzioni in modo ordinato Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare NLP Academy?

Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Pipeline completa per dati sbilanciati»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione NLP Academy?

Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché le classi rare vengono ignorate
  2. Ricampionamento e pesi delle classi
  3. Scegliere soglia e metrica
  4. Pipeline completa per dati sbilanciati
← Torna a NLP Academy