Data Science Academy · Lezione

Cross-validation K-Fold

Calcolare la media dei punteggi tra i fold.

Lezione 3 di 413 passaggi

Cross-validation K-Fold è una lezione Data Science Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Data Science Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Data Science Academy include 4 lezioni in totale.

Una sola suddivisione, una sola incertezza

Una singola suddivisione tra training e test produce un solo punteggio. Se quella suddivisione è stata fortunata o sfortunata, la vostra stima potrebbe essere fuorviante.

L'idea fondamentale

La cross-validation riutilizza i dati più volte, testando ogni volta una porzione diversa, poi calcola la media dei punteggi per ottenere una stima più stabile.

Dividete in fold

Dividete i dati in k parti uguali chiamate fold. Una scelta comune è usare cinque fold, ottenendo cinque distinti cicli di test.

Ruotate il fold di test

A ogni ciclo, un fold diventa il test set e gli altri k meno uno vengono usati per addestrare il modello. Poi il fold di test ruota verso quello successivo.

Tutti hanno il loro turno

Dopo k cicli, ogni riga viene testata esattamente una volta e usata per l'addestramento tutte le altre volte. Non si spreca alcun dato. 🔄

Calcolate la media dei punteggi

Alla fine avrete k punteggi, uno per fold. La loro media è la vostra stima principale, mentre la loro dispersione mostra quanto è stabile il modello.

Il modo più rapido

scikit-learn esegue i cicli al posto vostro. La funzione di supporto cross_val_score restituisce un punteggio per fold con una sola riga.

from sklearn.model_selection import cross_val_score
scores = cross_val_score(model, X, y, cv=5)

Leggete il risultato

L'array restituito contiene il punteggio di ogni fold. Calcolatene la media per la stima principale e la deviazione standard per valutarne l'affidabilità.

print(scores.mean(), scores.std())

Scegliere k

Cinque o dieci fold sono scelte comuni. Con più fold si usano più dati per l'addestramento a ogni ciclo, ma aumenta il costo di calcolo: è un compromesso tra velocità e stabilità.

Mantenete bilanciate le classi

Per la classificazione, usate StratifiedKFold, così ogni fold rispecchia la distribuzione complessiva delle classi. scikit-learn lo applica automaticamente ai classificatori.

Mettete da parte un test finale

La cross-validation guida la scelta del modello durante lo sviluppo. Mantenete comunque da parte un test set intatto per ottenere un unico punteggio onesto alla fine.

Verifica rapida

Nella cross-validation a 5 fold, quante volte viene testata ogni riga?

Riepilogo

Dividete i dati in k fold, ruotate il fold di test e calcolate la media dei punteggi per una stima robusta. Usate cross_val_score e poi un test finale separato. 🔄

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Cross-validation K-Fold» è gratuita?

Sì — il testo completo di «Cross-validation K-Fold» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Data Science Academy, passa a CoddyKit PRO. Il corso Data Science Academy include 4 lezioni in totale.

Cosa imparerò in «Cross-validation K-Fold»?

Calcolare la media dei punteggi tra i fold. Eserciti Data Science Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Data Science Academy?

Non è richiesta alcuna esperienza precedente. Data Science Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Cross-validation K-Fold»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Data Science Academy?

Sì. Ogni lezione Data Science Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché tenere da parte un test set
  2. Usare train_test_split correttamente
  3. Cross-validation K-Fold
  4. Prevenire il data leakage fin dall'inizio
← Torna a Data Science Academy