Data Science Academy · Leçon

Validation croisée en K parties

Moyenner les scores sur les différentes parties

Leçon 3 sur 413 étapes

Validation croisée en K parties est une leçon Data Science Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Data Science Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Data Science Academy comprend 4 leçons au total.

Une séparation, une seule incertitude

Une seule séparation entre entraînement et test ne fournit qu'un seul score. Si cette séparation était particulièrement favorable ou défavorable, votre estimation pourrait être trompeuse.

L'idée essentielle

La validation croisée réutilise vos données plusieurs fois : à chaque tour, elle effectue le test sur une portion différente, puis calcule la moyenne des scores pour obtenir une estimation plus stable.

Découper en sous-ensembles

Vous découpez les données en k parties égales appelées plis. Un choix courant consiste à utiliser cinq plis, ce qui donne cinq tours de test distincts.

Faire tourner le pli de test

À chaque tour, un pli devient l'ensemble de test et les k moins un autres plis servent à entraîner le modèle. Puis le pli de test passe au suivant.

Chacun a son tour

Au cours des k tours, chaque ligne est testée exactement une fois et sert à l'entraînement tout le reste du temps. Aucune donnée n'est gaspillée. 🔄

Faire la moyenne des scores

Vous obtenez k scores, un par pli. Leur moyenne constitue votre estimation principale, tandis que leur dispersion indique la stabilité du modèle.

La méthode rapide

scikit-learn se charge de la boucle pour vous. L'outil cross_val_score renvoie un score par pli sur une seule ligne.

from sklearn.model_selection import cross_val_score
scores = cross_val_score(model, X, y, cv=5)

Lire le résultat

Le tableau renvoyé contient le score de chaque pli. Prenez sa mean pour obtenir l'estimation principale, et son écart type pour évaluer la fiabilité.

print(scores.mean(), scores.std())

Choisir k

Cinq ou dix plis sont des choix courants. Avec davantage de plis, l'entraînement utilise plus de données à chaque tour, mais demande davantage de calcul : c'est un compromis entre rapidité et stabilité.

Conserver l'équilibre des classes

Pour la classification, utilisez StratifiedKFold afin que chaque pli reflète l'équilibre global des classes. scikit-learn l'applique automatiquement pour les classifieurs.

Mettre de côté un test final

La validation croisée guide le choix du modèle pendant le développement. Gardez néanmoins un ensemble de test intact pour obtenir un score honnête unique à la toute fin.

Vérification rapide

Avec une validation croisée en 5 plis, combien de fois chaque ligne est-elle testée ?

Récapitulatif

Découpez en k plis, faites tourner le pli de test et calculez la moyenne des scores pour obtenir une estimation robuste. Utilisez cross_val_score, puis un test final sur un ensemble mis de côté. 🔄

Gratuit pour commencer

Apprends Python avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
30
Leçons
120

Questions Fréquemment Posées

La leçon « Validation croisée en K parties » est-elle gratuite ?

Oui — le texte complet de « Validation croisée en K parties » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Data Science Academy, passe à CoddyKit PRO. Le cours Data Science Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Validation croisée en K parties » ?

Moyenner les scores sur les différentes parties Tu pratiques Data Science Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Data Science Academy ?

Aucune expérience préalable n'est requise. Data Science Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Validation croisée en K parties » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Data Science Academy ?

Oui. Chaque leçon Data Science Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi mettre un jeu de test de côté
  2. Bien utiliser train_test_split
  3. Validation croisée en K parties
  4. Éviter la fuite de données dès le départ
← Retour à Data Science Academy