0Pricing
Learn AI with Python · Leçon

Git pour les projets d’IA

git init, .gitignore pour les données et les modèles, validation des notebooks et DVC pour le versionnage des données.

Git pour les projets d’IA est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 4 leçons au total.

Git dans les projets d’IA

Git suit les modifications apportées à votre code afin que vous puissiez collaborer, annuler les erreurs et consulter l’historique. Mais les projets d’IA ont une particularité : les fichiers de données volumineux et les modèles binaires n’ont pas leur place dans Git.

Cette leçon présente un fichier .gitignore pertinent et l’utilisation de DVC pour gérer les versions des données.

Ce que Git suit bien

Git excelle avec le texte : code source, configurations, carnets (dont les sorties ont été effacées) et documentation. Il stocke efficacement les différences entre les versions des fichiers texte.

Il gère mal les fichiers binaires volumineux : chaque version est stockée intégralement, ce qui alourdit définitivement le dépôt.

Pourquoi ne pas valider les données et les modèles ?

Valider un jeu de données de 2 GB ou un modèle de 500 MB :

  • Alourdit le dépôt et ralentit chaque clonage
  • Ne permet pas de comparer les versions de manière utile
  • Le laisse dans l’historique pour toujours, même après sa suppression

Solution : ignorez-les dans Git et gérez leurs versions avec un outil dédié.

Le fichier .gitignore

.gitignore répertorie les motifs que Git ne doit pas suivre. Créez-le à la racine du projet. Chaque ligne est un motif générique.

# .gitignore
*.pkl
*.joblib
*.h5
data/raw/*
data/processed/*
models/*
__pycache__/
*.pyc
.ipynb_checkpoints/
.env

Ignorer les fichiers de modèles et de cache

Motifs d’exclusion courants pour l’IA :

  • *.pkl, *.joblib, *.h5 — modèles sérialisés
  • __pycache__/, *.pyc — bytecode Python
  • .ipynb_checkpoints/ — sauvegardes automatiques de Jupyter
  • .env — secrets et clés d’API (ne les validez jamais !)

Conserver les dossiers vides avec .gitkeep

Git ignore les répertoires vides. Pour conserver data/raw/ dans la structure du dépôt tout en ignorant son contenu, ajoutez un fichier .gitkeep vide et une règle de négation.

# .gitignore
data/raw/*
!data/raw/.gitkeep

Présentation de DVC

DVC (Data Version Control) gère les versions des données et des modèles volumineux parallèlement à Git. Git suit de petits fichiers pointeurs .dvc ; les données réelles sont stockées à distance (S3, GCS, etc.).

Vous obtenez des versions de données reproductibles sans alourdir le dépôt Git.

dvc init

Initialisez DVC dans un dépôt Git existant. Cette commande crée un répertoire .dvc/ et une configuration que vous validez dans Git.

# in your git repo
dvc init
git add .dvc .gitignore
git commit -m "Initialize DVC"

dvc add — Suivre les données

dvc add commence à suivre un fichier ou un dossier. DVC déplace les données vers son cache et crée un petit fichier pointeur .dvc. Vous validez le pointeur dans Git, et non les données.

dvc add data/raw/dataset.csv
# creates data/raw/dataset.csv.dvc
git add data/raw/dataset.csv.dvc data/raw/.gitignore
git commit -m "Track dataset with DVC"

dvc push et dvc pull

Configurez un espace distant, puis dvc push y envoie les données et dvc pull télécharge la version correspondant à la validation Git actuelle. C’est ainsi que les membres de l’équipe partagent les données.

dvc remote add -d storage s3://my-bucket/dvcstore
dvc push          # upload data to the remote

# teammate after git clone + git checkout:
dvc pull          # fetch the matching data version

Le flux de travail en équipe

La boucle Git + DVC associe les versions du code et des données :

  • git pull pour obtenir le dernier code et les pointeurs .dvc
  • dvc pull pour récupérer les données et les modèles correspondants
  • Travaillez, puis exécutez dvc add + git commit + dvc push

Revenir à une ancienne validation et exécuter dvc pull permet de reproduire exactement cet état.

Vérification rapide : fichiers volumineux

Votre projet contient un jeu de données d’entraînement de 1 GB et un fichier de modèle de 300 MB.

Récapitulatif : Git pour les projets d’IA

Vous avez appris la gestion des versions adaptée à l’IA :

  • Git pour le texte (code, configurations, carnets), mais pas pour les fichiers binaires volumineux
  • Un fichier .gitignore pour *.pkl, data/raw/*, __pycache__ et .env
  • .gitkeep pour préserver les dossiers vides
  • DVC : dvc init, dvc add, dvc push/pull pour gérer les versions des données et des modèles
  • Le flux de travail Git + DVC maintient le code et les données synchronisés

Ensuite : rendre les expériences reproductibles.

Questions Fréquemment Posées

La leçon « Git pour les projets d’IA » est-elle gratuite ?

Oui — le texte complet de « Git pour les projets d’IA » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Git pour les projets d’IA » ?

git init, .gitignore pour les données et les modèles, validation des notebooks et DVC pour le versionnage des données. Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Learn AI with Python ?

Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Git pour les projets d’IA » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?

Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Structure professionnelle des répertoires d’un projet d’IA
  2. Git pour les projets d’IA
  3. Reproductibilité : graines, configurations et environnements
  4. Bonnes pratiques pour les notebooks Jupyter
← Retour à Learn AI with Python