0Pricing
Learn AI with Python · Lektion

Git für KI-Projekte

git init, .gitignore für Daten/Modelle, Notebooks committen und DVC zur Datenversionierung.

Git für KI-Projekte ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Git in KI-Projekten

Git verfolgt Änderungen an Ihrem Code, damit Sie zusammenarbeiten, Fehler rückgängig machen und den Verlauf prüfen können. KI-Projekte bringen jedoch eine Besonderheit mit sich: Große Datendateien und Binärmodelle gehören nicht in Git.

Diese Lektion behandelt eine sinnvolle .gitignore und die Verwendung von DVC zur Datenversionsverwaltung.

Womit Git gut umgehen kann

Git spielt seine Stärken bei Text aus: Quellcode, Konfigurationen, Notebooks (mit gelöschten Ausgaben) und Dokumentation. Für Textdateien speichert Git effiziente Diffs.

Mit großen Binärdateien kann Git schlecht umgehen — jede Version wird vollständig gespeichert und bläht das Repository dauerhaft auf.

Warum Sie Daten und Modelle nicht committen sollten

Das Committen eines 2-GB-Datensatzes oder eines 500-MB-Modells:

  • Bläht das Repository auf und verlangsamt jeden Klonvorgang
  • Kann nicht sinnvoll verglichen werden
  • Bleibt dauerhaft im Verlauf, selbst wenn die Datei gelöscht wird

Die Lösung: Ignorieren Sie diese Dateien in Git und verwalten Sie ihre Versionen mit einem spezialisierten Tool.

Die .gitignore-Datei

.gitignore enthält Muster für Dateien, die Git nicht verfolgen soll. Erstellen Sie sie im Stammverzeichnis des Projekts. Jede Zeile ist ein Glob-Muster.

# .gitignore
*.pkl
*.joblib
*.h5
data/raw/*
data/processed/*
models/*
__pycache__/
*.pyc
.ipynb_checkpoints/
.env

Modell- und Cache-Dateien ignorieren

Übliche Ignore-Muster für KI-Projekte:

  • *.pkl, *.joblib, *.h5 — serialisierte Modelle
  • __pycache__/, *.pyc — Python-Bytecode
  • .ipynb_checkpoints/ — automatische Jupyter-Speicherungen
  • .env — Geheimnisse und API-Schlüssel (niemals committen!)

Leere Ordner mit .gitkeep behalten

Git ignoriert leere Verzeichnisse. Damit data/raw/ in der Repository-Struktur erhalten bleibt, während sein Inhalt ignoriert wird, fügen Sie eine leere Datei .gitkeep und eine Negation hinzu.

# .gitignore
data/raw/*
!data/raw/.gitkeep

DVC kennenlernen

DVC (Data Version Control) verwaltet die Versionen großer Datenmengen und Modelle zusammen mit Git. Git verfolgt kleine .dvc-Zeigerdateien; die eigentlichen Daten liegen in einem entfernten Speicher (S3, GCS usw.).

So erhalten Sie reproduzierbare Datenversionen, ohne das Git-Repository aufzublähen.

dvc init

Initialisieren Sie DVC in einem bestehenden Git-Repository. Dabei werden ein Verzeichnis .dvc/ und eine Konfiguration erstellt, die Sie in Git committen.

# in your git repo
dvc init
git add .dvc .gitignore
git commit -m "Initialize DVC"

dvc add — Daten verfolgen

dvc add beginnt mit der Versionsverwaltung einer Datei oder eines Ordners. DVC verschiebt die Daten in seinen Cache und erstellt eine kleine .dvc-Zeigerdatei. Sie committen den Zeiger in Git, nicht die Daten.

dvc add data/raw/dataset.csv
# creates data/raw/dataset.csv.dvc
git add data/raw/dataset.csv.dvc data/raw/.gitignore
git commit -m "Track dataset with DVC"

dvc push und dvc pull

Konfigurieren Sie einen entfernten Speicher. Anschließend lädt dvc push Daten dorthin hoch, während dvc pull die zum aktuellen Git-Commit passende Version herunterlädt. So teilen Teammitglieder Daten.

dvc remote add -d storage s3://my-bucket/dvcstore
dvc push          # upload data to the remote

# teammate after git clone + git checkout:
dvc pull          # fetch the matching data version

Der Workflow im Team

Der Git- und DVC-Ablauf verknüpft Code- und Datenversionen:

  • git pull, um den neuesten Code und die .dvc-Zeiger abzurufen
  • dvc pull, um die passenden Daten und Modelle abzurufen
  • Arbeiten Sie weiter und führen Sie anschließend dvc add + git commit + dvc push aus

Wenn Sie einen alten Commit auschecken und dvc pull ausführen, stellen Sie genau diesen Zustand wieder her.

Schnelltest: Große Dateien

Ihr Projekt enthält einen 1 GB großen Trainingsdatensatz und eine 300 MB große Modelldatei.

Rückblick: Git für KI-Projekte

Sie haben die versionsverwaltungsspezifischen Besonderheiten von KI-Projekten kennengelernt:

  • Git für Text (Code, Konfigurationen, Notebooks), nicht für große Binärdateien
  • Eine .gitignore für *.pkl, data/raw/*, __pycache__ und .env
  • .gitkeep, um leere Ordner zu erhalten
  • DVC: dvc init, dvc add, dvc push/pull, um Daten und Modelle zu versionieren
  • Der Git- und DVC-Workflow hält Code und Daten synchron

Als Nächstes: Experimente reproduzierbar machen.

Häufig gestellte Fragen

Ist die Lektion „Git für KI-Projekte“ kostenlos?

Ja — der vollständige Text von „Git für KI-Projekte“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Git für KI-Projekte“?

git init, .gitignore für Daten/Modelle, Notebooks committen und DVC zur Datenversionierung. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Git für KI-Projekte“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Professionelle Verzeichnisstruktur für KI-Projekte
  2. Git für KI-Projekte
  3. Reproduzierbarkeit: Seeds, Konfigurationen und Umgebungen
  4. Best Practices für Jupyter Notebooks
← Zurück zu Learn AI with Python