0Pricing
Learn AI with Python · Lektion

Professionelle Verzeichnisstruktur für KI-Projekte

Aufbau mit data/, notebooks/, src/, models/, tests/ nach dem cookiecutter-data-science-Muster.

Professionelle Verzeichnisstruktur für KI-Projekte ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Warum Struktur wichtig ist

Ein Stapel von Notebooks namens final.ipynb, final2.ipynb und really_final.ipynb ist ein sicherer Weg, KI-Projekte zu ruinieren. Eine einheitliche Verzeichnisstruktur macht Projekte übersichtlich, reproduzierbar und teamfreundlich.

Diese Lektion behandelt die weitverbreitete Struktur von Cookiecutter Data Science.

Der data-Ordner

Trennen Sie Daten nach ihrer Verarbeitungsstufe, damit Rohdaten niemals überschrieben werden:

  • data/raw/ — originale, unveränderliche Quelldaten
  • data/processed/ — bereinigte, für Modelle geeignete Daten
  • data/interim/ — Zwischenergebnisse der Verarbeitung

Behandeln Sie data/raw als schreibgeschützt — alles andere sollte jederzeit daraus neu erzeugt werden können.

Warum Rohdaten unveränderlich sind

Wenn ein Fehler bei der Datenbereinigung Ihre einzige Datenkopie beschädigt, ist das Projekt gescheitert. Wenn data/raw unverändert bleibt, ist jede verarbeitete Datei reproduzierbar, da Sie Ihre Pipeline erneut ausführen können.

Verarbeitete Ergebnisse sind entbehrlich; Rohdaten sind unantastbar.

Der notebooks-Ordner

notebooks/ enthält Notebooks zur Exploration und Berichterstellung. Üblicherweise werden sie nach Phase nummeriert und mit Initialen versehen, z. B. 1.0-mk-eda.ipynb.

Notebooks dienen der Exploration; wiederverwendbare Logik sollte in src/ überführt werden.

Das src-Paket

src/ enthält importierbaren Python-Code, der nach Zuständigkeiten aufgeteilt ist:

  • src/data/ — Skripte zum Laden und Verarbeiten von Daten
  • src/features/ — Feature Engineering
  • src/models/ — Code zum Trainieren und Vorhersagen
  • src/visualization/ — Diagramme und Berichte

src/features und src/models

Wenn Feature Engineering und Modellierung in getrennten Modulen organisiert sind, zahlt sich das aus: Sie können den Feature-Code mit Unit-Tests prüfen, in mehreren Notebooks wiederverwenden und Modelle austauschen, ohne die Datenvorbereitung neu schreiben zu müssen.

from src.features.build_features import make_features
from src.models.train import train_model

X = make_features(df)
model = train_model(X, y)

Der models-Ordner

models/ speichert serialisierte trainierte Artefakte (z. B. model.pkl, model.joblib). Dabei handelt es sich um Ausgaben, nicht um Quellcode.

Große Modelldateien sollten normalerweise nicht in Git gespeichert werden — verwenden Sie stattdessen DVC oder einen Objektspeicher (behandelt in der nächsten Lektion).

Der reports-Ordner

reports/ enthält für Menschen bestimmte generierte Ergebnisse: reports/figures/ für Diagramme und ein Berichtsdokument auf oberster Ebene. Diese Dateien werden von Ihrem Code erzeugt und können daher neu generiert werden.

Konfigurations- und Umgebungsdateien

Vervollständigen Sie das Projekt mit Dateien auf Projektebene:

  • requirements.txt oder environment.yml — Abhängigkeiten
  • config.yaml — Hyperparameter und Pfade
  • README.md — Beschreibung des Projekts und Anleitung zu seiner Ausführung
  • .gitignore — Dateien, die Git ignorieren soll

Die vollständige Struktur

Zusammengefügt sieht ein übersichtliches KI-Projekt so aus:

project/
  data/
    raw/
    interim/
    processed/
  notebooks/
  src/
    data/
    features/
    models/
    visualization/
  models/
  reports/
    figures/
  config.yaml
  requirements.txt
  README.md

Mit Cookiecutter generieren

Sie müssen diese Struktur nicht jedes Mal von Hand erstellen. Die Vorlage cookiecutter-data-science erzeugt die gesamte Struktur mit einem einzigen Befehl.

# pip install cookiecutter
# cookiecutter -c v1 https://github.com/drivendata/cookiecutter-data-science
# Answer a few prompts -> full project tree created

Schnelltest: Wo gehören Rohdaten hin?

Sie laden eine originale CSV-Datei von einem Datenanbieter herunter.

Rückblick: Projektstruktur

Sie haben die professionelle Struktur eines KI-Projekts kennengelernt:

  • data/raw (unveränderlich), data/processed für die verschiedenen Verarbeitungsstufen
  • notebooks/ für Exploration, src/features und src/models für wiederverwendbaren Code
  • models/ für Artefakte, reports/ für Ergebnisse
  • Konfiguration, Anforderungen, README und .gitignore im Stammverzeichnis
  • cookiecutter-data-science, um die Struktur sofort zu erzeugen

Als Nächstes: Git effektiv in KI-Projekten einsetzen.

Häufig gestellte Fragen

Ist die Lektion „Professionelle Verzeichnisstruktur für KI-Projekte“ kostenlos?

Ja — der vollständige Text von „Professionelle Verzeichnisstruktur für KI-Projekte“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Professionelle Verzeichnisstruktur für KI-Projekte“?

Aufbau mit data/, notebooks/, src/, models/, tests/ nach dem cookiecutter-data-science-Muster. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Professionelle Verzeichnisstruktur für KI-Projekte“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Professionelle Verzeichnisstruktur für KI-Projekte
  2. Git für KI-Projekte
  3. Reproduzierbarkeit: Seeds, Konfigurationen und Umgebungen
  4. Best Practices für Jupyter Notebooks
← Zurück zu Learn AI with Python