Professionelle Verzeichnisstruktur für KI-Projekte
Aufbau mit data/, notebooks/, src/, models/, tests/ nach dem cookiecutter-data-science-Muster.
Professionelle Verzeichnisstruktur für KI-Projekte ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Warum Struktur wichtig ist
Ein Stapel von Notebooks namens final.ipynb, final2.ipynb und really_final.ipynb ist ein sicherer Weg, KI-Projekte zu ruinieren. Eine einheitliche Verzeichnisstruktur macht Projekte übersichtlich, reproduzierbar und teamfreundlich.
Diese Lektion behandelt die weitverbreitete Struktur von Cookiecutter Data Science.
Der data-Ordner
Trennen Sie Daten nach ihrer Verarbeitungsstufe, damit Rohdaten niemals überschrieben werden:
data/raw/— originale, unveränderliche Quelldatendata/processed/— bereinigte, für Modelle geeignete Datendata/interim/— Zwischenergebnisse der Verarbeitung
Behandeln Sie data/raw als schreibgeschützt — alles andere sollte jederzeit daraus neu erzeugt werden können.
Warum Rohdaten unveränderlich sind
Wenn ein Fehler bei der Datenbereinigung Ihre einzige Datenkopie beschädigt, ist das Projekt gescheitert. Wenn data/raw unverändert bleibt, ist jede verarbeitete Datei reproduzierbar, da Sie Ihre Pipeline erneut ausführen können.
Verarbeitete Ergebnisse sind entbehrlich; Rohdaten sind unantastbar.
Der notebooks-Ordner
notebooks/ enthält Notebooks zur Exploration und Berichterstellung. Üblicherweise werden sie nach Phase nummeriert und mit Initialen versehen, z. B. 1.0-mk-eda.ipynb.
Notebooks dienen der Exploration; wiederverwendbare Logik sollte in src/ überführt werden.
Das src-Paket
src/ enthält importierbaren Python-Code, der nach Zuständigkeiten aufgeteilt ist:
src/data/— Skripte zum Laden und Verarbeiten von Datensrc/features/— Feature Engineeringsrc/models/— Code zum Trainieren und Vorhersagensrc/visualization/— Diagramme und Berichte
src/features und src/models
Wenn Feature Engineering und Modellierung in getrennten Modulen organisiert sind, zahlt sich das aus: Sie können den Feature-Code mit Unit-Tests prüfen, in mehreren Notebooks wiederverwenden und Modelle austauschen, ohne die Datenvorbereitung neu schreiben zu müssen.
from src.features.build_features import make_features
from src.models.train import train_model
X = make_features(df)
model = train_model(X, y)Der models-Ordner
models/ speichert serialisierte trainierte Artefakte (z. B. model.pkl, model.joblib). Dabei handelt es sich um Ausgaben, nicht um Quellcode.
Große Modelldateien sollten normalerweise nicht in Git gespeichert werden — verwenden Sie stattdessen DVC oder einen Objektspeicher (behandelt in der nächsten Lektion).
Der reports-Ordner
reports/ enthält für Menschen bestimmte generierte Ergebnisse: reports/figures/ für Diagramme und ein Berichtsdokument auf oberster Ebene. Diese Dateien werden von Ihrem Code erzeugt und können daher neu generiert werden.
Konfigurations- und Umgebungsdateien
Vervollständigen Sie das Projekt mit Dateien auf Projektebene:
requirements.txtoderenvironment.yml— Abhängigkeitenconfig.yaml— Hyperparameter und PfadeREADME.md— Beschreibung des Projekts und Anleitung zu seiner Ausführung.gitignore— Dateien, die Git ignorieren soll
Die vollständige Struktur
Zusammengefügt sieht ein übersichtliches KI-Projekt so aus:
project/
data/
raw/
interim/
processed/
notebooks/
src/
data/
features/
models/
visualization/
models/
reports/
figures/
config.yaml
requirements.txt
README.mdMit Cookiecutter generieren
Sie müssen diese Struktur nicht jedes Mal von Hand erstellen. Die Vorlage cookiecutter-data-science erzeugt die gesamte Struktur mit einem einzigen Befehl.
# pip install cookiecutter
# cookiecutter -c v1 https://github.com/drivendata/cookiecutter-data-science
# Answer a few prompts -> full project tree createdSchnelltest: Wo gehören Rohdaten hin?
Sie laden eine originale CSV-Datei von einem Datenanbieter herunter.
Rückblick: Projektstruktur
Sie haben die professionelle Struktur eines KI-Projekts kennengelernt:
data/raw(unveränderlich),data/processedfür die verschiedenen Verarbeitungsstufennotebooks/für Exploration,src/featuresundsrc/modelsfür wiederverwendbaren Codemodels/für Artefakte,reports/für Ergebnisse- Konfiguration, Anforderungen, README und .gitignore im Stammverzeichnis
- cookiecutter-data-science, um die Struktur sofort zu erzeugen
Als Nächstes: Git effektiv in KI-Projekten einsetzen.
Häufig gestellte Fragen
Ist die Lektion „Professionelle Verzeichnisstruktur für KI-Projekte“ kostenlos?
Ja — der vollständige Text von „Professionelle Verzeichnisstruktur für KI-Projekte“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Professionelle Verzeichnisstruktur für KI-Projekte“?
Aufbau mit data/, notebooks/, src/, models/, tests/ nach dem cookiecutter-data-science-Muster. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Learn AI with Python zu starten?
Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Professionelle Verzeichnisstruktur für KI-Projekte“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?
Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Professionelle Verzeichnisstruktur für KI-Projekte
- Git für KI-Projekte
- Reproduzierbarkeit: Seeds, Konfigurationen und Umgebungen
- Best Practices für Jupyter Notebooks