0Pricing
Learn AI with Python · Lektion

Reproduzierbare ML-Pipelines erstellen

sklearn Pipeline, Persistieren von Pipelines mit joblib, parametrisierte Läufe mit Konfigurationsdateien.

Reproduzierbare ML-Pipelines erstellen ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Warum Reproduzierbarkeit?

Ein Ergebnis, das Sie nicht reproduzieren können, ist keine Wissenschaft, sondern Glück. Reproduzierbare Pipelines stellen sicher, dass dieselben Daten und dieselbe Konfiguration immer dasselbe Modell hervorbringen. Das ist entscheidend für Debugging, Audits und Teamarbeit.

Die sklearn-Pipeline

Eine scikit-learn-Pipeline verbindet Vorverarbeitung und Modell zu einem Objekt. Dadurch werden bei der Inferenz exakt dieselben Transformationen angewendet wie beim Training, was Train-Serve-Skew verhindert.

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.ensemble import RandomForestClassifier

pipe = Pipeline([
    ("scaler", StandardScaler()),
    ("model", RandomForestClassifier(n_estimators=200))
])
pipe.fit(X_train, y_train)

Die Pipeline als Artefakt speichern

Da die gesamte Pipeline ein einziges Objekt ist, können Sie sie als ein einzelnes Artefakt speichern und überall erneut laden. So ist sichergestellt, dass die Vorverarbeitung zusammen mit dem Modell übertragen wird.

joblib.dump und load

joblib serialisiert scikit-learn-Objekte effizient (große NumPy-Arrays verarbeitet es besser als pickle). Speichern Sie die angepasste Pipeline und laden Sie sie anschließend für die Bereitstellung erneut.

import joblib

joblib.dump(pipe, "pipeline.joblib")        # save
loaded = joblib.load("pipeline.joblib")    # reload
preds = loaded.predict(X_new)

YAML-Konfiguration für Hyperparameter

Fest im Code hinterlegte Werte verschleiern, welche Einstellungen ein Durchlauf verwendet hat. Legen Sie alle Hyperparameter in einer YAML-Datei ab, damit jede Einstellung explizit, versionskontrolliert und ohne Codeänderungen anpassbar ist.

# config.yaml
model:
  n_estimators: 200
  max_depth: 8
data:
  test_size: 0.2
  random_state: 42

Die Konfiguration laden

Lesen Sie die YAML-Datei einmal beim Start ein und übergeben Sie die Werte an Ihre Pipeline, sodass eine einzige Datei den gesamten Durchlauf steuert.

import yaml

with open("config.yaml") as f:
    cfg = yaml.safe_load(f)

model = RandomForestClassifier(
    n_estimators=cfg["model"]["n_estimators"],
    max_depth=cfg["model"]["max_depth"]
)

Random Seeds festlegen

Für Reproduzierbarkeit benötigen Sie außerdem überall feste Random Seeds: bei der Aufteilung in Trainings- und Testdaten, der Modellinitialisierung und beim Mischen. Speichern Sie den Seed in der YAML-Konfiguration, damit er explizit und konsistent festgelegt ist.

from sklearn.model_selection import train_test_split

X_tr, X_te, y_tr, y_te = train_test_split(
    X, y, test_size=cfg["data"]["test_size"],
    random_state=cfg["data"]["random_state"]
)

Makefile für wiederholbare Schritte

Ein Makefile macht aus jeder Pipeline-Phase ein benanntes Ziel. So führt jeder make train aus, statt sich lange Befehle merken zu müssen. Dadurch wird der Workflow im gesamten Team standardisiert.

Make-Ziele definieren

Häufige Ziele sind make data, make train und make evaluate, die jeweils das passende Skript aufrufen.

# Makefile
data:
	python src/prepare_data.py

train:
	python src/train.py --config config.yaml

evaluate:
	python src/evaluate.py --config config.yaml

Abhängigkeiten verketten

Make-Ziele können voneinander abhängen. Wenn nötig, führt make train dadurch zuerst data aus und stellt sicher, dass die Pipeline immer in der richtigen Reihenfolge ausgeführt wird.

train: data
	python src/train.py --config config.yaml

Alles zusammenführen

Eine reproduzierbare Einrichtung umfasst eine mit joblib gespeicherte Pipeline, alle Hyperparameter in YAML, feste Seeds und ein Makefile mit den Zielen make data / train / evaluate. Jeder kann das Repository klonen und Ihr exaktes Modell reproduzieren.

Schnelltest

Testen Sie Ihr Wissen über reproduzierbare Pipelines.

Zusammenfassung

Sie haben reproduzierbare Pipelines erstellt: eine sklearn-Pipeline, die über joblib.dump/load gespeichert wird, alle Hyperparameter in einer YAML-Konfiguration, festgelegte Random Seeds und ein Makefile mit den Zielen make data / train / evaluate. Als Nächstes folgt die Überwachung von Modellen in Produktion.

Häufig gestellte Fragen

Ist die Lektion „Reproduzierbare ML-Pipelines erstellen“ kostenlos?

Ja — der vollständige Text von „Reproduzierbare ML-Pipelines erstellen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Reproduzierbare ML-Pipelines erstellen“?

sklearn Pipeline, Persistieren von Pipelines mit joblib, parametrisierte Läufe mit Konfigurationsdateien. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Reproduzierbare ML-Pipelines erstellen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Experiment-Tracking mit MLflow
  2. Model Registry und Versionierung
  3. Reproduzierbare ML-Pipelines erstellen
  4. Modellleistung in der Produktion überwachen
← Zurück zu Learn AI with Python