0Pricing
MLOps Academy · Lektion

Die Daten-zu-Modell-Herkunft nachverfolgen

Verknüpfen Sie ein bereitgestelltes Modell mit seinen exakten Daten und seinem Code.

Die Daten-zu-Modell-Herkunft nachverfolgen ist eine kostenlose MLOps Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des MLOps Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der MLOps Academy-Kurs umfasst insgesamt 4 Lektionen.

Was Lineage bedeutet

Lineage ist die dokumentierte Kette, die ein bereitgestelltes Modell mit den exakten Daten, dem Code und der Konfiguration verknüpft, durch die es entstanden ist. 🔗

Warum Sie Lineage brauchen

Wenn eine Vorhersage hinterfragt wird, können Sie mit Lineage eine schwierige Frage beantworten: Welche Daten und welche Codeversion haben dieses Modell erstellt?

Die drei zu erfassenden Eingaben

Jedes trainierte Modell hat drei wichtige Ursprünge, die Sie verfolgen sollten: die Dataset-Version, den Commit des Trainingscodes und die Laufparameter.

Den Code-Commit festhalten

Protokollieren Sie bei jedem Lauf den exakten Git-Commit-Hash, damit Sie immer wissen, welcher Code das Modell trainiert hat.

import subprocess
commit = subprocess.check_output(["git", "rev-parse", "HEAD"]).decode().strip()
mlflow.set_tag("git_commit", commit)

Die Datenversion festhalten

Erfassen Sie auch die Datenversion. Mit DVC liegt der Daten-Hash in Git, sodass der Commit bereits auf genau einen Dataset-Stand verweist.

MLflow speichert die Verknüpfung

MLflow speichert Parameter, Metriken und Tags pro Lauf. Ein protokolliertes Modell enthält daher bereits Verweise darauf, wie es erstellt wurde. 🧾

mlflow.log_param("data_path", "data/train.csv")
mlflow.log_metric("f1", 0.91)
mlflow.sklearn.log_model(model, "model")

Den Lauf großzügig taggen

Tags sind kostenlose Metadaten. Fügen Sie den Dataset-Hash, den Umgebungsnamen und die Autorin oder den Autor hinzu, damit der Lauf später seine eigene Geschichte erzählt.

mlflow.set_tag("dataset_hash", "a1b2c3")
mlflow.set_tag("author", "team-fraud")

Lineage ist ein Graph

Stellen Sie sich Lineage als Graphen vor: Datenknoten fließen in einen Trainingslauf, dieser in ein Modell und das Modell in ein Deployment.

Vorwärts und rückwärts verfolgen

Gute Lineage funktioniert in beide Richtungen. Rückwärts beantwortet, was dieses Modell erstellt hat; vorwärts zeigt, welche Modelle von einem Dataset beeinflusst wurden.

Lineage aus einem Lauf auslesen

Sie können einen vergangenen Lauf über seine ID abrufen und seine Tags auslesen, um exakt zu rekonstruieren, welche Daten und welcher Commit dieses Modell erzeugt haben.

run = mlflow.get_run(run_id)
print(run.data.tags["git_commit"])
print(run.data.tags["dataset_hash"])

Tools dafür

MLflow, DVC und spezielle Tools wie OpenLineage erfassen diese Verknüpfungen automatisch, sodass Sie Lineage nicht von Hand zusammenstellen müssen.

Schnelltest

Testen Sie Ihr Verständnis davon, was Lineage tatsächlich miteinander verknüpft.

Zusammenfassung

Sie haben gelernt, dass Lineage ein Modell mit seinen Daten, seinem Code und seinen Parametern verknüpft. Diese Informationen werden als Tags an einem Lauf erfasst, sodass jedes Modell vollständig nachvollziehbar ist. ✅

Häufig gestellte Fragen

Ist die Lektion „Die Daten-zu-Modell-Herkunft nachverfolgen“ kostenlos?

Ja — der vollständige Text von „Die Daten-zu-Modell-Herkunft nachverfolgen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des MLOps Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der MLOps Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Die Daten-zu-Modell-Herkunft nachverfolgen“?

Verknüpfen Sie ein bereitgestelltes Modell mit seinen exakten Daten und seinem Code. Du übst MLOps Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um MLOps Academy zu starten?

Keine Vorkenntnisse erforderlich. MLOps Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Die Daten-zu-Modell-Herkunft nachverfolgen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser MLOps Academy-Lektion Code schreiben und ausführen?

Ja. Jede MLOps Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Die Daten-zu-Modell-Herkunft nachverfolgen
  2. Model Cards schreiben
  3. Audit-Trails und Reproduzierbarkeit
  4. Zugriffskontrolle und Compliance
← Zurück zu MLOps Academy