0Pricing
Learn AI with Python · Lektion

Observability und Monitoring von KI-Systemen

Dashboards zur Modellleistung, Warnungen bei Data Drift, Feedbackschleifen, Deployment im Shadow Mode.

Observability und Monitoring von KI-Systemen ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Warum ML-Systeme überwachen

Mit der Bereitstellung eines Modells ist die Arbeit nicht abgeschlossen. Der Datenverkehr nimmt zu, die Latenz steigt allmählich, und die Welt verändert sich, sodass die Daten von den Trainingsdaten abweichen. Observability zeigt Ihnen, ob das System zuverlässig arbeitet und das Modell weiterhin genau ist, bevor Benutzer die Auswirkungen bemerken.

Zwei Arten der Überwachung

ML-Observability umfasst zwei Ebenen:

  • Betrieb: Latenz, Durchsatz, Fehler und Ressourcenverbrauch (wie bei jedem Dienst)
  • Modell: Daten-Drift, Verteilung der Vorhersagen und Genauigkeit im Zeitverlauf (ML-spezifisch)

Prometheus für Metriken

Prometheus ist das Standardsystem zum Erfassen von Zeitreihenmetriken. Ihr Dienst stellt einen Metrik-Endpunkt bereit. Prometheus ruft diesen in regelmäßigen Abständen ab und speichert die Werte für Abfragen und Benachrichtigungen.

Latenz instrumentieren

Sie erfassen die Inferenzlatenz mit einem Prometheus-Histogramm. Histogramme ermöglichen die Berechnung von Perzentilen. Das ist die geeignete Methode, um Latenz zusammenzufassen, statt einen irreführenden Durchschnitt zu verwenden.

from prometheus_client import Histogram

INFER_LATENCY = Histogram(
    "inference_latency_seconds",
    "Model inference latency",
)

@INFER_LATENCY.time()
def predict(x):
    return model(x)

P50- und P95-Latenz

Geben Sie die Latenz als Perzentile an. P50 (der Median) beschreibt die typische Erfahrung; P95 bezeichnet den langsamen Randbereich, den 5 % der Anfragen überschreiten. Wenn Sie P95 beobachten, erkennen Sie Probleme, die ein Durchschnittswert verbirgt, denn auch wenige langsame Anfragen beeinträchtigen die Benutzer.

Grafana-Dashboards

Grafana visualisiert Prometheus-Metriken in Live-Dashboards. Ein Modelldashboard zeigt typischerweise Anfragerate, Fehlerrate, P50-/P95-Latenz und die Verteilung der Vorhersagen auf einem Bildschirm, damit der Systemzustand sofort erkennbar ist.

Was ist Datendrift

Datendrift tritt auf, wenn sich die Verteilung der Live-Eingabedaten von der Trainingsverteilung entfernt. Das Modell wurde auf alte Muster angepasst. Wenn sich die Eingabedaten verändern, nimmt seine Genauigkeit daher unbemerkt ab, obwohl kein Code geändert wurde.

Population Stability Index

Der Population Stability Index (PSI) quantifiziert den Drift, indem er die aktuelle Verteilung eines Merkmals mit der Verteilung während des Trainings vergleicht. Beide Verteilungen werden in Intervalle eingeteilt, anschließend wird über diese Intervalle hinweg eine gewichtete Summe von Logarithmus-Verhältnissen gebildet.

# PSI = sum over bins of
#   (actual_pct - expected_pct) * ln(actual_pct / expected_pct)

PSI interpretieren

Übliche PSI-Schwellenwerte:

  • PSI < 0.1: kein signifikanter Drift
  • 0.1 bis 0.2: moderater Drift, Untersuchung erforderlich
  • PSI > 0.2: signifikanter Drift, das Modell muss wahrscheinlich neu trainiert werden

Es ist gängige Praxis, einen Alarm auszulösen, wenn der PSI den Wert 0.2 überschreitet.

Die Feedback-Schleife

Das wertvollste Überwachungssignal sind reale Ergebnisse. Eine Feedback-Schleife erfasst Korrekturen von Benutzerinnen und Benutzern sowie Ground-Truth-Labels (z. B. ob eine Empfehlung angeklickt wurde oder die Betrugsmarkierung korrekt war) und führt sie als neue Trainingsdaten zurück.

Die Feedback-Schleife mit Retraining schließen

Drifterkennung und Feedback-Schleife lösen gemeinsam das Retraining aus: Wenn der PSI den Schwellenwert überschreitet oder die Genauigkeit anhand neuer Labels abnimmt, trainiert die Pipeline das Modell mit aktuellen Daten neu und stellt es erneut bereit. So bleibt das Modell an eine sich verändernde Welt angepasst.

Kurzer Test

Testen Sie Ihr Wissen über Observability.

Zusammenfassung

Sie haben Observability und Monitoring von KI-Systemen kennengelernt:

  • Prometheus erfasst Metriken; melden Sie die Inferenzlatenz als P50/P95
  • Grafana-Dashboards visualisieren den Systemzustand auf einen Blick
  • Datendrift wird mit PSI gemessen; PSI > 0.2 bedeutet, dass ein Retraining erforderlich ist
  • Eine Feedback-Schleife macht aus Korrekturen von Benutzerinnen und Benutzern Trainingsdaten für das Retraining

Häufig gestellte Fragen

Ist die Lektion „Observability und Monitoring von KI-Systemen“ kostenlos?

Ja — der vollständige Text von „Observability und Monitoring von KI-Systemen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Observability und Monitoring von KI-Systemen“?

Dashboards zur Modellleistung, Warnungen bei Data Drift, Feedbackschleifen, Deployment im Shadow Mode. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Observability und Monitoring von KI-Systemen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Architekturmuster für KI-Systeme
  2. Skalierbare ML-Pipelines mit Airflow
  3. Feature Stores: Feast und Tecton
  4. Observability und Monitoring von KI-Systemen
← Zurück zu Learn AI with Python