0Pricing
MLOps Academy · Lektion

Training als Kubernetes-Job ausführen

Führen Sie Batch-Training im Cluster bis zum Abschluss aus.

Training als Kubernetes-Job ausführen ist eine kostenlose MLOps Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des MLOps Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der MLOps Academy-Kurs umfasst insgesamt 4 Lektionen.

Training ist kein Server

Ein Model-Server läuft dauerhaft, ein Trainingslauf hingegen sollte starten, abgeschlossen werden und enden. Kubernetes bietet dafür ein anderes Objekt: den Job. 🏁

Ein Job läuft bis zum Abschluss

Ein Job erstellt einen oder mehrere Pods und überwacht sie, bis sie erfolgreich beendet werden. Sobald das Training erfolgreich war, ist der Job abgeschlossen und gibt seine Ressourcen frei.

apiVersion: batch/v1
kind: Job
metadata:
  name: train-ranker
spec:
  template:
    spec:
      restartPolicy: Never

restartPolicy darf nicht Always sein

Ein Job-Pod muss restartPolicy auf Never oder OnFailure setzen. Always ist für Server gedacht, und Kubernetes lehnt es bei einem Job ab, der beendet werden soll.

Wiederholungen mit backoffLimit

Training kann an einem instabilen Download scheitern. backoffLimit legt fest, wie oft der Job einen fehlgeschlagenen Pod erneut versucht, bevor er endgültig aufgibt.

spec:
  backoffLimit: 4
  activeDeadlineSeconds: 3600

Laufzeit begrenzen, um Endlosschleifen zu vermeiden

Setzen Sie activeDeadlineSeconds so, dass ein festgefahrener Trainingslauf nicht das ganze Wochenende einen teuren GPU-Knoten belegt. Sobald dieses Limit überschritten ist, wird der Job beendet. ⏱️

Die benötigte GPU anfordern

Ein Trainings-Job verwendet denselben Ressourcenblock wie ein Deployment. Fügen Sie unter limits nvidia.com/gpu hinzu, damit der Lauf auf einem GPU-Knoten ausgeführt wird.

Parallelität für Sweeps

Setzen Sie completions und parallelism, um viele Pods auszuführen – ideal für einen Hyperparameter-Sweep, bei dem jeder Pod gleichzeitig eine Konfiguration trainiert.

Logs und Artefakte überleben den Pod

Ein abgeschlossener Job-Pod ist nicht mehr vorhanden. Speichern Sie Ihr Modell und Ihre Metriken daher in dauerhaftem Speicher wie S3 oder einem Volume, niemals im Dateisystem des Pods.

CronJob für geplantes Retraining

Betten Sie einen Job in einen CronJob ein, um das Modell nach einem Zeitplan, etwa jede Nacht, neu zu trainieren. Bei jeder Ausführung des Cron-Ausdrucks wird ein neuer Job erstellt.

apiVersion: batch/v1
kind: CronJob
spec:
  schedule: "0 2 * * *"

Abgeschlossene Jobs bereinigen

Abgeschlossene Jobs bleiben standardmäßig bestehen und überladen den Cluster. Setzen Sie ttlSecondsAfterFinished, damit Kubernetes sie nach einer Kulanzfrist automatisch löscht.

Status mit kubectl überwachen

Prüfen Sie einen Lauf mit kubectl get jobs und lesen Sie die Ausgabe mit kubectl logs. Der Status zeigt auf einen Blick die Anzahl erfolgreicher und fehlgeschlagener Ausführungen.

kubectl get jobs
kubectl logs job/train-ranker

Kurze Prüfung

Warum ist für das Training ein Job und kein Deployment geeignet?

Zusammenfassung

Führen Sie zeitlich begrenztes Training als Job mit restartPolicy Never, einem backoffLimit und einer Laufzeitbegrenzung aus. Planen Sie das Retraining anschließend mit einem CronJob. ✅

Häufig gestellte Fragen

Ist die Lektion „Training als Kubernetes-Job ausführen“ kostenlos?

Ja — der vollständige Text von „Training als Kubernetes-Job ausführen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des MLOps Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der MLOps Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Training als Kubernetes-Job ausführen“?

Führen Sie Batch-Training im Cluster bis zum Abschluss aus. Du übst MLOps Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um MLOps Academy zu starten?

Keine Vorkenntnisse erforderlich. MLOps Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Training als Kubernetes-Job ausführen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser MLOps Academy-Lektion Code schreiben und ausführen?

Ja. Jede MLOps Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Pods, Deployments und Services für Modelle
  2. CPU, Arbeitsspeicher und GPU anfordern
  3. Mit ConfigMaps und Secrets konfigurieren
  4. Training als Kubernetes-Job ausführen
← Zurück zu MLOps Academy