0Pricing
MLOps Academy · Lekcja

Uruchamianie trenowania jako zadania Kubernetes

Wykonuj wsadowe trenowanie do końca w klastrze

Uruchamianie trenowania jako zadania Kubernetes to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.

Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.

Training Is Not a Server

A model server runs forever, but a training run should start, finish, and stop. Kubernetes has a different object built for that: the Job. 🏁

A Job Runs to Completion

A Job creates one or more Pods and watches them until they exit successfully. Once training succeeds, the Job is done and frees its resources.

apiVersion: batch/v1
kind: Job
metadata:
  name: train-ranker
spec:
  template:
    spec:
      restartPolicy: Never

restartPolicy Must Not Be Always

A Job Pod must use restartPolicy Never or OnFailure. Always is for servers and Kubernetes rejects it for a Job that is meant to end.

Retries with backoffLimit

Training can fail on a flaky download. The backoffLimit sets how many times the Job retries a failing Pod before it gives up for good.

spec:
  backoffLimit: 4
  activeDeadlineSeconds: 3600

Cap Runtime to Avoid Runaways

Set activeDeadlineSeconds so a hung training run cannot burn an expensive GPU node all weekend. The Job is killed once that limit passes. ⏱️

Request the GPU You Need

A training Job uses the same resources block as a Deployment. Add nvidia.com/gpu under limits so the run lands on a GPU node.

Parallelism for Sweeps

Set completions and parallelism to run many Pods, perfect for a hyperparameter sweep where each Pod trains one configuration at once.

Logs and Artifacts Outlive the Pod

A finished Job Pod is gone, so write your model and metrics to durable storage like S3 or a volume, never to the Pod filesystem.

CronJob for Scheduled Retraining

Wrap a Job in a CronJob to retrain on a schedule, like nightly. It creates a fresh Job each time the cron expression fires.

apiVersion: batch/v1
kind: CronJob
spec:
  schedule: "0 2 * * *"

Clean Up Finished Jobs

Completed Jobs linger by default and clutter the cluster. Set ttlSecondsAfterFinished so Kubernetes deletes them automatically after a grace period.

Watch Status with kubectl

Check a run with kubectl get jobs and read output with kubectl logs. The status shows succeeded or failed counts at a glance.

kubectl get jobs
kubectl logs job/train-ranker

Quick Check

Why is a Job, not a Deployment, right for training?

Recap

Run finite training as a Job with restartPolicy Never, a backoffLimit, and a runtime cap, then schedule retraining with a CronJob. ✅

Często zadawane pytania

Czy lekcja „Uruchamianie trenowania jako zadania Kubernetes” jest bezpłatna?

Tak — pełny tekst „Uruchamianie trenowania jako zadania Kubernetes” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Uruchamianie trenowania jako zadania Kubernetes”?

Wykonuj wsadowe trenowanie do końca w klastrze Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?

Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Uruchamianie trenowania jako zadania Kubernetes”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?

Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Pody, wdrożenia i usługi dla modeli
  2. Żądanie CPU, pamięci i GPU
  3. Konfigurowanie za pomocą ConfigMaps i Secrets
  4. Uruchamianie trenowania jako zadania Kubernetes
← Powrót do MLOps Academy