MLOps Academy · Les

Naar nul schalen en weer opschalen

Bespaar kosten met autoscaling op basis van requests.

Les 2 van 413 stappen

Naar nul schalen en weer opschalen is een gratis MLOps Academy-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject MLOps Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus MLOps Academy bevat in totaal 4 lessen.

Inactieve modellen kosten geld

Een model-Pod zonder verkeer blijft CPU, geheugen en cloudkosten verbruiken. KServe kan een inactieve service helemaal terugschalen. Terugschalen naar nul voorkomt die verspilling. 💸

Aangedreven door Knative

De serverloze modus van KServe gebruikt Knative. Dat houdt de hoeveelheid aanvragen in de gaten en past het aantal replica's aan. Wanneer het verkeer stopt, kan Knative elke Pod voor die service verwijderen.

Automatisch schalen op basis van aanvragen

Replica's volgen de vraag, niet een vast schema. Naarmate het aantal aanvragen stijgt, voegt KServe Pods toe, en wanneer de vraag afneemt, schaalt het weer terug. Dit is automatisch schalen op basis van aanvragen.

minReplicas instellen op nul

Om volledig terugschalen toe te staan, stel je minReplicas in de predictor-specificatie in op 0. Als nul is toegestaan, daalt een inactieve service naar helemaal geen actieve Pods.

spec:
  predictor:
    minReplicas: 0
    model:
      modelFormat:
        name: sklearn

Het gelijktijdigheidsdoel

De autoscaler mikt op een bepaald aantal aanvragen dat per Pod gelijktijdig wordt verwerkt. Dit doel voor gelijktijdigheid bepaalt hoe agressief KServe replica's toevoegt bij hoge belasting.

metadata:
  annotations:
    autoscaling.knative.dev/target: "10"

Weer opschalen

Wanneer er een aanvraag binnenkomt bij een service die naar nul is geschaald, start Knative op verzoek een Pod. Zodra de Pod gereed is, wordt het verkeer hervat. Het opschalen gebeurt dus automatisch.

De kosten van een koude start

De eerste aanvraag na het terugschalen naar nul moet wachten totdat de Pod is gestart en het model is geladen. Deze vertraging heet de koude start en is het belangrijkste nadeel van terugschalen naar nul. ⏱️

Wanneer nul zinvol is

Terugschalen naar nul is ideaal voor onregelmatige of zeldzame werklasten waarbij inactieve tijd overheerst. Voor stabiel verkeer waarbij latentie cruciaal is, is de straf van een koude start misschien niet de moeite waard.

Houd in plaats daarvan één exemplaar warm

Als koude starts problemen geven, stel je minReplicas in op 1, zodat er altijd één Pod actief blijft. Je ruilt wat kosten in voor een gegarandeerd warm exemplaar dat klaarstaat om aanvragen te verwerken.

spec:
  predictor:
    minReplicas: 1

Beperk de bovengrens

Je kunt de groei ook begrenzen met maxReplicas, zodat een verkeerspiek nooit je budget voor het cluster overschrijdt. Daarmee stel je een bovengrens in voor de autoscaler.

spec:
  predictor:
    minReplicas: 0
    maxReplicas: 5

Bekijk hoe het schaalt

Je kunt het gedrag bevestigen door te bekijken hoe Pods verschijnen en verdwijnen naargelang het verkeer. Het aantal Pods daalt naar nul wanneer er geen verkeer is en stijgt weer zodra er aanvragen binnenkomen.

kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -w

Snelle controle

Wat is het belangrijkste nadeel van een service laten terugschalen naar nul?

Samenvatting

Je hebt gezien hoe minReplicas: 0 KServe inactieve modellen naar nul en op verzoek weer omhoog laat schalen. Stel een bovengrens in met maxReplicas en houd één exemplaar warm als koude starts problemen geven. Goed bezig! 🎉

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Naar nul schalen en weer opschalen” gratis?

Ja — de volledige tekst van “Naar nul schalen en weer opschalen” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus MLOps Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus MLOps Academy bevat in totaal 4 lessen.

Wat leer ik in “Naar nul schalen en weer opschalen”?

Bespaar kosten met autoscaling op basis van requests. Je oefent met MLOps Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met MLOps Academy te beginnen?

Ervaring vooraf is niet nodig. MLOps Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.

Hoe lang duurt de les “Naar nul schalen en weer opschalen”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over MLOps Academy?

Ja. Elke les over MLOps Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. De InferenceService-resource
  2. Naar nul schalen en weer opschalen
  3. Een aangepaste predictor schrijven
  4. KServe versus Seldon Core
← Terug naar MLOps Academy