Naar nul schalen en weer opschalen
Bespaar kosten met autoscaling op basis van requests.
Naar nul schalen en weer opschalen is een gratis MLOps Academy-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject MLOps Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus MLOps Academy bevat in totaal 4 lessen.
Inactieve modellen kosten geld
Een model-Pod zonder verkeer blijft CPU, geheugen en cloudkosten verbruiken. KServe kan een inactieve service helemaal terugschalen. Terugschalen naar nul voorkomt die verspilling. 💸
Aangedreven door Knative
De serverloze modus van KServe gebruikt Knative. Dat houdt de hoeveelheid aanvragen in de gaten en past het aantal replica's aan. Wanneer het verkeer stopt, kan Knative elke Pod voor die service verwijderen.
Automatisch schalen op basis van aanvragen
Replica's volgen de vraag, niet een vast schema. Naarmate het aantal aanvragen stijgt, voegt KServe Pods toe, en wanneer de vraag afneemt, schaalt het weer terug. Dit is automatisch schalen op basis van aanvragen.
minReplicas instellen op nul
Om volledig terugschalen toe te staan, stel je minReplicas in de predictor-specificatie in op 0. Als nul is toegestaan, daalt een inactieve service naar helemaal geen actieve Pods.
spec:
predictor:
minReplicas: 0
model:
modelFormat:
name: sklearnHet gelijktijdigheidsdoel
De autoscaler mikt op een bepaald aantal aanvragen dat per Pod gelijktijdig wordt verwerkt. Dit doel voor gelijktijdigheid bepaalt hoe agressief KServe replica's toevoegt bij hoge belasting.
metadata:
annotations:
autoscaling.knative.dev/target: "10"Weer opschalen
Wanneer er een aanvraag binnenkomt bij een service die naar nul is geschaald, start Knative op verzoek een Pod. Zodra de Pod gereed is, wordt het verkeer hervat. Het opschalen gebeurt dus automatisch.
De kosten van een koude start
De eerste aanvraag na het terugschalen naar nul moet wachten totdat de Pod is gestart en het model is geladen. Deze vertraging heet de koude start en is het belangrijkste nadeel van terugschalen naar nul. ⏱️
Wanneer nul zinvol is
Terugschalen naar nul is ideaal voor onregelmatige of zeldzame werklasten waarbij inactieve tijd overheerst. Voor stabiel verkeer waarbij latentie cruciaal is, is de straf van een koude start misschien niet de moeite waard.
Houd in plaats daarvan één exemplaar warm
Als koude starts problemen geven, stel je minReplicas in op 1, zodat er altijd één Pod actief blijft. Je ruilt wat kosten in voor een gegarandeerd warm exemplaar dat klaarstaat om aanvragen te verwerken.
spec:
predictor:
minReplicas: 1Beperk de bovengrens
Je kunt de groei ook begrenzen met maxReplicas, zodat een verkeerspiek nooit je budget voor het cluster overschrijdt. Daarmee stel je een bovengrens in voor de autoscaler.
spec:
predictor:
minReplicas: 0
maxReplicas: 5Bekijk hoe het schaalt
Je kunt het gedrag bevestigen door te bekijken hoe Pods verschijnen en verdwijnen naargelang het verkeer. Het aantal Pods daalt naar nul wanneer er geen verkeer is en stijgt weer zodra er aanvragen binnenkomen.
kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -wSnelle controle
Wat is het belangrijkste nadeel van een service laten terugschalen naar nul?
Samenvatting
Je hebt gezien hoe minReplicas: 0 KServe inactieve modellen naar nul en op verzoek weer omhoog laat schalen. Stel een bovengrens in met maxReplicas en houd één exemplaar warm als koude starts problemen geven. Goed bezig! 🎉
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “Naar nul schalen en weer opschalen” gratis?
Ja — de volledige tekst van “Naar nul schalen en weer opschalen” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus MLOps Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus MLOps Academy bevat in totaal 4 lessen.
Wat leer ik in “Naar nul schalen en weer opschalen”?
Bespaar kosten met autoscaling op basis van requests. Je oefent met MLOps Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met MLOps Academy te beginnen?
Ervaring vooraf is niet nodig. MLOps Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.
Hoe lang duurt de les “Naar nul schalen en weer opschalen”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over MLOps Academy?
Ja. Elke les over MLOps Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- De InferenceService-resource
- Naar nul schalen en weer opschalen
- Een aangepaste predictor schrijven
- KServe versus Seldon Core