Skala till noll och tillbaka
Spara kostnader med efterfrågestyrd autoskalning.
Skala till noll och tillbaka är en gratis lektion i MLOps Academy på CoddyKit. Detta är lektion 2 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för MLOps Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i MLOps Academy innehåller totalt 4 lektioner.
Inaktiva modeller kostar pengar
En modellpod som inte får någon trafik förbrukar fortfarande CPU, minne och pengar i molnet. KServe kan skala ned en inaktiv tjänst hela vägen. Scale to zero stoppar det slöseriet. 💸
Drivs av Knative
KServe:s serverlösa läge bygger på Knative, som övervakar mängden förfrågningar och justerar antalet repliker. När trafiken upphör kan alla poddar för tjänsten tas bort.
Efterfrågestyrd autoskalning
Antalet repliker följer efterfrågan, inte ett fast schema. När antalet förfrågningar ökar lägger KServe till poddar, och när de minskar skalar KServe ned igen. Detta är request-driven autoskalning i praktiken.
Ställ in minReplicas på noll
För att tillåta full nedskalning ställer du in minReplicas på 0 i predictor-specifikationen. När noll är tillåtet kan en inaktiv tjänst helt sakna körande poddar.
spec:
predictor:
minReplicas: 0
model:
modelFormat:
name: sklearnMålet för samtidighet
Autoskalaren strävar efter ett visst antal pågående förfrågningar per pod. Detta concurrency-mål avgör hur aggressivt KServe lägger till repliker under belastning.
metadata:
annotations:
autoscaling.knative.dev/target: "10"Skala upp igen
När en förfrågan kommer till en tjänst som skalats ned till noll startar Knative en pod vid behov. Trafiken återupptas så snart poden är redo, så scale up sker automatiskt.
Kostnaden för kallstart
Den första förfrågan efter noll måste vänta på att poden startar och läser in modellen. Denna fördröjning är en cold start, den främsta nackdelen med att skala till noll. ⏱️
När noll är rätt val
Scale to zero passar utmärkt för sporadiska arbetsbelastningar eller belastningar i toppar, där inaktiv tid dominerar. För jämn trafik med höga latenskrav kanske kostnaden för en cold start inte är värd det.
Håll i stället en instans varm
Om kallstarter stör dig ställer du in minReplicas på 1 så att en pod alltid är igång. Du byter lite högre kostnad mot en garanterat warm instans som är redo att servera.
spec:
predictor:
minReplicas: 1Sätt ett tak för uppskalningen
Du kan också begränsa tillväxten med maxReplicas så att en trafikökning aldrig överskrider klustrets budget. Det sätter ett tak för autoskalaren.
spec:
predictor:
minReplicas: 0
maxReplicas: 5Se skalningen i praktiken
Du kan bekräfta beteendet genom att se hur poddar dyker upp och försvinner med trafiken. Antalet poddar sjunker till noll när tjänsten är inaktiv och ökar igen när anrop kommer in.
kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -wSnabbkontroll
Vad är den största nackdelen med att låta en tjänst skala till noll?
Sammanfattning
Du har sett hur minReplicas: 0 låter KServe skala inaktiva modeller till noll och tillbaka vid behov. Sätt ett tak med maxReplicas och håll en instans varm om kallstarter är ett problem. Fantastiska framsteg! 🎉
Lär dig Python med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 30
- Lektioner
- 120
Vanliga frågor
Är lektionen ”Skala till noll och tillbaka” gratis?
Ja – hela texten till ”Skala till noll och tillbaka” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i MLOps Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i MLOps Academy innehåller totalt 4 lektioner.
Vad lär jag mig i ”Skala till noll och tillbaka”?
Spara kostnader med efterfrågestyrd autoskalning. Ni övar på MLOps Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig MLOps Academy?
Du behöver inga förkunskaper. Utbildningen i MLOps Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.
Hur lång tid tar lektionen ”Skala till noll och tillbaka”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här MLOps Academy-lektionen?
Ja. Varje MLOps Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Resursen InferenceService
- Skala till noll och tillbaka
- Skriv en anpassad prediktor
- KServe kontra Seldon Core