MLOps Academy · Lektion

Skala till noll och tillbaka

Spara kostnader med efterfrågestyrd autoskalning.

Lektion 2 av 413 steg

Skala till noll och tillbaka är en gratis lektion i MLOps Academy på CoddyKit. Detta är lektion 2 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för MLOps Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i MLOps Academy innehåller totalt 4 lektioner.

Inaktiva modeller kostar pengar

En modellpod som inte får någon trafik förbrukar fortfarande CPU, minne och pengar i molnet. KServe kan skala ned en inaktiv tjänst hela vägen. Scale to zero stoppar det slöseriet. 💸

Drivs av Knative

KServe:s serverlösa läge bygger på Knative, som övervakar mängden förfrågningar och justerar antalet repliker. När trafiken upphör kan alla poddar för tjänsten tas bort.

Efterfrågestyrd autoskalning

Antalet repliker följer efterfrågan, inte ett fast schema. När antalet förfrågningar ökar lägger KServe till poddar, och när de minskar skalar KServe ned igen. Detta är request-driven autoskalning i praktiken.

Ställ in minReplicas på noll

För att tillåta full nedskalning ställer du in minReplicas på 0 i predictor-specifikationen. När noll är tillåtet kan en inaktiv tjänst helt sakna körande poddar.

spec:
  predictor:
    minReplicas: 0
    model:
      modelFormat:
        name: sklearn

Målet för samtidighet

Autoskalaren strävar efter ett visst antal pågående förfrågningar per pod. Detta concurrency-mål avgör hur aggressivt KServe lägger till repliker under belastning.

metadata:
  annotations:
    autoscaling.knative.dev/target: "10"

Skala upp igen

När en förfrågan kommer till en tjänst som skalats ned till noll startar Knative en pod vid behov. Trafiken återupptas så snart poden är redo, så scale up sker automatiskt.

Kostnaden för kallstart

Den första förfrågan efter noll måste vänta på att poden startar och läser in modellen. Denna fördröjning är en cold start, den främsta nackdelen med att skala till noll. ⏱️

När noll är rätt val

Scale to zero passar utmärkt för sporadiska arbetsbelastningar eller belastningar i toppar, där inaktiv tid dominerar. För jämn trafik med höga latenskrav kanske kostnaden för en cold start inte är värd det.

Håll i stället en instans varm

Om kallstarter stör dig ställer du in minReplicas på 1 så att en pod alltid är igång. Du byter lite högre kostnad mot en garanterat warm instans som är redo att servera.

spec:
  predictor:
    minReplicas: 1

Sätt ett tak för uppskalningen

Du kan också begränsa tillväxten med maxReplicas så att en trafikökning aldrig överskrider klustrets budget. Det sätter ett tak för autoskalaren.

spec:
  predictor:
    minReplicas: 0
    maxReplicas: 5

Se skalningen i praktiken

Du kan bekräfta beteendet genom att se hur poddar dyker upp och försvinner med trafiken. Antalet poddar sjunker till noll när tjänsten är inaktiv och ökar igen när anrop kommer in.

kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -w

Snabbkontroll

Vad är den största nackdelen med att låta en tjänst skala till noll?

Sammanfattning

Du har sett hur minReplicas: 0 låter KServe skala inaktiva modeller till noll och tillbaka vid behov. Sätt ett tak med maxReplicas och håll en instans varm om kallstarter är ett problem. Fantastiska framsteg! 🎉

Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Skala till noll och tillbaka” gratis?

Ja – hela texten till ”Skala till noll och tillbaka” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i MLOps Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i MLOps Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Skala till noll och tillbaka”?

Spara kostnader med efterfrågestyrd autoskalning. Ni övar på MLOps Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig MLOps Academy?

Du behöver inga förkunskaper. Utbildningen i MLOps Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.

Hur lång tid tar lektionen ”Skala till noll och tillbaka”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här MLOps Academy-lektionen?

Ja. Varje MLOps Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Resursen InferenceService
  2. Skala till noll och tillbaka
  3. Skriv en anpassad prediktor
  4. KServe kontra Seldon Core
← Tillbaka till MLOps Academy