MLOps Academy · Lektion

Skalér til nul og op igen

Spar penge med request-drevet autoskalering.

Lektion 2 af 413 trin

Skalér til nul og op igen er en gratis MLOps Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i MLOps Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. MLOps Academy-kurset indeholder 4 lektioner i alt.

Inaktive modeller koster penge

En model-Pod, der står uden trafik, bruger stadig CPU, hukommelse og penge på cloudregningen. KServe kan skalere en inaktiv tjeneste helt ned. Skalering til nul fjerner dette spild. 💸

Drevet af Knative

KServe's serverløse tilstand bygger på Knative, som overvåger mængden af anmodninger og justerer antallet af replikaer. Når trafikken stopper, kan den fjerne alle Pods for tjenesten.

Anmodningsdrevet autoskalering

Antallet af replikaer følger efterspørgslen, ikke en fast tidsplan. Når antallet af anmodninger stiger, tilføjer KServe Pods, og når det falder, skalerer den ned igen. Det er anmodningsdrevet autoskalering i praksis.

Angiv minReplicas til nul

Hvis tjenesten skal kunne skaleres helt ned, angiver du minReplicas til 0 i predictor-specifikationen. Når nul er tilladt, falder en inaktiv tjeneste helt ned til ingen kørende Pods.

spec:
  predictor:
    minReplicas: 0
    model:
      modelFormat:
        name: sklearn

Målet for samtidighed

Autoskaleren sigter mod et bestemt antal samtidige anmodninger pr. Pod. Dette mål for samtidighed afgør, hvor aggressivt KServe tilføjer replikaer under belastning.

metadata:
  annotations:
    autoscaling.knative.dev/target: "10"

Skalér op igen

Når en anmodning ankommer til en tjeneste, der er skaleret til nul, starter Knative en Pod efter behov. Trafikken genoptages, så snart Pod'en er klar, så opskaleringen sker automatisk.

Prisen ved kold opstart

Den første anmodning efter nul skal vente på, at Pod'en starter og indlæser modellen. Denne forsinkelse er den kolde opstart og den vigtigste ulempe ved at skalere til nul. ⏱️

Hvornår nul giver mening

Skalering til nul er ideel til periodiske eller sjældne arbejdsbelastninger, hvor inaktiv tid fylder mest. Ved jævn trafik, hvor svartiden er kritisk, er ulempen ved kold opstart måske ikke besparelsen værd.

Hold i stedet én varm

Hvis kolde opstarter giver problemer, skal du angive minReplicas til 1, så én Pod altid holdes kørende. Du bytter en lille udgift for en garanteret varm instans, der er klar til at servere.

spec:
  predictor:
    minReplicas: 1

Sæt en øvre grænse

Du kan også begrænse væksten med maxReplicas, så en trafikspids aldrig overskrider dit klyngebudget. Det sætter et loft for autoskaleren.

spec:
  predictor:
    minReplicas: 0
    maxReplicas: 5

Se skaleringen

Du kan bekræfte funktionsmåden ved at se Pods dukke op og forsvinde sammen med trafikken. Pod-antallet falder til nul, når der er inaktivt, og stiger igen, når anmodninger kommer ind.

kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -w

Hurtigt tjek

Hvad er den største ulempe ved at lade en tjeneste skalere til nul?

Opsummering

Du har set, hvordan minReplicas: 0 lader KServe skalere inaktive modeller til nul og op igen efter behov. Sæt en grænse med maxReplicas, og hold én instans varm, hvis kolde opstarter giver problemer. Det går rigtig godt! 🎉

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “Skalér til nul og op igen” gratis?

Ja — hele teksten til “Skalér til nul og op igen” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af MLOps Academy-kurset, skal du opgradere til CoddyKit PRO. MLOps Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Skalér til nul og op igen”?

Spar penge med request-drevet autoskalering. Du øver dig i MLOps Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på MLOps Academy?

Der kræves ingen tidligere erfaring. MLOps Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.

Hvor lang tid tager lektionen “Skalér til nul og op igen”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne MLOps Academy-lektion?

Ja. Alle MLOps Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Ressourcen InferenceService
  2. Skalér til nul og op igen
  3. Skriv en brugerdefineret predictor
  4. KServe kontra Seldon Core
← Tilbage til MLOps Academy