Skalér til nul og op igen
Spar penge med request-drevet autoskalering.
Skalér til nul og op igen er en gratis MLOps Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i MLOps Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. MLOps Academy-kurset indeholder 4 lektioner i alt.
Inaktive modeller koster penge
En model-Pod, der står uden trafik, bruger stadig CPU, hukommelse og penge på cloudregningen. KServe kan skalere en inaktiv tjeneste helt ned. Skalering til nul fjerner dette spild. 💸
Drevet af Knative
KServe's serverløse tilstand bygger på Knative, som overvåger mængden af anmodninger og justerer antallet af replikaer. Når trafikken stopper, kan den fjerne alle Pods for tjenesten.
Anmodningsdrevet autoskalering
Antallet af replikaer følger efterspørgslen, ikke en fast tidsplan. Når antallet af anmodninger stiger, tilføjer KServe Pods, og når det falder, skalerer den ned igen. Det er anmodningsdrevet autoskalering i praksis.
Angiv minReplicas til nul
Hvis tjenesten skal kunne skaleres helt ned, angiver du minReplicas til 0 i predictor-specifikationen. Når nul er tilladt, falder en inaktiv tjeneste helt ned til ingen kørende Pods.
spec:
predictor:
minReplicas: 0
model:
modelFormat:
name: sklearnMålet for samtidighed
Autoskaleren sigter mod et bestemt antal samtidige anmodninger pr. Pod. Dette mål for samtidighed afgør, hvor aggressivt KServe tilføjer replikaer under belastning.
metadata:
annotations:
autoscaling.knative.dev/target: "10"Skalér op igen
Når en anmodning ankommer til en tjeneste, der er skaleret til nul, starter Knative en Pod efter behov. Trafikken genoptages, så snart Pod'en er klar, så opskaleringen sker automatisk.
Prisen ved kold opstart
Den første anmodning efter nul skal vente på, at Pod'en starter og indlæser modellen. Denne forsinkelse er den kolde opstart og den vigtigste ulempe ved at skalere til nul. ⏱️
Hvornår nul giver mening
Skalering til nul er ideel til periodiske eller sjældne arbejdsbelastninger, hvor inaktiv tid fylder mest. Ved jævn trafik, hvor svartiden er kritisk, er ulempen ved kold opstart måske ikke besparelsen værd.
Hold i stedet én varm
Hvis kolde opstarter giver problemer, skal du angive minReplicas til 1, så én Pod altid holdes kørende. Du bytter en lille udgift for en garanteret varm instans, der er klar til at servere.
spec:
predictor:
minReplicas: 1Sæt en øvre grænse
Du kan også begrænse væksten med maxReplicas, så en trafikspids aldrig overskrider dit klyngebudget. Det sætter et loft for autoskaleren.
spec:
predictor:
minReplicas: 0
maxReplicas: 5Se skaleringen
Du kan bekræfte funktionsmåden ved at se Pods dukke op og forsvinde sammen med trafikken. Pod-antallet falder til nul, når der er inaktivt, og stiger igen, når anmodninger kommer ind.
kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -wHurtigt tjek
Hvad er den største ulempe ved at lade en tjeneste skalere til nul?
Opsummering
Du har set, hvordan minReplicas: 0 lader KServe skalere inaktive modeller til nul og op igen efter behov. Sæt en grænse med maxReplicas, og hold én instans varm, hvis kolde opstarter giver problemer. Det går rigtig godt! 🎉
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 30
- Lektioner
- 120
Ofte stillede spørgsmål
Er lektionen “Skalér til nul og op igen” gratis?
Ja — hele teksten til “Skalér til nul og op igen” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af MLOps Academy-kurset, skal du opgradere til CoddyKit PRO. MLOps Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Skalér til nul og op igen”?
Spar penge med request-drevet autoskalering. Du øver dig i MLOps Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på MLOps Academy?
Der kræves ingen tidligere erfaring. MLOps Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “Skalér til nul og op igen”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne MLOps Academy-lektion?
Ja. Alle MLOps Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Ressourcen InferenceService
- Skalér til nul og op igen
- Skriv en brugerdefineret predictor
- KServe kontra Seldon Core