MLOps Academy · Lektion

Konfigurera autoskalning och samtidighet

Skala instanserna efter inkommande trafik.

Lektion 3 av 413 steg

Konfigurera autoskalning och samtidighet är en gratis lektion i MLOps Academy på CoddyKit. Detta är lektion 3 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för MLOps Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i MLOps Academy innehåller totalt 4 lektioner.

Anpassa kapaciteten efter efterfrågan

Autoskalning lägger till containerinstanser när trafiken ökar och tar bort dem när den minskar. Ni kan hantera trafiktoppar utan att betala för inaktiva maskiner. 📈

Samtidighet per instans

Concurrency anger hur många förfrågningar en instans hanterar samtidigt. Det är reglaget som avgör när plattformen lägger till fler instanser.

Skalningsmatematiken

Plattformen delar den inkommande belastningen med din concurrency för att beräkna hur många instanser som behövs. Lägre concurrency innebär fler instanser för samma trafik.

Ange maximal concurrency

I Cloud Run begränsar du antalet förfrågningar per instans med --concurrency. Anpassa värdet efter hur många anrop din modell kan hantera utan att bli långsammare.

gcloud run deploy model-api --concurrency 8

Tunga modeller vill ha låga värden

Om varje prediktion kräver mycket CPU svälter hög concurrency ut varje förfrågan på resurser. Ange ett lågt värde så att plattformen fördelar belastningen över fler instanser.

Begränsa maxvärdet

En trafikflod kan skapa oändligt många instanser och en enorm kostnad. En gräns för max instances skyddar din budget och underliggande databaser.

gcloud run deploy model-api --max-instances 20

Skalning till noll sparar pengar

När minsta antalet instanser är noll tar plattformen bort alla containrar när de är inaktiva. Du betalar ingenting mellan förfrågningar, men får i stället en cold start.

Anpassa CPU och minne

Varje instans får den CPU och det minne du begär. En stor modell behöver tillräckligt med minne för att läsas in, annars kraschar containern vid starten.

gcloud run deploy model-api --memory 2Gi --cpu 2

Övervaka kön för förfrågningar

När alla instanser har nått sin concurrency-gräns får nya förfrågningar vänta i en kö. En ökande kötid visar att du behöver skala ut snabbare.

Belastningstesta för att hitta rätt nivå

Välj inställningar genom att mäta, inte gissa. Belastningstesta ökande trafik och övervaka svarstiden för att hitta den concurrency som uppfyller ditt SLA.

Två reglage, ett mål

Concurrency och instansbegränsningar samverkar för att balansera svarstid mot kostnad. Anpassa båda så att användarna får snabba svar utan onödiga utgifter.

Snabbkontroll

Låt oss kontrollera vad concurrency faktiskt styr.

Sammanfattning

Du anpassade concurrency, begränsade det maximala antalet instanser, anpassade resurserna och belastningstestade. Nu skalar tjänsten efter efterfrågan och budget. ⚖️

Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Konfigurera autoskalning och samtidighet” gratis?

Ja – hela texten till ”Konfigurera autoskalning och samtidighet” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i MLOps Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i MLOps Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Konfigurera autoskalning och samtidighet”?

Skala instanserna efter inkommande trafik. Ni övar på MLOps Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig MLOps Academy?

Du behöver inga förkunskaper. Utbildningen i MLOps Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 3 av 4.

Hur lång tid tar lektionen ”Konfigurera autoskalning och samtidighet”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här MLOps Academy-lektionen?

Ja. Varje MLOps Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Skicka din avbildning till ett register
  2. Distribuera till en serverless container-runtime
  3. Konfigurera autoskalning och samtidighet
  4. Hantera hemligheter och konfiguration i molnet
← Tillbaka till MLOps Academy