Konfigurer autoskalering og samtidighet
Skaler instanser etter den innkommende trafikken.
Konfigurer autoskalering og samtidighet er en gratis leksjon i MLOps Academy på CoddyKit. Dette er leksjon 3 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i MLOps Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i MLOps Academy inneholder totalt 4 leksjoner.
Tilpass kapasiteten til etterspørselen
Autoskalering legger til containerinstanser når trafikken øker, og fjerner dem når den synker. Dere kan håndtere trafikkøkninger uten å betale for inaktive maskiner. 📈
Samtidighet per instans
Samtidighet er hvor mange forespørsler én instans håndterer samtidig. Det er bryteren som avgjør når plattformen legger til flere instanser.
Skaleringsberegningen
Plattformen deler den innkommende belastningen på samtidighetsgrensen din for å beregne hvor mange instanser som trengs. Lavere samtidighet betyr flere instanser for den samme trafikken.
Angi maksimal samtidighet
På Cloud Run begrenser du antallet forespørsler per instans med --concurrency. Juster verdien etter hvor mange kall modellen kan håndtere uten å bli tregere.
gcloud run deploy model-api --concurrency 8Tunge modeller trenger lave verdier
Hvis hver prediksjon krever mye CPU, vil høy samtidighet sulte ut alle forespørslene. Sett den lavt slik at plattformen fordeler belastningen på flere instanser.
Begrens maksimum
En trafikkflom kan opprette uendelig mange instanser og gi en enorm regning. En grense for maksimalt antall instanser beskytter budsjettet og databaser nedstrøms.
gcloud run deploy model-api --max-instances 20Skalering til null sparer penger
Når minimumsantallet av instanser er null, fjerner plattformen alle containere når de er inaktive. Du betaler ingenting mellom forespørsler, men må tåle en kald oppstart.
Tilpass CPU og minne
Hver instans får CPU-en og minnet du ber om. En stor modell trenger nok minne til å lastes inn, ellers krasjer containeren under oppstart.
gcloud run deploy model-api --memory 2Gi --cpu 2Følg med på forespørselskøen
Når alle instansene har nådd samtidighetsgrensen, venter nye forespørsler i en kø. Økende køtid er signalet ditt om å skalere ut raskere.
Lasttest for å finne riktig nivå
Velg innstillinger basert på målinger, ikke gjetninger. Lasttest økende trafikk og følg med på ventetiden for å finne den samtidigheten som oppfyller SLA-en din.
To brytere, ett mål
Samtidighet og instansgrenser virker sammen for å balansere ventetid mot kostnad. Juster begge for å betjene brukerne raskt uten å bruke for mye penger.
Hurtigsjekk
La oss sjekke hva samtidighet egentlig styrer.
Oppsummering
Du justerte samtidighet, satte en grense for maksimalt antall instanser, tilpasset ressursene og gjennomførte en lasttest. Tjenesten skalerer nå etter behov og budsjett. ⚖️
Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 30
- Leksjoner
- 120
Ofte stilte spørsmål
Er leksjonen «Konfigurer autoskalering og samtidighet» gratis?
Ja – hele teksten i «Konfigurer autoskalering og samtidighet» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av MLOps Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i MLOps Academy inneholder totalt 4 leksjoner.
Hva lærer jeg i «Konfigurer autoskalering og samtidighet»?
Skaler instanser etter den innkommende trafikken. Du øver på MLOps Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med MLOps Academy?
Ingen tidligere erfaring er nødvendig. MLOps Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.
Hvor lang tid tar leksjonen «Konfigurer autoskalering og samtidighet»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne MLOps Academy-leksjonen?
Ja. Alle MLOps Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Send imaget til et register
- Distribuer til et serverløst kontainerkjøremiljø
- Konfigurer autoskalering og samtidighet
- Administrer hemmeligheter og konfigurasjon i skyen