MLOps Academy · leksjon

Konfigurer autoskalering og samtidighet

Skaler instanser etter den innkommende trafikken.

Leksjon 3 av 413 trinn

Konfigurer autoskalering og samtidighet er en gratis leksjon i MLOps Academy på CoddyKit. Dette er leksjon 3 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i MLOps Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i MLOps Academy inneholder totalt 4 leksjoner.

Tilpass kapasiteten til etterspørselen

Autoskalering legger til containerinstanser når trafikken øker, og fjerner dem når den synker. Dere kan håndtere trafikkøkninger uten å betale for inaktive maskiner. 📈

Samtidighet per instans

Samtidighet er hvor mange forespørsler én instans håndterer samtidig. Det er bryteren som avgjør når plattformen legger til flere instanser.

Skaleringsberegningen

Plattformen deler den innkommende belastningen på samtidighetsgrensen din for å beregne hvor mange instanser som trengs. Lavere samtidighet betyr flere instanser for den samme trafikken.

Angi maksimal samtidighet

På Cloud Run begrenser du antallet forespørsler per instans med --concurrency. Juster verdien etter hvor mange kall modellen kan håndtere uten å bli tregere.

gcloud run deploy model-api --concurrency 8

Tunge modeller trenger lave verdier

Hvis hver prediksjon krever mye CPU, vil høy samtidighet sulte ut alle forespørslene. Sett den lavt slik at plattformen fordeler belastningen på flere instanser.

Begrens maksimum

En trafikkflom kan opprette uendelig mange instanser og gi en enorm regning. En grense for maksimalt antall instanser beskytter budsjettet og databaser nedstrøms.

gcloud run deploy model-api --max-instances 20

Skalering til null sparer penger

Når minimumsantallet av instanser er null, fjerner plattformen alle containere når de er inaktive. Du betaler ingenting mellom forespørsler, men må tåle en kald oppstart.

Tilpass CPU og minne

Hver instans får CPU-en og minnet du ber om. En stor modell trenger nok minne til å lastes inn, ellers krasjer containeren under oppstart.

gcloud run deploy model-api --memory 2Gi --cpu 2

Følg med på forespørselskøen

Når alle instansene har nådd samtidighetsgrensen, venter nye forespørsler i en kø. Økende køtid er signalet ditt om å skalere ut raskere.

Lasttest for å finne riktig nivå

Velg innstillinger basert på målinger, ikke gjetninger. Lasttest økende trafikk og følg med på ventetiden for å finne den samtidigheten som oppfyller SLA-en din.

To brytere, ett mål

Samtidighet og instansgrenser virker sammen for å balansere ventetid mot kostnad. Juster begge for å betjene brukerne raskt uten å bruke for mye penger.

Hurtigsjekk

La oss sjekke hva samtidighet egentlig styrer.

Oppsummering

Du justerte samtidighet, satte en grense for maksimalt antall instanser, tilpasset ressursene og gjennomførte en lasttest. Tjenesten skalerer nå etter behov og budsjett. ⚖️

Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
30
Leksjoner
120

Ofte stilte spørsmål

Er leksjonen «Konfigurer autoskalering og samtidighet» gratis?

Ja – hele teksten i «Konfigurer autoskalering og samtidighet» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av MLOps Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i MLOps Academy inneholder totalt 4 leksjoner.

Hva lærer jeg i «Konfigurer autoskalering og samtidighet»?

Skaler instanser etter den innkommende trafikken. Du øver på MLOps Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med MLOps Academy?

Ingen tidligere erfaring er nødvendig. MLOps Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.

Hvor lang tid tar leksjonen «Konfigurer autoskalering og samtidighet»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne MLOps Academy-leksjonen?

Ja. Alle MLOps Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Send imaget til et register
  2. Distribuer til et serverløst kontainerkjøremiljø
  3. Konfigurer autoskalering og samtidighet
  4. Administrer hemmeligheter og konfigurasjon i skyen
← Tilbake til MLOps Academy