MLOps Academy · leksjon

Aktiver adaptiv mikrobatching

Gruppér forespørsler automatisk for høyere gjennomstrømning.

Leksjon 3 av 413 trinn

Aktiver adaptiv mikrobatching er en gratis leksjon i MLOps Academy på CoddyKit. Dette er leksjon 3 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i MLOps Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i MLOps Academy inneholder totalt 4 leksjoner.

Gjennomstrømmingsproblemet

Det sløser med maskinvaren å kalle en modell én gang per forespørsel. Modeller kjører mye raskere på en batch med inndata enn på de samme inndataene én om gangen. ⚡

Hva mikro-batching gjør

Adaptiv batching samler innkommende forespørsler i et kort tidsvindu, kjører dem sammen og fordeler deretter resultatene automatisk tilbake til hver anroper.

Hvorfor adaptiv

Størrelsen på tidsvinduet er ikke fast. BentoML følger med på ventetiden i sanntid og tilpasser batchstørrelsen slik at den holder seg rask både ved lav og høy belastning.

Det skjer på runner-en

Batching konfigureres per modell, ikke per forespørsel. Du aktiverer det på runnable-objektet ved å markere hvilke metoder som støtter batch-inndata.

Slå det på

For en egendefinert runnable setter du batchable til true på metoden. BentoML grupperer deretter kall til denne metoden i bakgrunnen.

@bentoml.Runnable.method(batchable=True)
def predict(self, inputs):
    ...

Velg batch-aksen

BentoML må vite hvordan inndataene skal stables. Argumentet batch_dim angir hvilken akse de skal konkateneres langs, vanligvis akse 0.

@bentoml.Runnable.method(batchable=True, batch_dim=0)

Begrens batchstørrelsen

Du setter en grense for hvor stor en batch kan bli. max_batch_size begrenser antallet sammenslåtte forespørsler, slik at én gigantisk batch aldri blokkerer andre.

Begrens ventetiden

Du setter også en grense for hvor lenge systemet skal vente. max_latency_ms angir hvor lenge en forespørsel maksimalt kan ligge i køen før batchen kjøres.

Finjuster i konfigurasjonen

Du setter disse grensene uten å endre kode. En bentoml_configuration-fil lar deg justere batching per runner i hvert miljø.

runners:
  predict:
    batching:
      max_batch_size: 32

Avveiningen

Større batcher øker gjennomstrømmingen, men gir litt høyere ventetid per forespørsel. Finjustering handler om å finne det optimale punktet for trafikken din.

Se det i praksis

Du trenger ikke endre klienten i det hele tatt. Anroperne sender fortsatt enkeltforespørsler, mens BentoML slår dem sammen transparent i bakgrunnen.

Hurtigsjekk

Du øker max_batch_size til en stor verdi. Hva er den sannsynlige effekten på én enkelt forespørsel?

Oppsummering

Du har lært at adaptiv batching grupperer forespørsler på en batchable runner, justert med max_batch_size og max_latency_ms, slik at litt ventetid byttes mot høy gjennomstrømming. 🙌

Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
30
Leksjoner
120

Ofte stilte spørsmål

Er leksjonen «Aktiver adaptiv mikrobatching» gratis?

Ja – hele teksten i «Aktiver adaptiv mikrobatching» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av MLOps Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i MLOps Academy inneholder totalt 4 leksjoner.

Hva lærer jeg i «Aktiver adaptiv mikrobatching»?

Gruppér forespørsler automatisk for høyere gjennomstrømning. Du øver på MLOps Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med MLOps Academy?

Ingen tidligere erfaring er nødvendig. MLOps Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.

Hvor lang tid tar leksjonen «Aktiver adaptiv mikrobatching»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne MLOps Academy-leksjonen?

Ja. Alle MLOps Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Lagre en modell i Bento Store
  2. Definer en tjeneste og API-et dens
  3. Aktiver adaptiv mikrobatching
  4. Bygg en Bento og gjør den til en kontainer
← Tilbake til MLOps Academy