Konfigurér dynamisk batching i Triton
Justér den maksimale batchstørrelse og køforsinkelsen.
Konfigurér dynamisk batching i Triton er en gratis MLOps Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i MLOps Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. MLOps Academy-kurset indeholder 4 lektioner i alt.
Modeller ligger i et modelarkiv
Triton indlæser modeller fra et modelarkiv, en mappe hvor hver model har sin egen undermappe med vægte og en konfigurationsfil.
Filen config.pbtxt
Hver model får en config.pbtxt ved siden af sin versionsmappe. Denne tekstfil fortæller Triton, hvilke input og output der findes, samt hvordan forespørgsler skal planlægges.
Aktivér dynamisk batching
Du slår batching til ved at føje en blok med dynamic_batching til config.pbtxt. Med en tom blok bruger Triton straks fornuftige standardindstillinger.
dynamic_batching {
}Indstil max_batch_size
På øverste niveau indstiller du max_batch_size. Den begrænser, hvor mange forespørgsler Triton samler i ét inferenskald, og sætter dermed en grænse for hukommelse og forsinkelse.
max_batch_size: 32Køforsinkelsen
Den vigtigste indstilling er max_queue_delay_microseconds. Den angiver, hvor længe Triton venter på at samle forespørgsler, før den sender en batch, der endnu ikke er fuld.
dynamic_batching {
max_queue_delay_microseconds: 1000
}Kort forsinkelse, lav forsinkelse
En kort forsinkelse holder forsinkelsen lav, men danner mindre batches ved lav belastning. En længere forsinkelse danner større batches på bekostning af mere ventetid.
Foretrukne batchstørrelser
Du kan angive effektive størrelser med preferred_batch_size. Triton forsøger at samle batches med disse størrelser, som ofte passer til det, modellen kører hurtigst med.
dynamic_batching {
preferred_batch_size: [ 8, 16 ]
}Sådan dannes en batch
Triton holder indkommende forespørgsler i en kø. Den sender dem, når batchen når den maksimale størrelse, passer til en foretrukken størrelse, eller køforsinkelsen udløber.
Ingen ændringer på klienten
Det bedste er, at klienter stadig sender enkeltforespørgsler. Triton samler dem på serveren, så din programkode forbliver præcis den samme.
Genindlæs for at anvende ændringerne
Efter redigering af config.pbtxt genindlæser du modellen, så Triton henter den nye planlægning, enten ved at genstarte eller via modelstyrings-API'et.
Start forsigtigt
Begynd med en moderat max_batch_size og en meget lille køforsinkelse, og øg dem derefter, mens du holder øje med forsinkelsen. Finjustering baseret på målinger er bedre end gætteri.
Hurtigt tjek
Hvilket konfigurationsfelt styrer, hvor længe Triton venter, før den sender en delvist fuld batch?
Opsummering
Du aktiverede dynamic_batching i config.pbtxt, satte en grænse med max_batch_size og finjusterede køforsinkelsen og de foretrukne størrelser – alt sammen uden at ændre klienten. 🙌
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 30
- Lektioner
- 120
Ofte stillede spørgsmål
Er lektionen “Konfigurér dynamisk batching i Triton” gratis?
Ja — hele teksten til “Konfigurér dynamisk batching i Triton” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af MLOps Academy-kurset, skal du opgradere til CoddyKit PRO. MLOps Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Konfigurér dynamisk batching i Triton”?
Justér den maksimale batchstørrelse og køforsinkelsen. Du øver dig i MLOps Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på MLOps Academy?
Der kræves ingen tidligere erfaring. MLOps Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “Konfigurér dynamisk batching i Triton”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne MLOps Academy-lektion?
Ja. Alle MLOps Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Hvorfor GPU'er kræver batching
- Konfigurér dynamisk batching i Triton
- Kør flere modelinstanser pr. GPU
- Profilér og justér inferenslatenstid