MLOps Academy · Les

Meerdere modelinstanties per GPU uitvoeren

Gebruik gelijktijdige uitvoering om de benutting te verhogen.

Les 3 van 413 stappen

Meerdere modelinstanties per GPU uitvoeren is een gratis MLOps Academy-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject MLOps Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus MLOps Academy bevat in totaal 4 lessen.

Eén kopie kan alles vertragen

Met één modelkopie moet aanvraag twee wachten terwijl aanvraag één wordt uitgevoerd. Zelfs een snelle GPU kan tussen aanroepen inactief zijn, waardoor je doorvoer misloopt.

Meerdere kopieën uitvoeren

Triton kan meerdere instanties van hetzelfde model laden, zodat meerdere aanvragen gelijktijdig worden uitgevoerd en hun werk op de GPU overlapt.

Het blok instance_group

Je declareert kopieën met instance_group in config.pbtxt. Het veld count geeft aan hoeveel instanties Triton voor dat model moet maken.

instance_group {
  count: 2
  kind: KIND_GPU
}

GPU of CPU kiezen

Het veld kind kiest het apparaat. KIND_GPU voert instanties uit op de GPU, terwijl KIND_CPU ze op de hostprocessor uitvoert.

Ze op GPU's plaatsen

Je kunt instanties aan specifieke kaarten toewijzen met een lijst gpus. Zo kan één model zijn kopieën over meerdere GPU's op dezelfde server verdelen.

instance_group {
  count: 2
  kind: KIND_GPU
  gpus: [ 0, 1 ]
}

Waarom dit helpt

Terwijl één instantie berekeningen uitvoert, kan een andere invoer laden of resultaten kopiëren. Deze overlapping verbergt inactieve tussenruimtes en verhoogt het totale gebruik.

Het werkt samen met batching

Instanties en dynamische batching werken samen. Batching vult elke aanroep, terwijl meerdere instanties ervoor zorgen dat er tegelijk meer dan één aanroep wordt uitgevoerd.

Let op het geheugen

Elke instantie houdt een eigen kopie van de gewichten in het GPU-geheugen. Met te veel kopieën raakt je VRAM op, dus verhoog je het aantal geleidelijk.

Meer is niet altijd sneller

Na een bepaald punt concurreren extra instanties alleen nog om dezelfde rekenkracht. De doorvoer vlakt af of daalt, dus je bepaalt het beste aantal door te meten in plaats van te raden.

Houd rekening met gelijktijdigheid

Het juiste aantal instanties hangt af van hoeveel aanvragen tegelijk binnenkomen. Stem het aantal instanties af op je werkelijke gelijktijdigheid om zowel vertragingen als verspilling te voorkomen.

Een verstandig beginpunt

Twee instanties per GPU is een gebruikelijk beginpunt. Test met realistische belasting en pas het aantal daarna omhoog of omlaag aan op basis van wat je ziet.

Korte controle

Wat doet het instellen van count op 2 in een instance_group?

Samenvatting

Je hebt geleerd hoe je meerdere modelkopieën uitvoert via instance_group en instanties met batching combineert voor parallellisme, terwijl je het VRAM bewaakt en het aantal op basis van metingen afstelt. 🙌

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Meerdere modelinstanties per GPU uitvoeren” gratis?

Ja — de volledige tekst van “Meerdere modelinstanties per GPU uitvoeren” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus MLOps Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus MLOps Academy bevat in totaal 4 lessen.

Wat leer ik in “Meerdere modelinstanties per GPU uitvoeren”?

Gebruik gelijktijdige uitvoering om de benutting te verhogen. Je oefent met MLOps Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met MLOps Academy te beginnen?

Ervaring vooraf is niet nodig. MLOps Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.

Hoe lang duurt de les “Meerdere modelinstanties per GPU uitvoeren”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over MLOps Academy?

Ja. Elke les over MLOps Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Waarom GPU's batching nodig hebben
  2. Dynamische batching configureren in Triton
  3. Meerdere modelinstanties per GPU uitvoeren
  4. Inferentielatency profileren en optimaliseren
← Terug naar MLOps Academy