Meerdere modelinstanties per GPU uitvoeren
Gebruik gelijktijdige uitvoering om de benutting te verhogen.
Meerdere modelinstanties per GPU uitvoeren is een gratis MLOps Academy-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject MLOps Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus MLOps Academy bevat in totaal 4 lessen.
Eén kopie kan alles vertragen
Met één modelkopie moet aanvraag twee wachten terwijl aanvraag één wordt uitgevoerd. Zelfs een snelle GPU kan tussen aanroepen inactief zijn, waardoor je doorvoer misloopt.
Meerdere kopieën uitvoeren
Triton kan meerdere instanties van hetzelfde model laden, zodat meerdere aanvragen gelijktijdig worden uitgevoerd en hun werk op de GPU overlapt.
Het blok instance_group
Je declareert kopieën met instance_group in config.pbtxt. Het veld count geeft aan hoeveel instanties Triton voor dat model moet maken.
instance_group {
count: 2
kind: KIND_GPU
}GPU of CPU kiezen
Het veld kind kiest het apparaat. KIND_GPU voert instanties uit op de GPU, terwijl KIND_CPU ze op de hostprocessor uitvoert.
Ze op GPU's plaatsen
Je kunt instanties aan specifieke kaarten toewijzen met een lijst gpus. Zo kan één model zijn kopieën over meerdere GPU's op dezelfde server verdelen.
instance_group {
count: 2
kind: KIND_GPU
gpus: [ 0, 1 ]
}Waarom dit helpt
Terwijl één instantie berekeningen uitvoert, kan een andere invoer laden of resultaten kopiëren. Deze overlapping verbergt inactieve tussenruimtes en verhoogt het totale gebruik.
Het werkt samen met batching
Instanties en dynamische batching werken samen. Batching vult elke aanroep, terwijl meerdere instanties ervoor zorgen dat er tegelijk meer dan één aanroep wordt uitgevoerd.
Let op het geheugen
Elke instantie houdt een eigen kopie van de gewichten in het GPU-geheugen. Met te veel kopieën raakt je VRAM op, dus verhoog je het aantal geleidelijk.
Meer is niet altijd sneller
Na een bepaald punt concurreren extra instanties alleen nog om dezelfde rekenkracht. De doorvoer vlakt af of daalt, dus je bepaalt het beste aantal door te meten in plaats van te raden.
Houd rekening met gelijktijdigheid
Het juiste aantal instanties hangt af van hoeveel aanvragen tegelijk binnenkomen. Stem het aantal instanties af op je werkelijke gelijktijdigheid om zowel vertragingen als verspilling te voorkomen.
Een verstandig beginpunt
Twee instanties per GPU is een gebruikelijk beginpunt. Test met realistische belasting en pas het aantal daarna omhoog of omlaag aan op basis van wat je ziet.
Korte controle
Wat doet het instellen van count op 2 in een instance_group?
Samenvatting
Je hebt geleerd hoe je meerdere modelkopieën uitvoert via instance_group en instanties met batching combineert voor parallellisme, terwijl je het VRAM bewaakt en het aantal op basis van metingen afstelt. 🙌
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “Meerdere modelinstanties per GPU uitvoeren” gratis?
Ja — de volledige tekst van “Meerdere modelinstanties per GPU uitvoeren” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus MLOps Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus MLOps Academy bevat in totaal 4 lessen.
Wat leer ik in “Meerdere modelinstanties per GPU uitvoeren”?
Gebruik gelijktijdige uitvoering om de benutting te verhogen. Je oefent met MLOps Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met MLOps Academy te beginnen?
Ervaring vooraf is niet nodig. MLOps Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.
Hoe lang duurt de les “Meerdere modelinstanties per GPU uitvoeren”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over MLOps Academy?
Ja. Elke les over MLOps Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Waarom GPU's batching nodig hebben
- Dynamische batching configureren in Triton
- Meerdere modelinstanties per GPU uitvoeren
- Inferentielatency profileren en optimaliseren