Inferentielatency profileren en optimaliseren
Gebruik perf_analyzer om het optimale punt te vinden.
Inferentielatency profileren en optimaliseren is een gratis MLOps Academy-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject MLOps Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus MLOps Academy bevat in totaal 4 lessen.
Afstellen door te meten
Je kunt niets afstellen wat je niet meet. Leg voordat je instellingen wijzigt echte waarden voor latentie en doorvoer vast onder betrouwbare belasting. 📏
Maak kennis met perf_analyzer
Triton wordt geleverd met perf_analyzer, een hulpprogramma dat je model met aanvragen belast en latentie en doorvoer rapporteert, zodat je configuraties kunt vergelijken.
Een basistest uitvoeren
Je geeft perf_analyzer een model op. Het verstuurt vervolgens synthetische aanvragen en drukt het aantal inferenties per seconde en de uitsplitsing van de latentie af.
perf_analyzer -m my_modelDe gelijktijdigheid doorlopen
De nuttigste optie doorloopt verschillende waarden voor gelijktijdigheid, het aantal aanvragen dat gelijktijdig wordt uitgevoerd. Zo zie je hoe doorvoer en latentie veranderen wanneer de belasting toeneemt.
perf_analyzer -m my_model --concurrency-range 1:8De curve lezen
Naarmate de gelijktijdigheid toeneemt, stijgt de doorvoer eerst en vlakt die daarna af, terwijl de latentie blijft groeien. Het knikpunt van die curve is je praktische werkpunt.
Percentielen gebruiken
Gemiddelden verbergen problemen. Let op de p95-latentie: de waarde die 95 procent van de aanvragen niet overschrijdt, omdat gebruikers vooral de latentie aan het uiteinde van de verdeling ervaren.
De wachtrijvertraging afstellen
Als de latentie te hoog is, verlaag je max_queue_delay_microseconds. Als de doorvoer bij zware belasting te laag is, verhoog je deze waarde om vollere batches te vormen.
De instanties afstellen
Als de GPU onvoldoende wordt gebruikt, voeg je een instantie toe. Als het geheugen krap is of de doorvoer stagneert, verwijder je er een. Wijzig steeds één instelling en meet opnieuw.
Wijzig één ding
Afstellen is een herhalend proces, geen sprong. Pas één instelling aan, voer perf_analyzer opnieuw uit, vergelijk de resultaten en behoud de wijziging alleen als de cijfers echt verbeteren.
Een latentiebudget instellen
Bepaal eerst je budget, bijvoorbeeld p95 onder 50 ms. Verhoog daarna de batchgrootte en het aantal instanties zo ver mogelijk, zolang je binnen die limiet blijft.
Houd het volledige pad in de gaten
De cijfers van de server vertellen niet het hele verhaal. Netwerksprongen en clientcode voegen tijd toe, dus meet ook de latentie van begin tot eind vanaf de locatie van de gebruiker.
Korte controle
Waarom geef je bij het afstellen de voorkeur aan p95-latentie boven gemiddelde latentie?
Samenvatting
Je hebt perf_analyzer gebruikt om de gelijktijdigheid te doorlopen, de curve van doorvoer en latentie bij p95 gelezen en de wachtrijvertraging en instanties binnen een budget afgesteld, steeds met één wijziging tegelijk. 🙌
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “Inferentielatency profileren en optimaliseren” gratis?
Ja — de volledige tekst van “Inferentielatency profileren en optimaliseren” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus MLOps Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus MLOps Academy bevat in totaal 4 lessen.
Wat leer ik in “Inferentielatency profileren en optimaliseren”?
Gebruik perf_analyzer om het optimale punt te vinden. Je oefent met MLOps Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met MLOps Academy te beginnen?
Ervaring vooraf is niet nodig. MLOps Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “Inferentielatency profileren en optimaliseren”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over MLOps Academy?
Ja. Elke les over MLOps Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Waarom GPU's batching nodig hebben
- Dynamische batching configureren in Triton
- Meerdere modelinstanties per GPU uitvoeren
- Inferentielatency profileren en optimaliseren