Profilowanie i dostrajanie opóźnienia predykcji
Użyj perf_analyzer, aby znaleźć optymalny punkt
Profilowanie i dostrajanie opóźnienia predykcji to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.
DostrajanIe na podstawie pomiarów
Nie da się dostroić czegoś, czego się nie mierzy. Zanim zmienisz ustawienia, zbierz rzeczywiste wartości opóźnienia i przepustowości przy wiarygodnym obciążeniu. 📏
Poznaj perf_analyzer
Do Tritona dołączone jest narzędzie perf_analyzer, które intensywnie wysyła żądania do modelu i raportuje opóźnienie oraz przepustowość, aby można było porównywać konfiguracje.
Uruchom podstawowy test
Wskazujesz model narzędziu perf_analyzer, a ono wysyła syntetyczne żądania, po czym wyświetla liczbę inferencji na sekundę oraz zestawienie opóźnienia.
perf_analyzer -m my_modelPrzetestuj różne poziomy współbieżności
Najbardziej przydatna opcja testuje różne wartości współbieżności, czyli liczby żądań obsługiwanych jednocześnie. Pokazuje, jak zmieniają się przepustowość i opóźnienie wraz ze wzrostem obciążenia.
perf_analyzer -m my_model --concurrency-range 1:8Odczytaj wykres
Wraz ze wzrostem współbieżności przepustowość rośnie, a następnie się wypłaszcza, podczas gdy opóźnienie nadal rośnie. Punkt załamania tej krzywej to praktyczny punkt pracy.
Używaj percentyli
Średnie wartości ukrywają problemy. Obserwuj opóźnienie p95 — wartość, poniżej której mieści się czas obsługi 95 procent żądań — ponieważ to opóźnienie na końcu rozkładu odczuwają użytkownicy.
Dostrój opóźnienie kolejki
Jeśli opóźnienie jest zbyt wysokie, zmniejsz max_queue_delay_microseconds. Jeśli przy dużym obciążeniu przepustowość jest zbyt niska, zwiększ tę wartość, aby tworzyć pełniejsze partie.
Dostrój liczbę instancji
Jeśli GPU jest niedostatecznie wykorzystywany, dodaj instancję. Jeśli brakuje pamięci lub przepustowość przestaje rosnąć, usuń jedną. Zmieniaj jeden parametr naraz i ponownie wykonuj pomiary.
Zmieniaj jedną rzecz naraz
Strojenie to pętla, a nie pojedynczy skok. Zmień jedno ustawienie, ponownie uruchom perf_analyzer, porównaj wyniki i zachowaj zmianę tylko wtedy, gdy wartości rzeczywiście się poprawią.
Ustal budżet opóźnienia
Najpierw określ swój budżet, na przykład p95 poniżej 50 ms. Następnie zwiększaj rozmiar partii i liczbę instancji tak bardzo, jak to możliwe, pozostając w tym limicie.
Uwzględnij całą ścieżkę
Wyniki serwera nie pokazują pełnego obrazu. Przeskoki sieciowe i kod klienta również dodają czas, dlatego mierz także opóźnienie od końca do końca z miejsca, w którym znajduje się użytkownik.
Szybkie sprawdzenie
Dlaczego podczas strojenia warto preferować opóźnienie p95 zamiast średniego opóźnienia?
Podsumowanie
Użyłeś narzędzia perf_analyzer do przetestowania różnych poziomów współbieżności, odczytałeś krzywą przepustowości i opóźnienia dla p95 oraz dostroiłeś opóźnienie kolejki i liczbę instancji w ramach ustalonego budżetu, zmieniając jedną rzecz naraz. 🙌
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Profilowanie i dostrajanie opóźnienia predykcji” jest bezpłatna?
Tak — pełny tekst „Profilowanie i dostrajanie opóźnienia predykcji” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Profilowanie i dostrajanie opóźnienia predykcji”?
Użyj perf_analyzer, aby znaleźć optymalny punkt Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?
Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Profilowanie i dostrajanie opóźnienia predykcji”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?
Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego GPU potrzebują batchingu
- Konfigurowanie dynamicznego batchingu w Triton
- Uruchamianie wielu instancji modelu na jednym GPU
- Profilowanie i dostrajanie opóźnienia predykcji