Włączanie adaptacyjnego mikrobatchingu
Automatycznie grupuj żądania, aby zwiększyć przepustowość
Włączanie adaptacyjnego mikrobatchingu to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Problem z przepustowością
Wywoływanie modelu raz na żądanie marnuje zasoby sprzętowe. Modele działają znacznie szybciej na batch danych wejściowych niż na tych samych danych przetwarzanych pojedynczo. ⚡
Jak działa mikropartia
Adaptive batching przez krótki czas gromadzi przychodzące żądania, przetwarza je razem, a następnie automatycznie rozdziela wyniki między poszczególnych wywołujących.
Dlaczego adaptacyjne
Rozmiar okna nie jest stały. BentoML obserwuje opóźnienie w czasie rzeczywistym i adapts rozmiar partii, aby zachować szybkość zarówno przy małym, jak i dużym obciążeniu.
Działa na runnerze
Partiowanie konfiguruje się dla modelu, a nie dla pojedynczego żądania. Włączasz je w obiekcie runnable, oznaczając metody obsługujące dane wejściowe w partiach.
Włącz partiowanie
Własny runnable konfiguruje się, ustawiając batchable na true dla danej metody. Następnie BentoML grupuje wywołania tej metody w tle.
@bentoml.Runnable.method(batchable=True)
def predict(self, inputs):
...Wybierz wymiar partii
BentoML musi wiedzieć, jak układać dane wejściowe. Argument batch_dim wskazuje oś, wzdłuż której należy je łączyć, zwykle oś 0.
@bentoml.Runnable.method(batchable=True, batch_dim=0)Ogranicz rozmiar partii
Określasz maksymalny rozmiar partii. max_batch_size ogranicza liczbę scalanych żądań, dzięki czemu jedna ogromna partia nigdy nie blokuje pozostałych.
Ogranicz czas oczekiwania
Określasz również maksymalny czas oczekiwania. max_latency_ms ustala, jak długo żądanie może znajdować się w kolejce, zanim partia zostanie uruchomiona.
Dostosuj konfigurację
Te limity można ustawić bez zmieniania kodu. Plik bentoml_configuration umożliwia dostosowanie partiowania dla każdego runnera i każdego środowiska.
runners:
predict:
batching:
max_batch_size: 32Kompromis
Większe partie zwiększają przepustowość, ale nieco podnoszą latency pojedynczych żądań. Dostosowanie ustawień polega na znalezieniu najlepszego punktu dla danego ruchu.
Obserwuj działanie
Nie musisz w ogóle zmieniać klienta. Wywołujący nadal wysyłają pojedyncze żądania, a BentoML przejrzyście merges je w tle.
Szybkie sprawdzenie
Zwiększasz max_batch_size do dużej wartości. Jaki będzie prawdopodobny wpływ na pojedyncze żądanie?
Podsumowanie
Dowiedziałeś się, że adaptive batching grupuje żądania na batchable runnerze. Ustawienia max_batch_size i max_latency_ms pozwalają zamienić niewielki wzrost opóźnienia na znaczny wzrost przepustowości. 🙌
Często zadawane pytania
Czy lekcja „Włączanie adaptacyjnego mikrobatchingu” jest bezpłatna?
Tak — pełny tekst „Włączanie adaptacyjnego mikrobatchingu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Włączanie adaptacyjnego mikrobatchingu”?
Automatycznie grupuj żądania, aby zwiększyć przepustowość Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?
Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.
Ile czasu zajmuje lekcja „Włączanie adaptacyjnego mikrobatchingu”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?
Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Zapisywanie modelu w Bento Store
- Definiowanie usługi i jej API
- Włączanie adaptacyjnego mikrobatchingu
- Budowanie Bento i umieszczanie go w kontenerze