0Pricing
MLOps Academy · Lekcja

Włączanie adaptacyjnego mikrobatchingu

Automatycznie grupuj żądania, aby zwiększyć przepustowość

Włączanie adaptacyjnego mikrobatchingu to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.

Problem z przepustowością

Wywoływanie modelu raz na żądanie marnuje zasoby sprzętowe. Modele działają znacznie szybciej na batch danych wejściowych niż na tych samych danych przetwarzanych pojedynczo. ⚡

Jak działa mikropartia

Adaptive batching przez krótki czas gromadzi przychodzące żądania, przetwarza je razem, a następnie automatycznie rozdziela wyniki między poszczególnych wywołujących.

Dlaczego adaptacyjne

Rozmiar okna nie jest stały. BentoML obserwuje opóźnienie w czasie rzeczywistym i adapts rozmiar partii, aby zachować szybkość zarówno przy małym, jak i dużym obciążeniu.

Działa na runnerze

Partiowanie konfiguruje się dla modelu, a nie dla pojedynczego żądania. Włączasz je w obiekcie runnable, oznaczając metody obsługujące dane wejściowe w partiach.

Włącz partiowanie

Własny runnable konfiguruje się, ustawiając batchable na true dla danej metody. Następnie BentoML grupuje wywołania tej metody w tle.

@bentoml.Runnable.method(batchable=True)
def predict(self, inputs):
    ...

Wybierz wymiar partii

BentoML musi wiedzieć, jak układać dane wejściowe. Argument batch_dim wskazuje oś, wzdłuż której należy je łączyć, zwykle oś 0.

@bentoml.Runnable.method(batchable=True, batch_dim=0)

Ogranicz rozmiar partii

Określasz maksymalny rozmiar partii. max_batch_size ogranicza liczbę scalanych żądań, dzięki czemu jedna ogromna partia nigdy nie blokuje pozostałych.

Ogranicz czas oczekiwania

Określasz również maksymalny czas oczekiwania. max_latency_ms ustala, jak długo żądanie może znajdować się w kolejce, zanim partia zostanie uruchomiona.

Dostosuj konfigurację

Te limity można ustawić bez zmieniania kodu. Plik bentoml_configuration umożliwia dostosowanie partiowania dla każdego runnera i każdego środowiska.

runners:
  predict:
    batching:
      max_batch_size: 32

Kompromis

Większe partie zwiększają przepustowość, ale nieco podnoszą latency pojedynczych żądań. Dostosowanie ustawień polega na znalezieniu najlepszego punktu dla danego ruchu.

Obserwuj działanie

Nie musisz w ogóle zmieniać klienta. Wywołujący nadal wysyłają pojedyncze żądania, a BentoML przejrzyście merges je w tle.

Szybkie sprawdzenie

Zwiększasz max_batch_size do dużej wartości. Jaki będzie prawdopodobny wpływ na pojedyncze żądanie?

Podsumowanie

Dowiedziałeś się, że adaptive batching grupuje żądania na batchable runnerze. Ustawienia max_batch_size i max_latency_ms pozwalają zamienić niewielki wzrost opóźnienia na znaczny wzrost przepustowości. 🙌

Często zadawane pytania

Czy lekcja „Włączanie adaptacyjnego mikrobatchingu” jest bezpłatna?

Tak — pełny tekst „Włączanie adaptacyjnego mikrobatchingu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Włączanie adaptacyjnego mikrobatchingu”?

Automatycznie grupuj żądania, aby zwiększyć przepustowość Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?

Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Włączanie adaptacyjnego mikrobatchingu”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?

Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Zapisywanie modelu w Bento Store
  2. Definiowanie usługi i jej API
  3. Włączanie adaptacyjnego mikrobatchingu
  4. Budowanie Bento i umieszczanie go w kontenerze
← Powrót do MLOps Academy