MLOps Academy · Lekcja

Dopasowywanie rozmiaru instancji i replik

Dopasuj sprzęt do rzeczywistych profili obciążenia

Lekcja 1 z 413 kroki

Dopasowywanie rozmiaru instancji i replik to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.

Płać tylko za to, czego używasz

Większość kosztów obsługi ML generują instancje działające przez dużą część czasu niemal bez obciążenia. Dobór rozmiaru oznacza dopasowanie sprzętu i liczby replik do rzeczywistego obciążenia, a nie do najgorszego wyobrażonego przypadku.

Najpierw mierz, potem ograniczaj

Nie możesz dobrać odpowiedniego rozmiaru czegoś, czego nie zmierzyłeś. Zacznij od obserwowania rzeczywistego wykorzystania procesora i pamięci w zwykłym dniu z ruchem.

Pułapka nadmiarowej aprowizacji

Wybór ogromnej instancji na wszelki wypadek może wydawać się bezpieczny, ale co godzinę niepotrzebnie pochłania pieniądze. Chronicznie niskie wykorzystanie to najwyraźniejszy sygnał nadmiarowej aprowizacji.

Odczytuj wykorzystanie zasobów

Jeśli średnie wykorzystanie procesora wynosi około 15 procent, instancja jest zdecydowanie zbyt duża. Ustal odpowiednie docelowe wykorzystanie, pozostawiając zapas na krótkie skoki obciążenia.

kubectl top pods -n serving

Skalowanie pionowe a poziome

Skalowanie pionowe zapewnia jednej replice większą maszynę. Skalowanie poziome zamiast tego dodaje więcej małych replik, co zwykle lepiej obsługuje skokowy ruch.

Ustaw żądania i limity

W Kubernetes parametr żądania zasobów informuje harmonogram, ile każda replika rzeczywiście potrzebuje. Ustawiaj go na podstawie zaobserwowanego użycia, a nie zaokrąglonego przypuszczenia.

resources:
  requests:
    cpu: "500m"
    memory: "1Gi"

Wybierz właściwą liczbę replik

Zbyt mała liczba replik oznacza kolejki żądań i wolne odpowiedzi. Zbyt duża oznacza bezczynne pody, za które nadal płacisz. Dobierz liczbę replik do maksymalnego równoczesnego obciążenia.

Pozwól autoskalowaniu śledzić zapotrzebowanie

Horizontal Pod Autoscaler dodaje repliki, gdy obciążenie rośnie, i usuwa je, gdy spada, dzięki czemu nie płacisz za zasoby potrzebne tylko poza szczytem.

kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60

Zachowaj minimalny poziom bezpieczeństwa

Minimalna liczba replik utrzymuje kilka rozgrzanych podów, dzięki czemu ruch nigdy nie trafia do zimnej, pustej usługi. To kompromis między kosztami a dostępnością.

Instancje GPU są drogie

Instancje GPU kosztują wielokrotnie więcej niż CPU. Żądaj GPU tylko wtedy, gdy model rzeczywiście go potrzebuje, i maksymalnie wykorzystuj jego zasoby, aby nie pozostawał bezczynny.

Dobór rozmiaru to proces ciągły

Wzorce ruchu zmieniają się w ciągu tygodni i miesięcy. Regularnie analizuj typ instancji i liczbę replik, aby infrastruktura nadal była dobrze dopasowana.

Szybkie sprawdzenie

Sprawdźmy, co mówi Ci niskie wykorzystanie zasobów.

Podsumowanie

Zmierzyłeś wykorzystanie zasobów, wybrałeś między skalowaniem pionowym i poziomym, ustawiłeś żądania oraz dodałeś autoskalowanie. Twoja infrastruktura odpowiada teraz rzeczywistemu zapotrzebowaniu. 💸

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Dopasowywanie rozmiaru instancji i replik” jest bezpłatna?

Tak — pełny tekst „Dopasowywanie rozmiaru instancji i replik” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Dopasowywanie rozmiaru instancji i replik”?

Dopasuj sprzęt do rzeczywistych profili obciążenia Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?

Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Dopasowywanie rozmiaru instancji i replik”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?

Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dopasowywanie rozmiaru instancji i replik
  2. Kwantyzacja i destylacja na potrzeby tańszej predykcji
  3. Używanie instancji Spot do trenowania
  4. Śledzenie kosztu pojedynczej predykcji
← Powrót do MLOps Academy