Dopasowywanie rozmiaru instancji i replik
Dopasuj sprzęt do rzeczywistych profili obciążenia
Dopasowywanie rozmiaru instancji i replik to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Płać tylko za to, czego używasz
Większość kosztów obsługi ML generują instancje działające przez dużą część czasu niemal bez obciążenia. Dobór rozmiaru oznacza dopasowanie sprzętu i liczby replik do rzeczywistego obciążenia, a nie do najgorszego wyobrażonego przypadku.
Najpierw mierz, potem ograniczaj
Nie możesz dobrać odpowiedniego rozmiaru czegoś, czego nie zmierzyłeś. Zacznij od obserwowania rzeczywistego wykorzystania procesora i pamięci w zwykłym dniu z ruchem.
Pułapka nadmiarowej aprowizacji
Wybór ogromnej instancji na wszelki wypadek może wydawać się bezpieczny, ale co godzinę niepotrzebnie pochłania pieniądze. Chronicznie niskie wykorzystanie to najwyraźniejszy sygnał nadmiarowej aprowizacji.
Odczytuj wykorzystanie zasobów
Jeśli średnie wykorzystanie procesora wynosi około 15 procent, instancja jest zdecydowanie zbyt duża. Ustal odpowiednie docelowe wykorzystanie, pozostawiając zapas na krótkie skoki obciążenia.
kubectl top pods -n servingSkalowanie pionowe a poziome
Skalowanie pionowe zapewnia jednej replice większą maszynę. Skalowanie poziome zamiast tego dodaje więcej małych replik, co zwykle lepiej obsługuje skokowy ruch.
Ustaw żądania i limity
W Kubernetes parametr żądania zasobów informuje harmonogram, ile każda replika rzeczywiście potrzebuje. Ustawiaj go na podstawie zaobserwowanego użycia, a nie zaokrąglonego przypuszczenia.
resources:
requests:
cpu: "500m"
memory: "1Gi"Wybierz właściwą liczbę replik
Zbyt mała liczba replik oznacza kolejki żądań i wolne odpowiedzi. Zbyt duża oznacza bezczynne pody, za które nadal płacisz. Dobierz liczbę replik do maksymalnego równoczesnego obciążenia.
Pozwól autoskalowaniu śledzić zapotrzebowanie
Horizontal Pod Autoscaler dodaje repliki, gdy obciążenie rośnie, i usuwa je, gdy spada, dzięki czemu nie płacisz za zasoby potrzebne tylko poza szczytem.
kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60Zachowaj minimalny poziom bezpieczeństwa
Minimalna liczba replik utrzymuje kilka rozgrzanych podów, dzięki czemu ruch nigdy nie trafia do zimnej, pustej usługi. To kompromis między kosztami a dostępnością.
Instancje GPU są drogie
Instancje GPU kosztują wielokrotnie więcej niż CPU. Żądaj GPU tylko wtedy, gdy model rzeczywiście go potrzebuje, i maksymalnie wykorzystuj jego zasoby, aby nie pozostawał bezczynny.
Dobór rozmiaru to proces ciągły
Wzorce ruchu zmieniają się w ciągu tygodni i miesięcy. Regularnie analizuj typ instancji i liczbę replik, aby infrastruktura nadal była dobrze dopasowana.
Szybkie sprawdzenie
Sprawdźmy, co mówi Ci niskie wykorzystanie zasobów.
Podsumowanie
Zmierzyłeś wykorzystanie zasobów, wybrałeś między skalowaniem pionowym i poziomym, ustawiłeś żądania oraz dodałeś autoskalowanie. Twoja infrastruktura odpowiada teraz rzeczywistemu zapotrzebowaniu. 💸
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Dopasowywanie rozmiaru instancji i replik” jest bezpłatna?
Tak — pełny tekst „Dopasowywanie rozmiaru instancji i replik” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Dopasowywanie rozmiaru instancji i replik”?
Dopasuj sprzęt do rzeczywistych profili obciążenia Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?
Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Dopasowywanie rozmiaru instancji i replik”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?
Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dopasowywanie rozmiaru instancji i replik
- Kwantyzacja i destylacja na potrzeby tańszej predykcji
- Używanie instancji Spot do trenowania
- Śledzenie kosztu pojedynczej predykcji