Kwantyzacja i destylacja na potrzeby tańszej predykcji
Zmniejszaj modele, zachowując wysoką jakość
Kwantyzacja i destylacja na potrzeby tańszej predykcji to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Zmniejsz model, nie rachunek
Mniejszy model wymaga mniej pamięci i tańszego sprzętu do obsługi. Kompresja modelu zmniejsza jego rozmiar i koszt, zachowując większość wypracowanej dokładności.
Na czym polega kwantyzacja
Kwantyzacja przechowuje wagi z użyciem mniejszej liczby bitów, na przykład int8 zamiast float32. Model staje się mniej więcej cztery razy mniejszy i często działa szybciej na tym samym układzie.
Kwantyzacja po trenowaniu
Najprostsza metoda polega na kwantyzacji już wytrenowanego modelu bez ponownego trenowania. Kwantyzacja po trenowaniu wymaga jednego wywołania funkcji i powoduje tylko niewielki spadek dokładności.
import torch
q = torch.quantization.quantize_dynamic(model, dtype=torch.qint8)Kalibruj, aby uzyskać lepszą dokładność
Przekazanie kilku rzeczywistych partii danych pomaga kwantyzacji dobrać odpowiednie zakresy wartości. Ten etap kalibracji pozwala zachować większą dokładność niż sama konwersja bez przygotowania.
Trenowanie uwzględniające kwantyzację
Gdy dokładność ma największe znaczenie, podczas samego trenowania symuluje się obliczenia int8. Trenowanie uwzględniające kwantyzację wymaga więcej pracy, ale pozwala odzyskać większość utraconej dokładności.
Na czym polega destylacja
Destylacja wiedzy polega na trenowaniu małego modelu ucznia tak, aby naśladował duży model nauczyciela. Uczeń zachowuje znaczną część umiejętności nauczyciela przy ułamku kosztów.
Ucz się na miękkich etykietach
Uczeń uczy się na pełnych wynikach prawdopodobieństwa nauczyciela, a nie tylko na jednoznacznych odpowiedziach. Te miękkie etykiety niosą bogatszy sygnał niż pojedyncza klasa.
Wybierz tańszą architekturę
Destylacja pozwala zastąpić ciężki model lżejszym, na przykład DistilBERT modelem BERT. Mniejszy uczeń oznacza mniejsze opóźnienia i mniejszą instancję do obsługi.
Usuń także nieaktywne wagi
Przycinanie usuwa wagi, które niemal nie wpływają na wynik, pozostawiając rzadszą i lżejszą sieć. Dobrze współpracuje zarówno z kwantyzacją, jak i destylacją.
Zawsze mierz kompromis
Każde zmniejszenie modelu może obniżyć dokładność, dlatego testuj skompresowany model na rzeczywistych danych. Obserwuj zależność dokładności od kosztu i zatrzymaj się, zanim jakość spadnie zbyt mocno.
Eksportuj i obsługuj model w ekonomiczny sposób
Skompresowane modele dobrze współpracują z szybkimi środowiskami uruchomieniowymi, takimi jak ONNX Runtime. Wyeksportuj model raz, a następnie obsługuj mniejszy artefakt na tańszym sprzęcie.
Szybkie sprawdzenie
Ustalmy dokładnie, na czym polega destylacja.
Podsumowanie
Zmniejszyłeś liczbę bitów używanych do przechowywania wag, utworzyłeś małego ucznia na podstawie dużego nauczyciela i usunąłeś nieaktywne wagi, cały czas obserwując kompromis między dokładnością a kosztem. 🪶
Często zadawane pytania
Czy lekcja „Kwantyzacja i destylacja na potrzeby tańszej predykcji” jest bezpłatna?
Tak — pełny tekst „Kwantyzacja i destylacja na potrzeby tańszej predykcji” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Kwantyzacja i destylacja na potrzeby tańszej predykcji”?
Zmniejszaj modele, zachowując wysoką jakość Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?
Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Kwantyzacja i destylacja na potrzeby tańszej predykcji”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?
Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dopasowywanie rozmiaru instancji i replik
- Kwantyzacja i destylacja na potrzeby tańszej predykcji
- Używanie instancji Spot do trenowania
- Śledzenie kosztu pojedynczej predykcji