Dostrajać model z mniejszym learning rate
Delikatnie aktualizować wstępnie wytrenowane wagi
Dostrajać model z mniejszym learning rate to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Coś więcej niż sama głowica
Zamrożenie backbone'u jest szybkie, ale czasami chcą Państwo, aby cały model się dostosował. Dostrajanie odmraża backbone i trenuje wszystkie elementy razem. 🔧
Odmroź backbone
Aby przeprowadzić dostrajanie, ustaw requires_grad z powrotem na True, aby wstępnie wytrenowane wagi mogły ponownie zmieniać się podczas trenowania.
for p in model.parameters():
p.requires_grad = TrueNiebezpieczeństwo zbyt dużego kroku
Te wstępnie wytrenowane wagi są już bardzo dobre. Duży współczynnik uczenia nadpisałby je zaszumionymi aktualizacjami i zniszczył to, czego się nauczyły.
Postępuj ostrożnie
Rozwiązaniem jest mniejszy współczynnik uczenia. Małe kroki przesuwają wstępnie wytrenowane wagi w stronę Państwa zadania, nie wymazując zdobytej wiedzy.
opt = torch.optim.Adam(model.parameters(), lr=1e-5)O ile mniejszy?
Popularna praktyczna zasada mówi, aby użyć współczynnika uczenia od dziesięciu do stu razy mniejszego niż podczas trenowania od zera.
Najpierw rozgrzej głowicę
Popularna sztuczka: trenować tylko głowicę przez kilka epok, a następnie ją odmrozić i przeprowadzić dostrajanie. Pozwala to uniknąć wczesnego wstrząsu dla backbone'u.
Obserwuj stratę walidacyjną
Dostrajanie może szybko doprowadzić do przeuczenia na małym zbiorze danych. Należy obserwować stratę walidacyjną i zatrzymać trenowanie, gdy tylko zacznie rosnąć.
Potrzeba mniej epok
Ponieważ model już rozumie dane, dostrajanie zwykle zbiega w zaledwie kilku epokach, a nie w kilkudziesięciu.
Połącz to z harmonogramem
Harmonogram może z czasem dodatkowo zmniejszać współczynnik uczenia, pozwalając modelowi łagodnie osiąść w dobrym rozwiązaniu.
sched = torch.optim.lr_scheduler.CosineAnnealingLR(opt, T_max=5)Pełne dostrajanie a zamrożenie
Pełne dostrajanie wymaga większej ilości danych i mocy obliczeniowej, ale zapewnia wyższą dokładność. Trenowanie z zamrożonym backbone'em jest tańsze. Kompromis zależy od rozmiaru zbioru danych.
Zachowaj najlepszy checkpoint
Ponieważ podczas dostrajania wyniki mogą się pogarszać, należy zapisywać model za każdym razem, gdy poprawia się dokładność walidacyjna, aby nigdy nie utracić najlepszej wersji.
Szybkie sprawdzenie
Odmrozili Państwo wstępnie wytrenowany model, aby go dostroić. Jakiego współczynnika uczenia należy użyć?
Podsumowanie
Odmrozili Państwo backbone, przeprowadzili dostrajanie z użyciem niskiego współczynnika uczenia, najpierw rozgrzali głowicę i obserwowali walidację, aby zatrzymać przeuczenie. 🎯
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Dostrajać model z mniejszym learning rate” jest bezpłatna?
Tak — pełny tekst „Dostrajać model z mniejszym learning rate” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Dostrajać model z mniejszym learning rate”?
Delikatnie aktualizować wstępnie wytrenowane wagi Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?
Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Dostrajać model z mniejszym learning rate”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?
Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Zamrozić backbone i trenować head
- Dostrajać model z mniejszym learning rate
- Różne learning rates dla poszczególnych warstw
- Dostrajać model Hugging Face