Ocena dostrojonych modeli względem bazowego
Porównaj dostrojony model z bazowym na swoim zbiorze ewaluacyjnym — czasami dostrajanie bardziej szkodzi, niż pomaga.
Ocena dostrojonych modeli względem bazowego to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
Nie ufaj stracie treningowej
Niska strata treningowa nie oznacza lepszego działania na produkcji. Model może się przeuczyć, utracić ogólne możliwości lub gorzej radzić sobie z nieznanymi zadaniami.
Zawsze należy oceniać dostrojony model na wydzielonym zbiorze ewaluacyjnym.
Trzy niezbędne podziały ewaluacyjne
- Treningowy — używany podczas dostrajania
- Walidacyjny — używany do wyboru najlepszego checkpointu
- Testowy — nigdy niewidziany podczas treningu; WYŁĄCZNIE do końcowej ewaluacji
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')Uważaj na katastrofalne zapominanie
Dostrajanie na wąskich danych może pogorszyć działanie modelu w INNYCH zadaniach. Należy również testować szeroki zbiór ewaluacyjny — nie tylko nową specjalizację modelu.
Raportowanie według kategorii
Należy oznaczyć zbiór ewaluacyjny i raportować wyniki dla poszczególnych kategorii:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)Kalibracja
Dostrojone modele często stają się nadmiernie pewne siebie. Należy porównać przewidywane i rzeczywiste prawdopodobieństwo poprawności, a w razie potrzeby przeprowadzić kalibrację.
Dryf długości i stylu
Dostrojone modele przesuwają się w kierunku rozkładu danych treningowych. Jeśli dane treningowe są krótsze, wyniki również stają się krótsze. Czasami jest to pożądane, a czasami nie.
Test A/B w świecie rzeczywistym
Oprócz ewaluacji offline należy przeprowadzać testy A/B na produkcji:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)Porównanie jakości i kosztu
Dostrojony model może być mniejszy i tańszy. Łączne zestawienie kosztu i jakości:
- Bazowy GPT-4o: X USD za wywołanie, jakość Y
- Dostrojony Llama 8B (hostowany samodzielnie): X/10 USD za wywołanie, jakość 0,9Y
- Prawdopodobnie będzie zwycięzcą, jeśli Y pozostanie wystarczająco wysokie
Ukryte tryby awarii
Należy wypróbować dane wejściowe o charakterze adversarial:
- Prompty próbujące ominąć zabezpieczenia
- Dane wejściowe spoza rozkładu
- Prompty opisujące przypadki brzegowe
Czasami dostrojenie osłabia bezpieczeństwo; przed wdrożeniem należy to zweryfikować.
Zastrzeżenie dotyczące LLM-as-Judge
Jeśli używany jest LLM jako sędzia, należy użyć INNEJ rodziny modeli niż rodzina dostrojonego modelu. W przeciwnym razie sędzia będzie przyznawać stronniczo wysokie oceny.
Kiedy iterować nad zbiorem danych
Jeśli ewaluacja wykaże regresję w określonych kategoriach:
- Znajdź podobne przykłady w śladach z produkcji
- Dodaj je do zbioru treningowego
- Przeprowadź ponowne trenowanie
- Przeprowadź ponowną ewaluację
Można się wycofać
Jeśli dostrojenie daje gorsze wyniki, należy je odrzucić i spróbować ponownie. Koszty utopione nie są powodem, aby wdrażać gorszy model.
Katastrofalne zapominanie
Czym jest katastrofalne zapominanie podczas dostrajania?
Podsumowanie
Należy oceniać dostrojony model względem bazowego na WŁASNYM referencyjnym zbiorze danych. Trzeba obserwować regresje w poszczególnych kategoriach. Należy przeprowadzać testy A/B na produkcji. Jeśli model traci jakość, należy go wycofać; jeśli poprawia się tylko częściowo, należy iterować nad zbiorem danych.
Często zadawane pytania
Czy lekcja „Ocena dostrojonych modeli względem bazowego” jest bezpłatna?
Tak — pełny tekst „Ocena dostrojonych modeli względem bazowego” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Ocena dostrojonych modeli względem bazowego”?
Porównaj dostrojony model z bazowym na swoim zbiorze ewaluacyjnym — czasami dostrajanie bardziej szkodzi, niż pomaga. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Ocena dostrojonych modeli względem bazowego”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Kiedy dostrajanie przewyższa promptowanie
- Zbieranie danych: trajektorie i odtwarzanie śladów
- LoRA i QLoRA do ekonomicznego dostrajania
- Ocena dostrojonych modeli względem bazowego