AI Engineering Academy · Lekcja

Jak trenuje się LLM-y

Uczestnicy poznają etapy trenowania LLM-ów: pretraining na ogromnych korpusach, supervised fine-tuning oraz RLHF, a także znaczenie każdego z tych etapów dla zachowania modelu.

Lekcja 3 z 413 kroki

Jak trenuje się LLM-y to bezpłatna lekcja AI Engineering Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Engineering Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Engineering Academy zawiera 4 lekcji w sumie.

Trzy etapy treningu LLM

LLM-y powstają w trzech etapach: wstępny trening uczy języka i wiedzy, dostrajanie uczy wykonywania instrukcji, a RLHF dostosowuje model do ludzkich oczekiwań.

Wstępny trening: przewidywanie następnego tokenu na dużą skalę

Wstępny trening dostarcza modelowi ogromne ilości tekstu i jedno zadanie: przewidywanie następnego tokenu. Ten prosty cel wystarcza, aby model po drodze nauczył się gramatyki, faktów i rozumowania.

Jakość i selekcja danych treningowych

Surowy tekst z internetu jest chaotyczny. Zespoły porządkują go za pomocą potoków danych, które filtrują dane, usuwają duplikaty i oceniają ich jakość. Zasada praktyczna: lepsze dane są ważniejsze niż większy model.

Funkcja straty i optymalizacja

Trening minimalizuje stratę entropii krzyżowej — miarę odległości przewidywania modelu od prawidłowego następnego tokenu. To drobne korekty wag, powtarzane miliardy razy. Kod pokazuje matematykę.

# Illustrative cross-entropy loss for a single token prediction
import math

vocab_size = 50000
correct_token_index = 4217  # index for the word 'Paris'

# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size  # simplified uniform base
model_probs[correct_token_index] = 0.70  # model is 70% confident in 'Paris'

loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}')  # ~0.3567

Zdolności emergentne wynikające ze skali

Po osiągnięciu odpowiedniej skali pojawiają się nowe zdolności emergentne — na przykład rozumowanie krok po kroku — których małe modele po prostu nie mają. Nikt nie uczył ich bezpośrednio; pojawiły się dzięki skali.

Dostrajanie nadzorowane na parach instrukcja–odpowiedź

Surowy model jedynie kontynuuje tekst. Dostrajanie nadzorowane trenuje go na parach (instrukcja, idealna odpowiedź), dzięki czemu uczy się rzeczywiście odpowiadać, zamiast rozwlekać wypowiedź.

# Illustrative SFT data format
training_example = {
    'messages': [
        {'role': 'system', 'content': 'You are a helpful assistant.'},
        {'role': 'user', 'content': 'What is the capital of France?'},
        {'role': 'assistant', 'content': 'The capital of France is Paris.'}
    ]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained on

Etap 1 RLHF: trenowanie modelu nagrody

RLHF zaczyna się od modelu nagrody. Ludzie wybierają lepszą z dwóch odpowiedzi, a model nagrody uczy się przewidywać te preferencje — stając się przybliżeniem ludzkich ocen.

Etap 2 RLHF: dostrajanie PPO

Następnie PPO dostraja LLM tak, aby uzyskiwał wyższe oceny modelu nagrody. Kara KL zapobiega nadmiernemu odchodzeniu od pierwotnego modelu i optymalizowaniu nagrody zamiast rzeczywistej pomocy.

Direct Preference Optimization: prostsze RLHF

PPO jest złożone. DPO to prostsza alternatywa: trenuje model bezpośrednio na parach odpowiedzi preferowanych i odrzuconych — bez osobnego modelu nagrody.

Prawa skalowania Chinchilla: trening optymalny obliczeniowo

Wniosek z badań Chinchilla: starsze modele były niedotrenowane. Przy określonym budżecie należy zwiększać ilość danych i rozmiar modelu jednocześnie — dla najlepszych wyników przypada w przybliżeniu 20 tokenów na parametr.

Wpływ poszczególnych etapów treningu

Każdy etap odpowiada za coś innego: wstępny trening określa, co model wie, dostrajanie określa jego zachowanie, a RLHF — jego wartości. Dzięki temu wiadomo, którą część należy poprawić.

Szybki test

Sprawdź swoją wiedzę na temat zagadnień inżynierii AI z tej lekcji.

Podsumowanie lekcji

Podsumowanie: wstępny trening buduje wiedzę, dostrajanie uczy wykonywania instrukcji, a RLHF lub DPO dostosowuje model do ludzkich wartości. Dalej: co LLM-y potrafią, a czego nie. 💡

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Jak trenuje się LLM-y” jest bezpłatna?

Tak — pełny tekst „Jak trenuje się LLM-y” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Engineering Academy, przejdź na CoddyKit PRO. Kurs AI Engineering Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Jak trenuje się LLM-y”?

Uczestnicy poznają etapy trenowania LLM-ów: pretraining na ogromnych korpusach, supervised fine-tuning oraz RLHF, a także znaczenie każdego z tych etapów dla zachowania modelu. Ćwiczysz AI Engineering Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Engineering Academy?

Nie wymagamy żadnego doświadczenia. AI Engineering Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Jak trenuje się LLM-y”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Engineering Academy?

Tak. Każda lekcja AI Engineering Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Od autouzupełniania do ChatGPT
  2. Transformery i mechanizm uwagi prostym językiem
  3. Jak trenuje się LLM-y
  4. Możliwości i ograniczenia LLM-ów
← Powrót do AI Engineering Academy