Come vengono addestrati gli LLM
Imparerà le fasi dell'addestramento degli LLM: pre-training su enormi corpus, fine-tuning supervisionato e RLHF, comprendendo perché ciascuna fase è importante per il comportamento del modello.
Come vengono addestrati gli LLM è una lezione AI Engineering Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Engineering Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Engineering Academy include 4 lezioni in totale.
Le tre fasi dell'addestramento degli LLM
Gli LLM vengono costruiti in tre fasi: il pre-training insegna la lingua e le conoscenze, il fine-tuning insegna a seguire le istruzioni e RLHF allinea il modello a ciò che le persone desiderano.
Pre-training: previsione del token successivo su larga scala
Il pre-training sottopone al modello enormi quantità di testo con un unico compito: prevedere il token successivo. Questo semplice obiettivo è sufficiente per insegnargli grammatica, nozioni e capacità di ragionamento.
Qualità e selezione dei dati di addestramento
Il testo grezzo proveniente da Internet è disordinato. I team lo ripuliscono con pipeline di dati che filtrano, rimuovono i duplicati e valutano la qualità. La regola generale è: dati migliori battono un modello più grande.
La funzione di loss e l'ottimizzazione
L'addestramento minimizza la loss di entropia incrociata, cioè la distanza tra la previsione del modello e il token successivo corretto. Piccoli aggiustamenti dei pesi, ripetuti miliardi di volte. Il codice mostra la matematica.
# Illustrative cross-entropy loss for a single token prediction
import math
vocab_size = 50000
correct_token_index = 4217 # index for the word 'Paris'
# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size # simplified uniform base
model_probs[correct_token_index] = 0.70 # model is 70% confident in 'Paris'
loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}') # ~0.3567Capacità emergenti dovute alla scala
Raggiunta una scala sufficiente, compaiono nuove capacità emergenti, come il ragionamento passo dopo passo, che i modelli piccoli semplicemente non possiedono. Nessuno le ha addestrate direttamente: sono emerse grazie alla scala.
Supervised fine-tuning su coppie di istruzioni
Un modello grezzo si limita a continuare il testo. Il supervised fine-tuning lo addestra su coppie (istruzione, risposta ideale), così impara a rispondere davvero invece di divagare.
# Illustrative SFT data format
training_example = {
'messages': [
{'role': 'system', 'content': 'You are a helpful assistant.'},
{'role': 'user', 'content': 'What is the capital of France?'},
{'role': 'assistant', 'content': 'The capital of France is Paris.'}
]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained onFase 1 di RLHF: addestrare il reward model
RLHF inizia con un reward model. Le persone scelgono la migliore tra due risposte e il reward model impara a prevedere queste preferenze: è un sostituto del giudizio umano.
Fase 2 di RLHF: fine-tuning con PPO
Successivamente, PPO regola l'LLM affinché ottenga un punteggio più alto dal reward model. Una penalità KL gli impedisce di allontanarsi troppo dal comportamento previsto e di sfruttare il reward invece di essere realmente utile.
Direct Preference Optimization: un RLHF più semplice
PPO è complesso. DPO è un'alternativa più semplice: addestra direttamente il modello su coppie di risposte preferite e rifiutate, senza bisogno di un reward model separato.
Leggi dello scaling di Chinchilla: addestramento ottimale rispetto al calcolo
La scoperta di Chinchilla è stata la seguente: i modelli precedenti erano sottoaddestrati. A parità di budget, bisogna aumentare dati e dimensioni insieme: circa 20 token per parametro per ottenere i risultati migliori.
Che cosa influenza ogni fase dell'addestramento
Ogni fase controlla un aspetto diverso: il pre-training stabilisce ciò che il modello sa, il fine-tuning definisce come si comporta e RLHF ne orienta i valori. Questo indica quale parte correggere.
Verifica rapida
Verifichi la Sua comprensione dei concetti di AI Engineering presentati in questa lezione.
Riepilogo della lezione
Riepilogo: il pre-training costruisce la conoscenza, il fine-tuning insegna a seguire le istruzioni e RLHF o DPO allinea il modello ai valori umani. Prossimo argomento: che cosa gli LLM possono e non possono fare. 💡
Impara Python con un tutor IA — gratis
Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.
- Corsi
- 30
- Lezioni
- 120
Domande Frequenti
La lezione «Come vengono addestrati gli LLM» è gratuita?
Sì — il testo completo di «Come vengono addestrati gli LLM» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Engineering Academy, passa a CoddyKit PRO. Il corso AI Engineering Academy include 4 lezioni in totale.
Cosa imparerò in «Come vengono addestrati gli LLM»?
Imparerà le fasi dell'addestramento degli LLM: pre-training su enormi corpus, fine-tuning supervisionato e RLHF, comprendendo perché ciascuna fase è importante per il comportamento del modello. Eserciti AI Engineering Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Engineering Academy?
Non è richiesta alcuna esperienza precedente. AI Engineering Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.
Quanto tempo richiede la lezione «Come vengono addestrati gli LLM»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Engineering Academy?
Sì. Ogni lezione AI Engineering Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Da Autocomplete a ChatGPT
- Transformer e meccanismi di attenzione spiegati in modo semplice
- Come vengono addestrati gli LLM
- Capacità e limiti degli LLM