Comment les LLM sont entraînés
Découvrez les étapes de l’entraînement des LLM : pré-entraînement sur d’immenses corpus, affinage supervisé et RLHF, ainsi que l’importance de chaque étape pour le comportement du modèle.
Comment les LLM sont entraînés est une leçon AI Engineering Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Engineering Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Engineering Academy comprend 4 leçons au total.
Les trois étapes de l’entraînement des LLM
Les LLM sont construits en trois étapes : le pré-entraînement enseigne la langue et les connaissances, le réglage fin apprend à suivre les instructions, et le RLHF aligne le modèle sur les attentes humaines.
Pré-entraînement : prédire le jeton suivant à grande échelle
Le pré-entraînement fournit au modèle d’énormes quantités de texte avec une seule mission : prédire le jeton suivant. Cet objectif simple suffit à lui apprendre progressivement la grammaire, des faits et le raisonnement.
Qualité et sélection des données d’entraînement
Le texte brut d’Internet est désordonné. Les équipes le nettoient grâce à des pipelines de données qui filtrent, dédoublonnent et évaluent la qualité. La règle générale : de meilleures données valent mieux qu’un modèle plus grand.
Fonction de perte et optimisation
L’entraînement minimise la perte d’entropie croisée — l’écart entre la prédiction du modèle et le bon jeton suivant. De minuscules ajustements des poids, répétés des milliards de fois. Le code présente les mathématiques.
# Illustrative cross-entropy loss for a single token prediction
import math
vocab_size = 50000
correct_token_index = 4217 # index for the word 'Paris'
# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size # simplified uniform base
model_probs[correct_token_index] = 0.70 # model is 70% confident in 'Paris'
loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}') # ~0.3567Capacités émergentes dues à l’échelle
À partir d’une certaine échelle, de nouvelles capacités émergentes apparaissent — comme le raisonnement étape par étape — dont les petits modèles sont tout simplement dépourvus. Personne ne les leur a enseignées directement : c’est l’échelle qui les a fait émerger.
Réglage fin supervisé sur des paires d’instructions
Un modèle brut ne fait que poursuivre le texte. Le réglage fin supervisé l’entraîne sur des paires (instruction, réponse idéale), afin qu’il apprenne à répondre réellement au lieu de divaguer.
# Illustrative SFT data format
training_example = {
'messages': [
{'role': 'system', 'content': 'You are a helpful assistant.'},
{'role': 'user', 'content': 'What is the capital of France?'},
{'role': 'assistant', 'content': 'The capital of France is Paris.'}
]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained onPhase 1 du RLHF : entraîner le modèle de récompense
Le RLHF commence par un modèle de récompense. Des personnes choisissent la meilleure de deux réponses, puis le modèle de récompense apprend à prédire ces préférences — une approximation des goûts humains.
Phase 2 du RLHF : réglage fin avec PPO
Ensuite, PPO règle le LLM afin qu’il obtienne un meilleur score auprès du modèle de récompense. Une pénalité KL l’empêche de dériver de manière étrange et d’exploiter la récompense au lieu d’être réellement utile.
Optimisation directe des préférences : un RLHF plus simple
PPO est complexe. DPO est une solution plus simple : il entraîne directement le modèle à partir de paires de réponses préférées et rejetées — sans modèle de récompense distinct.
Lois de mise à l’échelle de Chinchilla : un entraînement optimal en calcul
La conclusion de Chinchilla : les anciens modèles étaient sous-entraînés. Pour un budget donné, augmentez simultanément la quantité de données et la taille du modèle — environ 20 jetons par paramètre pour obtenir les meilleurs résultats.
Ce que chaque étape d’entraînement influence
Chaque étape contrôle un aspect différent : le pré-entraînement détermine ce que le modèle sait, le réglage fin détermine son comportement et le RLHF détermine ses valeurs. Cela vous indique quelle partie corriger.
Vérification rapide
Testez votre compréhension des concepts d’ingénierie de l’IA abordés dans cette leçon.
Récapitulatif de la leçon
Récapitulatif : le pré-entraînement construit les connaissances, le réglage fin apprend à suivre les instructions, et le RLHF ou le DPO aligne le modèle sur les valeurs humaines. Ensuite : ce que les LLM peuvent et ne peuvent pas faire. 💡
Apprends Python avec un tuteur IA — gratuit
Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.
- Cours
- 30
- Leçons
- 120
Questions Fréquemment Posées
La leçon « Comment les LLM sont entraînés » est-elle gratuite ?
Oui — le texte complet de « Comment les LLM sont entraînés » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Engineering Academy, passe à CoddyKit PRO. Le cours AI Engineering Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Comment les LLM sont entraînés » ?
Découvrez les étapes de l’entraînement des LLM : pré-entraînement sur d’immenses corpus, affinage supervisé et RLHF, ainsi que l’importance de chaque étape pour le comportement du modèle. Tu pratiques AI Engineering Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Engineering Academy ?
Aucune expérience préalable n'est requise. AI Engineering Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.
Combien de temps prend la leçon « Comment les LLM sont entraînés » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Engineering Academy ?
Oui. Chaque leçon AI Engineering Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- De la saisie prédictive à ChatGPT
- Transformers et attention en termes simples
- Comment les LLM sont entraînés
- Capacités et limites des LLM