0Pricing
AI Agents · Leçon

Évaluer les modèles ajustés par rapport au modèle de base

Comparez le modèle de base et le modèle ajusté sur votre jeu d’évaluation A/B : l’ajustement fin nuit parfois davantage qu’il n’aide.

Évaluer les modèles ajustés par rapport au modèle de base est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Ne faites pas confiance à la perte d’entraînement

Une faible perte d’entraînement ne signifie pas nécessairement de meilleurs résultats en production. Le modèle peut être en surapprentissage, perdre des capacités générales ou nuire à des tâches qu’il n’a pas vues.

Évaluez toujours le modèle affiné sur un ensemble d’évaluation mis de côté.

Trois partitions d’évaluation indispensables

  1. Entraînement — utilisé pour l’affinage
  2. Validation — utilisée pour choisir le meilleur point de contrôle
  3. Évaluation finale — jamais vue pendant l’entraînement ; utilisée ONLY pour l’évaluation finale

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Surveillez l’oubli catastrophique

Un affinage sur des données étroites peut dégrader le modèle pour OTHER tâches. Évaluez-le également sur un vaste ensemble d’évaluation, et pas uniquement sur votre nouvelle spécialisation.

Rapports par catégorie

Ajoutez des étiquettes à votre ensemble d’évaluation et indiquez les scores par catégorie :

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Étalonnage

Les modèles affinés deviennent souvent trop sûrs d’eux. Comparez la probabilité prédite de correction à la probabilité réelle, puis procédez à un étalonnage si nécessaire.

Dérive de la longueur et du style

Les modèles affinés dérivent vers la distribution des données d’entraînement. Si les données d’entraînement sont plus courtes, les sorties raccourcissent. C’est parfois souhaitable, parfois non.

Test A/B en conditions réelles

Au-delà des évaluations hors ligne, effectuez un test A/B en production :

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Comparer qualité et coût

Le modèle affiné peut être plus petit et moins cher. Rapport coût-qualité total :

  • GPT-4o de base : $X par appel, qualité Y
  • Llama 8B affiné (auto-hébergé) : $X/10 par appel, qualité 0.9Y
  • Il sera probablement gagnant si Y reste suffisamment élevé

Modes d’échec cachés

Essayez des entrées adversariales :

  • Prompts qui tentent de contourner les garde-fous
  • Entrées hors distribution
  • Prompts correspondant à des cas limites

Les affinages affaiblissent parfois la sécurité ; vérifiez-la avant la mise en production.

Réserve concernant le LLM comme juge

Si vous utilisez un juge LLM, choisissez une famille de modèles DIFFERENT de celle de votre modèle affiné. Sinon, le juge attribuera des scores élevés de manière biaisée.

Quand faire évoluer le jeu de données

Si l’évaluation révèle une régression dans certaines catégories :

  1. Trouvez des exemples similaires dans les traces de production
  2. Ajoutez-les au jeu d’entraînement
  3. Réentraînez le modèle
  4. Effectuez une nouvelle évaluation

Le retour en arrière est OK

Si l’affinage donne de moins bons résultats, abandonnez-le et recommencez. Les coûts déjà engagés ne justifient pas la mise en production d’un modèle moins performant.

Oubli catastrophique

Qu’est-ce que l’oubli catastrophique dans l’affinage ?

Récapitulatif

Évaluez le modèle affiné par rapport au modèle de base sur YOUR jeu de référence. Surveillez les régressions par catégorie. Effectuez des tests A/B en production. Revenez en arrière s’il perd en qualité ; faites évoluer le jeu de données s’il ne gagne que sur certains points.

Questions Fréquemment Posées

La leçon « Évaluer les modèles ajustés par rapport au modèle de base » est-elle gratuite ?

Oui — le texte complet de « Évaluer les modèles ajustés par rapport au modèle de base » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Évaluer les modèles ajustés par rapport au modèle de base » ?

Comparez le modèle de base et le modèle ajusté sur votre jeu d’évaluation A/B : l’ajustement fin nuit parfois davantage qu’il n’aide. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Évaluer les modèles ajustés par rapport au modèle de base » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Quand l’ajustement fin est préférable aux invites
  2. Collecte de données : trajectoires et rejeu des traces
  3. LoRA et QLoRA pour un ajustement économique
  4. Évaluer les modèles ajustés par rapport au modèle de base
← Retour à AI Agents