Développement d’agents piloté par l’évaluation
Rédigez l’évaluation avant de déployer l’agent : c’est la seule façon d’itérer sans régressions.
Développement d’agents piloté par l’évaluation est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.
Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.
Les évaluations sont des tests pour l’IA
Vous ne livreriez pas de code sans tests. La même logique s’applique aux agents fondés sur des LLM : sans évaluations, chaque modification revient à jouer à pile ou face.
Le développement piloté par les évaluations (EDD) consiste à rédiger l’évaluation BEFORE de livrer la modification.
La boucle EDD
- Rédigez une évaluation qui échoue : entrée + comportement attendu
- Améliorez l’agent jusqu’à ce que l’évaluation réussisse
- Ajoutez l’évaluation à votre suite
- Exécutez-la à chaque modification
Que faut-il évaluer ?
Pour un agent, évaluez plusieurs niveaux :
- Composant — le récupérateur renvoie-t-il les bons fragments ?
- Étape — le LLM choisit-il le bon outil ?
- De bout en bout — l’agent produit-il la bonne réponse finale ?
Données d’évaluation
Chaque ligne d’évaluation contient au minimum :
eval_example = {
'input': 'What is our return policy?',
'expected_output': 'mentions 30-day window',
'expected_tool_calls': ['retrieve'],
'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
print(f"{k}: {v}")
Run an Eval Suite
def run_evals(suite, agent):
results = []
for case in suite:
actual = agent.run(case['input'])
scores = [
score_correctness(actual, case['expected_output']),
score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
]
results.append({'case': case, 'actual': actual, 'scores': scores})
return resultsIntégration à l’intégration continue
Exécutez les évaluations à chaque PR. Si la qualité passe sous le seuil, bloquez la fusion :
# .github/workflows/evals.yml
on: pull_request
jobs:
evals:
runs-on: ubuntu-latest
steps:
- run: python -m evals.run --fail-below 0.85Fréquence des évaluations
- Évaluations des composants — à chaque PR
- Évaluations de bout en bout — à chaque PR (échantillonnées) et chaque nuit (complètes)
- Traces de production -> ensemble d’évaluation — chaque semaine
Chaîne de traitement de la production vers l’évaluation
Analysez les traces réelles. Les mauvais résultats deviennent les évaluations de demain :
for trace in production_traces_with_thumbs_down():
add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)Évaluation avec LangSmith / Langfuse
Les deux outils intègrent la prise en charge des évaluations : gestion des versions des jeux de données, fonctions d’évaluation et vues de comparaison.
Vérifications manuelles par sondage
Les évaluations automatisées ne détectent pas le style ni les nuances. Lisez périodiquement à la main 20 traces choisies au hasard : cela permet de repérer les problèmes qui échappent aux évaluations.
Anti-modèle : mémorisation de l’ensemble d’évaluation
Si vous ajustez l’agent jusqu’à ce qu’il réussisse votre évaluation, mais que celle-ci est petite, vous créez un surapprentissage. Continuez à enrichir les évaluations et faites tourner les partitions d’entraînement et de test.
Maintenance de l’ensemble d’évaluation
Les évaluations dérivent à mesure que votre produit évolue. Ajoutez des cas pour les nouvelles fonctionnalités et retirez ceux qui concernent les fonctionnalités supprimées.
Définition de l’EDD
Que signifie le développement piloté par les évaluations ?
Récapitulatif
Le développement piloté par les évaluations est indispensable pour les agents sérieux. Rédigez des évaluations à chaque niveau, exécutez-les dans l’intégration continue et enrichissez votre suite à partir des traces de production.
Questions Fréquemment Posées
La leçon « Développement d’agents piloté par l’évaluation » est-elle gratuite ?
Oui — le texte complet de « Développement d’agents piloté par l’évaluation » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Développement d’agents piloté par l’évaluation » ?
Rédigez l’évaluation avant de déployer l’agent : c’est la seule façon d’itérer sans régressions. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Agents ?
Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.
Combien de temps prend la leçon « Développement d’agents piloté par l’évaluation » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?
Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Développement d’agents piloté par l’évaluation
- Construire un jeu de tests de référence
- Pièges des LLM-as-a-Judge
- Suites de référence : SWE-Bench, GAIA, ToolBench