0Pricing
AI Agents · Leçon

Construire un jeu de tests de référence

Constituez 50 à 200 paires de grande qualité (entrée, sortie attendue) couvrant les cas rares d’une utilisation réelle.

Construire un jeu de tests de référence est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Qu’est-ce qu’un ensemble de référence ?

Un « ensemble de tests de référence » (ou « ensemble de référence ») est une collection élaborée de paires (entrée, sortie attendue) qui définit ce qu’est un bon comportement.

Chaque modification est mesurée par rapport à cet ensemble.

Caractéristiques d’un bon ensemble de référence

  • Diversifié — couvre les cas courants AND les cas limites
  • Élaboré par des humains — et non généré automatiquement
  • Versionné — figé dans votre dépôt
  • Documenté — chaque cas possède sa justification

Combien de cas ?

Règle générale :

  • 50 cas — minimum viable
  • 200 cas — bonne couverture
  • 1 000 cas ou plus — produit mature

La qualité prime sur la quantité. 50 cas bien choisis valent mieux que 500 cas pris au hasard.

Sélectionner les cas

  1. Entretiens avec les utilisateurs — ce que demandent les utilisateurs réels
  2. Journaux de production — les questions qui ont été posées
  3. Rapports de bogues — chaque bogue devient une évaluation
  4. Génération adversariale — demandez au LLM de mettre l’agent en défaut

Mining Bad Production Traces

for trace in last_week_traces():
    if trace.has_thumbs_down or trace.had_error:
        case = {
            'input': trace.input,
            'why_bad': trace.feedback_comment,
            'expected': None   # to be filled by human reviewer
        }
        save_to_review_queue(case)

Sortie attendue : exacte ou heuristique

Il existe deux types de sorties attendues :

  • Correspondance exacte — pour l’extraction, la classification et le calcul
  • Heuristique — pour les questions-réponses ouvertes, vérifiez si les faits essentiels apparaissent

Heuristic Scoring

def score_answer(actual, expected_facts):
    return sum(1 for f in expected_facts if f.lower() in actual.lower()) / len(expected_facts)

case = {
    'input': 'What is our refund policy?',
    'expected_facts': ['30 days', 'unopened', 'receipt required'],
    'min_score': 0.66   # at least 2 of 3 facts mentioned
}

actual_answer = "You can return items within 30 days if they are unopened."
score = score_answer(actual_answer, case['expected_facts'])
print(f"Score: {score:.2f} (min required: {case['min_score']})")

Cas adversariaux

Incluez des cas difficiles :

  • Questions hors périmètre (« Quel temps fait-il sur Mars ? »)
  • Requêtes ambiguës
  • Tentatives d’injection de prompt
  • Entrées en langue étrangère
  • Entrées très longues

Gérer les versions de l’ensemble de référence

Stockez-le au format JSON dans votre dépôt. Chaque PR qui met à jour l’ensemble doit expliquer pourquoi :

// gold-set.json
[
  {
    "id": "refund-policy-001",
    "input": "What is your refund policy?",
    "expected_facts": ["30 days", "unopened", "receipt required"],
    "added_by": "alice@",
    "added_at": "2025-08-12",
    "reason": "Top customer support question"
  }
]

Partitions d’entraînement et de test

Pour détecter le surapprentissage, répartissez les données en :

  • Ensemble de développement — itérez dessus (vous le voyez)
  • Ensemble de test — mesurez les performances dessus (vous ne l’ajustez NOT pas)
  • Ensemble de contrôle — utilisé uniquement avant les versions majeures

Étiquetage selon Pareto

Étiquetez les cas par catégorie afin de voir WHERE vous avez régressé :

tag1 = {'tags': ['policy', 'common-question']}
tag2 = {'tags': ['math', 'edge-case']}
print(tag1)
print(tag2)

# Run eval and report:
print("Category 'policy': 0.92")
print("Category 'math': 0.68   <- regression here")

Grilles d’évaluation

Pour les sorties complexes, rédigez une grille d’évaluation : ce qui doit être présent, ce qui ne doit NOT pas être présent et ce qui est préférable :

rubric = {
    'must_include': ['30 days'],
    'must_not_include': ['no refunds'],
    'preferably_includes': ['receipt']
}
for k, v in rubric.items():
    print(f"{k}: {v}")

Source des cas

Quelle est la source des cas d’évaluation offrant le meilleur signal ?

Récapitulatif

Au moins 50 cas élaborés, issus d’utilisateurs réels et d’échecs en production. Versionnez-les, étiquetez-les et répartissez-les entre développement, test et contrôle. Enrichissez l’ensemble à chaque bogue.

Questions Fréquemment Posées

La leçon « Construire un jeu de tests de référence » est-elle gratuite ?

Oui — le texte complet de « Construire un jeu de tests de référence » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Construire un jeu de tests de référence » ?

Constituez 50 à 200 paires de grande qualité (entrée, sortie attendue) couvrant les cas rares d’une utilisation réelle. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Construire un jeu de tests de référence » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Développement d’agents piloté par l’évaluation
  2. Construire un jeu de tests de référence
  3. Pièges des LLM-as-a-Judge
  4. Suites de référence : SWE-Bench, GAIA, ToolBench
← Retour à AI Agents