0Pricing
AI Prompt Engineering · Leçon

Lire et évaluer les résultats de l’IA

Critères pour évaluer la pertinence, l’exactitude et l’exhaustivité des réponses de l’IA.

Lire et évaluer les résultats de l’IA est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Pourquoi l’évaluation est importante

Obtenir une réponse d’IA ne représente que la moitié du travail. La seconde moitié consiste à évaluer si cette réponse est réellement bonne.

Sans cadre d’évaluation clair, vous pourriez accepter une réponse qui semble soignée mais répond à la mauvaise question, ou rejeter une réponse réellement utile parce qu’elle n’est pas mise en forme comme vous l’espériez.

Développer un regard fiable sur la qualité des sorties d’IA est l’une des compétences les plus pratiques en ingénierie des invites.

Les quatre critères d’évaluation

Lorsque vous lisez une réponse d’IA, évaluez-la selon quatre dimensions :

  • Pertinence — A-t-elle répondu à la question réelle que vous avez posée ?
  • Exactitude — Les informations sont-elles factuellement correctes ?
  • Exhaustivité — A-t-elle couvert toutes les parties de la demande ?
  • Format — Est-elle structurée comme vous en avez besoin ?

Une réponse peut obtenir une évaluation élevée dans trois dimensions et échouer dans la quatrième. Chaque critère compte indépendamment.

Critère 1 : Pertinence

La pertinence pose la question suivante : le modèle a-t-il répondu à la question que vous avez réellement posée, ou à une question différente, mais connexe ?

Exemple : vous demandez "Quels sont les risques liés à l’utilisation des LLM dans le domaine de la santé ?" et le modèle répond par une présentation générale du fonctionnement des LLM. Cette réponse peut être exacte, mais elle n’est pas pertinente : elle est passée à côté de l’essentiel.

Pour vérifier la pertinence, relisez votre invite initiale et demandez-vous : la réponse répond-elle directement à ce que j’ai demandé ?

Critère 2 : Exactitude

L’exactitude pose la question suivante : les faits, les chiffres et les affirmations contenus dans la réponse sont-ils corrects ?

Les modèles d’IA peuvent produire des hallucinations : ils peuvent affirmer avec assurance des choses tout simplement fausses. Parmi les problèmes courants d’exactitude figurent :

  • Des statistiques ou des dates incorrectes
  • Des citations attribuées à tort
  • Des informations obsolètes présentées comme actuelles
  • Des références ou des sources inventées

Pour les sujets factuels, vérifiez toujours les affirmations importantes à l’aide d’une source fiable avant d’utiliser la sortie.

Critère 3 : Exhaustivité

L’exhaustivité pose la question suivante : la réponse a-t-elle couvert toutes les parties de votre demande ?

Si votre invite comportait plusieurs parties — "Expliquez X, énumérez trois exemples et suggérez une prochaine étape" — vérifiez que le modèle les a toutes traitées, et pas seulement la première.

Les modèles omettent parfois la dernière partie d’une demande composée de plusieurs éléments, en particulier lorsque l’invite est longue. Comparer la réponse à votre invite, point par point, est le moyen le plus fiable de vérifier son exhaustivité.

Critère 4 : Format

Le format pose la question suivante : la réponse est-elle structurée comme vous en avez besoin ?

Même une réponse parfaitement exacte et exhaustive peut être difficile à utiliser si son format ne convient pas. Voici des incompatibilités de format courantes :

  • Du texte suivi alors que vous aviez besoin de points
  • Un long essai alors que vous aviez besoin d’un résumé
  • L’absence d’en-têtes qui faciliteraient la navigation
  • Du code sans explications, ou des explications sans code

Les problèmes de format sont souvent les plus faciles à corriger à l’aide d’une invite de suivi.

Une simple liste de contrôle de l’évaluation

Après avoir reçu une réponse d’une IA, parcourez mentalement cette liste de contrôle :

  • Pertinence : répond-elle à ma véritable question ?
  • Exactitude : puis-je me fier aux faits ? Que devrais-je vérifier ?
  • Exhaustivité : a-t-elle couvert toutes les parties de ma demande ?
  • Format : est-elle structurée d’une manière que je peux utiliser ?

Si un critère n’est pas respecté, cela vous indique précisément quel type d’invite de suivi rédiger. Chaque critère indique les points précis de la correction à apporter.

Évaluer dans le code : attribuer une note à une réponse

Vous pouvez créer une enveloppe légère d’évaluation en Python qui attribue une note à une réponse pour chaque critère, en utilisant un second appel à un LLM :

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

Échecs de pertinence : schémas courants

Les échecs de pertinence suivent généralement des schémas prévisibles. Les reconnaître accélère votre évaluation :

  • Dérive du sujet — Le modèle commence correctement, puis s’égare vers un sujet connexe
  • Substitution de question — Le modèle répond à une version plus simple ou plus facile de votre question
  • Généralisation excessive — Vous avez posé une question sur un cas précis, mais le modèle répond pour le cas général
  • Non-respect d’une contrainte — Vous avez indiqué un contexte (par ex. "pour les débutants"), mais le modèle l’a ignoré

Chaque schéma suggère une correction précise à apporter dans votre invite de suivi.

Signaux d’alerte concernant l’exactitude

Même lorsque vous ne pouvez pas vérifier immédiatement une affirmation, certains signaux suggèrent une exactitude moindre :

  • Des chiffres très précis cités sans source
  • Des affirmations qui semblent trop commodes ou parfaitement adaptées
  • Des références à des études, des articles ou des livres mentionnant leur titre et leur auteur
  • Des dates et des numéros de version, qui changent fréquemment
  • Des détails juridiques, médicaux ou financiers

Ces éléments ne prouvent pas qu’il y a une erreur, mais ce sont ceux qu’il vaut la peine de vérifier une seconde fois avant d’utiliser la sortie dans un contexte à forts enjeux.

Utiliser l’évaluation pour rédiger de meilleures invites de suivi

La véritable valeur de l’évaluation réside dans le fait que chaque critère non respecté correspond directement à un type d’invite de suivi :

  • Échec de pertinence → "Vous avez répondu à X, mais je vous interrogeais sur Y. Veuillez vous concentrer sur Y."
  • Doute sur l’exactitude → "Veuillez vérifier une seconde fois l’affirmation concernant Z et citer son fondement."
  • Échec d’exhaustivité → "Vous n’avez pas traité la troisième partie de ma question. Veuillez l’ajouter."
  • Échec de format → "Réécrivez ceci sous forme de points avec un résumé d’une ligne en tête."

L’évaluation et la formulation d’invites de suivi fonctionnent comme une boucle de rétroaction.

Vérification des connaissances : critères d’évaluation

Vous demandez au modèle : "Énumérez les cinq principaux cadres de développement web Python, avec une description d’une phrase pour chacun." Le modèle répond par un essai bien rédigé sur l’histoire de Python et son essor dans le développement web, en mentionnant brièvement Flask et Django, mais sans énumérer cinq cadres.

Quel critère cette réponse ne respecte-t-elle pas le plus gravement ?

Récapitulatif : lire et évaluer les sorties de l’IA

La bonne formulation d’invites est un processus en deux étapes : concevoir l’invite, puis évaluer la réponse.

Les quatre critères — Pertinence, Exactitude, Exhaustivité, Format — vous donnent une méthode systématique pour évaluer toute sortie d’IA. Chaque critère non respecté vous indique précisément quel type d’invite de suivi rédiger.

Dans la prochaine leçon, vous vous exercerez à rédiger ces invites de suivi pour corriger des types précis de problèmes.

Questions Fréquemment Posées

La leçon « Lire et évaluer les résultats de l’IA » est-elle gratuite ?

Oui — le texte complet de « Lire et évaluer les résultats de l’IA » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Lire et évaluer les résultats de l’IA » ?

Critères pour évaluer la pertinence, l’exactitude et l’exhaustivité des réponses de l’IA. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.

Combien de temps prend la leçon « Lire et évaluer les résultats de l’IA » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Lire et évaluer les résultats de l’IA
  2. Rédiger des invites de suivi efficaces
  3. S’appuyer sur les réponses précédentes
  4. Savoir affiner ou recommencer
← Retour à AI Prompt Engineering