AI Prompt Engineering · Leçon

Contrôler les sorties multimodales

Structurer des réponses mêlant plusieurs médias.

Leçon 4 sur 413 étapes

Contrôler les sorties multimodales est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Contrôler les sorties multimédias

Le contrôle de la sortie consiste à façonner la forme que prend la réponse lorsque celle-ci englobe du texte, des données structurées et des références à des médias générés ou sélectionnés. Le modèle produit par défaut de la prose ; les systèmes de production ont besoin d'artefacts analysables, affichables et composables.

  • Vous spécifiez un contrat de rendu, plutôt que de poser simplement une question.
  • La fiabilité du format prime sur sa richesse : les structures prévisibles l'emportent.

Séparer le contenu de la présentation

Demandez au modèle de produire un contenu structuré, puis effectuez le rendu des médias de votre côté. Demander à un modèle de texte de produire des octets d'image bruts ou des mises en page comportant beaucoup de balises est fragile ; lui demander une description typée que votre moteur de rendu transforme en média est robuste.

Le modèle décide quoi ; votre chaîne de traitement décide de l'apparence.

block = {
  'type': 'figure',
  'caption': 'Quarterly revenue',
  'chart': {'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10, 14]},
  'alt_text': 'Bar chart rising from 10 to 14.'
}

Schémas de réponse typés par blocs

Représentez les réponses riches sous la forme d'une liste ordonnée de blocs typés : text, code, image_ref, table, chart_spec. Chaque bloc ne contient que les champs nécessaires à son type. Votre moteur de rendu parcourt la liste et produit le composant approprié pour chaque type.

C'est ainsi que les interfaces de conversation, les rapports et les générateurs de diapositives restent fiables sur des milliers de réponses.

schema = {
  'blocks': [
    {'type': 'text', 'value': '...'},
    {'type': 'code', 'lang': 'python', 'value': '...'},
    {'type': 'image_ref', 'id': 'fig1', 'alt': '...'},
    {'type': 'table', 'columns': [...], 'rows': [...]}
  ]
}

Référencer plutôt qu'intégrer les médias

Préférez les références aux intégrations. Le modèle produit un identifiant ou une spécification de génération ; votre système la résout en ressource réelle. Cela découple l'étape linguistique de l'étape multimédia et vous permet de mettre les ressources en cache, de les régénérer ou de les remplacer sans reformuler la requête.

  • Intégration : la réponse contient la ressource directement (lourd, fragile).
  • Référence : la réponse contient un pointeur ou une recette (léger, composable).
image_block = {
  'type': 'image_ref',
  'spec': {'prompt': 'minimal line icon of a gear', 'size': '512x512'},
  'alt': 'Settings gear icon'
}
# Pipeline calls the image model with spec, fills in the URL.

Contraindre les spécifications de génération

Lorsque le modèle rédige une spécification destinée à un générateur en aval (image, graphique, TTS), contraignez-la strictement. Les spécifications ouvertes dérivent ; les options énumérées restent conformes à la charte et au budget.

Fournissez au modèle un vocabulaire contrôlé : types de graphiques autorisés, styles d'image autorisés, voix autorisées, et interdisez tout écart en texte libre.

chart_spec = {
  'kind': 'one of [bar, line, scatter]',   # enumerated
  'palette': 'brand_default',               # not a hex free-for-all
  'max_series': 4
}

Champs d'accessibilité obligatoires

Chaque bloc multimédia doit contenir un texte alternatif ou un champ de transcription, que vous devez rendre obligatoire dans le schéma. Il s'agit à la fois d'une exigence d'accessibilité et d'un moyen de vérification : le texte alternatif révèle ce que le modèle entendait faire comprendre par le média, ce que vous pouvez comparer à la spécification.

Ordre d'enchaînement et intention de mise en page

L'ordre des blocs constitue la mise en page. Si le modèle renvoie un graphique avant le paragraphe qui l'explique, le document produit est incohérent. Indiquez l'intention de mise en page : « le texte explicatif précède la figure qu'il décrit ; une figure est toujours suivie d'une conclusion en une ligne ».

Encodez les règles d'ordre de lecture afin que la liste de blocs produise un récit cohérent.

Budgets de longueur et de densité par bloc

Contrôlez le niveau de détail au niveau du bloc, et non globalement. Une légende tient sur une ligne ; une introduction de section forme un court paragraphe ; un tableau est limité à N lignes. Les budgets par bloc empêchent le modèle de gonfler démesurément un composant tout en en privant un autre de contenu.

  • « Légendes : 12 mots maximum. »
  • « Tableaux : 8 lignes maximum ; résumez le reste dans une dernière ligne. »
limits = {'caption_words': 12, 'table_rows': 8, 'intro_sentences': 3}

Boucles de validation et de réparation

Un schéma multimédia ne vaut que ce que vaut son validateur. Analysez la liste de blocs, validez chaque bloc selon le schéma de son type et, en cas d'échec, envoyez une requête de réparation ciblée qui indique précisément la violation.

Réparer vaut mieux que régénérer : redemander toute la réponse gaspille des jetons et peut endommager les parties qui étaient correctes.

def validate(blocks):
    for b in blocks:
        if b['type'] == 'image_ref' and 'alt' not in b:
            return f'Block {b} missing required alt text'
    return None  # ok

Diffusion multimédia en continu

Lors d'une diffusion en continu, les blocs doivent pouvoir être analysés individuellement afin que l'interface puisse afficher chacun d'eux dès qu'il est terminé, sans attendre la réponse complète. Produisez un objet JSON bien formé par bloc, délimité par des retours à la ligne, plutôt qu'un tableau géant qui reste invalide jusqu'au dernier crochet.

La diffusion bloc par bloc offre des interfaces réactives et une validation précoce.

{'type': 'text', 'value': 'Revenue grew this quarter.'}
{'type': 'chart_spec', 'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10,14], 'alt': '...'}
{'type': 'text', 'value': 'The bulk came from new accounts.'}

Contrat de contrôle de la sortie

Un contrat multimédia complet précise : le vocabulaire de blocs typés, les références plutôt que les intégrations, les spécifications de génération énumérées, les textes alternatifs ou transcriptions obligatoires, les règles d'ordre de lecture, les budgets par bloc et une sérialisation adaptée à la diffusion en continu. Regroupez-le dans un bloc système réutilisable et votre moteur de rendu devient une cible stable pour de nombreuses tâches.

Vérification rapide

Vous créez un générateur de rapports dont les réponses mélangent des paragraphes, des tableaux et des figures, affichés par votre propre interface.

Récapitulatif : structurer les réponses multimédias

Traitez une sortie riche comme un contrat de rendu : un vocabulaire de blocs typés, des médias représentés par des références ou des spécifications de génération contraintes plutôt que par des intégrations, des champs de texte alternatif ou de transcription obligatoires, un ordre de lecture explicite, des budgets par bloc et une sérialisation adaptée à la diffusion en continu, avec validation et réparation. Séparez ce que décide le modèle de la manière dont votre chaîne de traitement effectue le rendu ; les réponses multimédias deviennent ainsi prévisibles, vérifiables et faciles à composer.

Gratuit pour commencer

Apprends AI Prompt Engineering avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
53
Leçons
199

Questions Fréquemment Posées

La leçon « Contrôler les sorties multimodales » est-elle gratuite ?

Oui — le texte complet de « Contrôler les sorties multimodales » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Contrôler les sorties multimodales » ?

Structurer des réponses mêlant plusieurs médias. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Contrôler les sorties multimodales » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Combiner texte et images
  2. Ancrage entre les modalités
  3. Audio, texte et vision réunis
  4. Contrôler les sorties multimodales
← Retour à AI Prompt Engineering