AI Prompt Engineering · Leçon

Combiner texte et images

Des prompts multimodaux unifiés.

Leçon 1 sur 413 étapes

Combiner texte et images est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Invite multimodale unifiée

Une invite multimodale n’est pas du texte accompagné d’une image jointe. Il s’agit d’une séquence unique entrelacée dans laquelle les jetons d’image et les jetons de texte occupent le même contexte et portent attention les uns aux autres. Le modèle ne « regarde pas l’image puis ne lit pas le texte » ; il traite un flux de jetons fusionné.

  • Les zones d’image sont projetées dans le même espace d’intégration que les jetons de texte.
  • L’ordre est important : une question placée avant une image sollicite l’attention différemment d’une question placée après.
  • Vous rédigez une seule invite avec deux formes de surface, et non deux invites.

Ordre d’entrelacement et ancrage

L’emplacement de l’image par rapport à l’instruction modifie le comportement. Placer l’instruction après l’image permet au modèle de conditionner la question sur ce qu’il a déjà encodé ; la placer avant transforme l’image en élément probant pour une tâche énoncée au préalable.

Pour les invites contenant plusieurs images, étiquetez chaque image directement dans le texte afin que les textes suivants puissent la référencer sans ambiguïté ([Image 1], [Image 2]).

messages = [
  {'role': 'user', 'content': [
    {'type': 'text', 'text': 'You will see two product photos.'},
    {'type': 'text', 'text': 'Image 1:'},
    {'type': 'image', 'source': img_a},
    {'type': 'text', 'text': 'Image 2:'},
    {'type': 'image', 'source': img_b},
    {'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
  ]}
]

Cadrage de la tâche avant l’encodage

Les encodeurs de vision sont avec perte : les détails qui ne sont pas pertinents pour la tâche implicite peuvent être supprimés lors de l’agrégation. Si vous énoncez la tâche avant l’image, vous orientez le modèle vers les régions auxquelles il doit prêter attention.

  • Les demandes de description génériques produisent des représentations génériques.
  • Une question précise (« comptez les résistances sur la carte ») concentre le budget de représentation sur les sous-régions pertinentes.

Donnez la priorité à la précision lorsqu’un niveau de détail élevé est nécessaire.

Budgets de résolution et de découpage en tuiles

La plupart des modèles de vision découpent les images haute résolution en blocs de taille fixe, chacun consommant des jetons. Une image de 2000x2000 peut être divisée en nombreuses tuiles, chacune étant sous-échantillonnée. Le budget de jetons est la contrainte silencieuse des instructions multimodales.

  • Utilisez crop sur la région d’intérêt avant l’envoi — ne comptez pas sur le modèle pour zoomer.
  • Pour les documents denses, envoyez des recadrages de pages plutôt qu’une seule image pleine page.
  • Connaissez le nombre maximal de tuiles de votre fournisseur ; au-delà, les petits caractères deviennent illisibles.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
    import math
    tiles = math.ceil(w / tile) * math.ceil(h / tile)
    return tiles * per_tile + per_tile  # + thumbnail

Le texte comme schéma structuré pour la vision

Combinez l’image avec un schéma de sortie explicite dans le canal textuel. L’image fournit le contenu ; le texte fournit le contrat. Cette approche est bien plus fiable qu’une description libre.

Demandez un JSON indexé par les entités que vous vous attendez à voir, et indiquez au modèle d’émettre null pour les champs non visibles — cela réduit les détails hallucinés.

instruction = (
  'Extract from the receipt image. Return JSON: '
  '{"merchant": str|null, "total": number|null, '
  '"date": str|null, "line_items": [{"name": str, "price": number}]}. '
  'Use null when a field is not legible. Do not invent values.'
)

Désambiguïsation par la déixis

Les références déictiques (« ceci », « celui de gauche », « la case mise en évidence ») relient le texte aux régions de l’image. Lorsque vous pouvez annoter préalablement l’image (dessiner un cadre, ajouter une flèche), la référence textuelle devient bien plus robuste que le seul langage spatial.

  • Les indications spatiales (« en haut à droite ») sont sujettes aux erreurs en cas de rotation ou de crop.
  • Un marqueur numéroté superposé accompagné de « objet n° 3 » ne laisse place à aucune ambiguïté.
  • Le prétraitement de l’image pour y ajouter des marqueurs est une technique légitime de conception d’instructions.

Apprentissage à quelques exemples avec des modalités mixtes

Vous pouvez fournir des exemples image-texte pour imposer le format et le style de raisonnement. Chaque exemple est une paire entrelacée (image, réponse idéale). Le modèle déduit la correspondance à partir des démonstrations.

Veillez à ce que les images d’exemple soient représentatives de la distribution réelle — un exemple provenant d’un autre domaine enseigne une mauvaise sélection des caractéristiques.

shots = [
  ('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
  ('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
  ('image', target_chart), ('text', 'Trend:')  # model completes
]

Ancrage des affirmations sur les pixels

Pour les extractions à forts enjeux, exigez que le modèle indique où dans l’image chaque affirmation trouve son origine. Des boîtes englobantes approximatives ou du texte cité présent dans l’image servent de preuves vérifiables et réduisent considérablement les inventions formulées avec assurance.

  • « Pour chaque valeur, citez mot pour mot le texte de l’étiquette que vous avez lu. »
  • « Donnez une boîte normalisée approximative [x0,y0,x1,y1] pour chaque champ. »

L’ancrage transforme une réponse opaque en réponse vérifiable.

Modes d’échec à prévenir

Les modèles multimodaux échouent de manière caractéristique :

  • Dérive de l’OCR avec les petites polices ou les polices stylisées — des chiffres comme 1/7 et 0/O sont confondus.
  • Effondrement du comptage au-delà d’environ 6 objets similaires.
  • Biais de légende : décrire la scène typique plutôt que la scène réelle.
  • Prise de contrôle par le canal textuel : une affirmation textuelle erronée formulée avec assurance peut supprimer des éléments visuels corrects.

Réduisez ces problèmes en demandant au modèle de déduire d’abord les informations depuis l’image, puis de les mettre en cohérence avec les éventuelles affirmations textuelles.

Instructions de réconciliation

Lorsque le contexte textuel et l’image sont en conflit, vous devez définir explicitement la priorité — le modèle ne dispose d’aucune politique par défaut fiable. Indiquez-la : « Si l’image contredit les métadonnées fournies, faites confiance à l’image et signalez la divergence. »

Cette seule phrase transforme une erreur silencieuse en conflit explicite et visible que votre chaîne de traitement en aval peut orienter vers une vérification.

policy = (
  'You are given metadata AND a photo. '
  'When they disagree, prefer the photo as ground truth. '
  'Emit {"value": ..., "conflict": bool, "note": str}.'
)

Conception d’une chaîne de fusion

Les instructions multimodales en production forment une chaîne de traitement, et non un appel unique :

  • Prétraitez : utilisez crop, annotez et réduisez la taille pour respecter le budget.
  • Fusionnez : entrelacez les éléments avec une instruction donnant la priorité à la tâche et un schéma de sortie.
  • Ancrez : exigez des preuves pour chaque affirmation.
  • Réconciliez : indiquez la priorité entre les modalités.
  • Validez : analysez le JSON, vérifiez les valeurs nulles et les indicateurs de conflit.

Chaque étape réduit la surface d’échec que les seules instructions ne peuvent pas éliminer.

Vérification rapide

Vous devez extraire les petits caractères d’une numérisation haute résolution d’un contrat et avez besoin de nombres fiables.

Récapitulatif : fusionner texte et images

Une instruction multimodale unifiée est un flux de jetons entrelacés. Les actions clés sont le cadrage donnant la priorité à la tâche pour orienter l’encodeur de vision, la prise en compte de la résolution et du découpage en tuiles au moyen du recadrage, les schémas de sortie explicites avec des champs pouvant être nuls, l’ancrage sur les pixels pour chaque affirmation et la priorité explicite entre les modalités en cas de conflit. Traitez cela comme une chaîne de traitement — prétraiter, fusionner, ancrer, réconcilier, valider — et les parties fragiles des instructions de vision deviennent contrôlables.

Gratuit pour commencer

Apprends AI Prompt Engineering avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
53
Leçons
199

Questions Fréquemment Posées

La leçon « Combiner texte et images » est-elle gratuite ?

Oui — le texte complet de « Combiner texte et images » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Combiner texte et images » ?

Des prompts multimodaux unifiés. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.

Combien de temps prend la leçon « Combiner texte et images » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Combiner texte et images
  2. Ancrage entre les modalités
  3. Audio, texte et vision réunis
  4. Contrôler les sorties multimodales
← Retour à AI Prompt Engineering