0Pricing
AI Prompt Engineering · Leçon

Invites de description et de légendage d’images

Orientez l’attention du modèle vers les objets, les relations, l’ambiance et les détails techniques.

Invites de description et de légendage d’images est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Modèles de vision et formulation d’instructions

Les modèles de langage visuel comme GPT-4o et Claude peuvent traiter des images en plus du texte. L’instruction que vous envoyez avec une image modifie considérablement la qualité, l’orientation et le format de la description produite par le modèle.

Sans instruction directrice, le modèle décide lui-même quoi décrire — ce qui peut ne pas correspondre à vos besoins. Une instruction de description structurée indique précisément au modèle quels éléments examiner et comment organiser sa sortie.

Envoyer une image avec une instruction

L’API d’Anthropic accepte les images sous forme de contenu encodé en base64 ou d’adresses URL. Voici la structure de base :

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

L’instruction de description non structurée

L’instruction la plus simple — Décrivez cette image — produit une sortie entièrement dictée par les priorités du modèle. Pour de nombreux cas d’usage, cela ne suffit pas :

  • Le modèle peut se concentrer sur l’élément le plus frappant visuellement plutôt que sur le plus pertinent
  • La longueur et l’organisation des descriptions peuvent varier considérablement d’une image similaire à l’autre
  • Les détails importants (texte, petits objets, contexte de l’arrière-plan) sont souvent omis

Les instructions de description structurées résolvent tous ces problèmes.

Description structurée : orienter l’attention

Une instruction de description structurée oriente explicitement l’attention du modèle vers des éléments visuels précis :

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

Contrôler la longueur de la description

Une même image peut nécessiter des descriptions de longueurs différentes selon les cas d’usage. Contrôlez explicitement la longueur dans l’instruction :

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

Instructions de description propres au domaine

Les différents domaines nécessitent un vocabulaire descriptif et des points d’attention différents :

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

Sortie structurée des descriptions d’images

Pour les chaînes de traitement automatisées, demandez une sortie JSON structurée à partir de la description de l’image plutôt qu’un texte suivi :

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

Description axée sur l’accessibilité

La rédaction de descriptions d’images accessibles nécessite un style d’instruction particulier qui donne la priorité aux informations utiles aux utilisateurs malvoyants :

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

Éviter les erreurs courantes dans les instructions de description

Erreurs courantes dans les instructions de description d’images et façons de les corriger :

  • Trop vague : Décrivez l’image → Correction : précisez les éléments à décrire
  • Aucun format : le modèle produit un texte suivi alors que vous avez besoin de JSON → Correction : précisez explicitement le format de sortie
  • Aucune limite de longueur : le modèle produit 1 000 mots → Correction : précisez la longueur cible
  • Aucun point focal : tous les éléments sont décrits de la même manière → Correction : précisez quel élément est principal
  • Aucun contexte de domaine : description générique d’une image spécialisée → Correction : incluez le vocabulaire du domaine et les critères d’attention

Chaîne de traitement par lots pour la description d’images

Pour traiter plusieurs images dans une chaîne de traitement automatisée :

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

Évaluer la qualité des instructions de description

Évaluez les instructions de description sur un ensemble varié d’images afin de garantir leur couverture et leur cohérence :

  • Produit simple sur fond blanc
  • Photo de scène quotidienne avec plusieurs personnes
  • Document ou panneau contenant beaucoup de texte
  • Image sombre ou de mauvaise qualité
  • Contenu abstrait ou ambigu

Pour chaque image évaluée, vérifiez que la sortie couvre tous les éléments requis, respecte les contraintes de longueur et utilise le format requis. Ajustez l’instruction lorsqu’un type de cas échoue systématiquement.

Vérification rapide

Quel est le principal avantage d’une instruction de description d’image structurée par rapport à une simple instruction « Décrivez cette image » ?

Instructions de description d’images — Points clés

Les instructions de description d’images structurées sont essentielles pour obtenir des résultats cohérents et utiles de l’IA visuelle :

  • Énumérez explicitement les éléments visuels à décrire (premier plan, arrière-plan, couleurs, ambiance, texte, personnes)
  • Précisez le format de sortie — texte suivi, JSON ou titres de sections précis
  • Contrôlez explicitement la longueur — adaptez-la au cas d’usage (légende de 15 mots contre analyse de 250 mots)
  • Les instructions propres à un domaine (médical, immobilier, sécurité) nécessitent le vocabulaire du domaine et des critères d’attention
  • Pour l’accessibilité, donnez la priorité aux informations plutôt qu’à l’esthétique et incluez tout le texte visible à l’identique
  • Évaluez les instructions sur des types d’images variés : produit, scène quotidienne, image contenant beaucoup de texte, image de mauvaise qualité, contenu abstrait

Questions Fréquemment Posées

La leçon « Invites de description et de légendage d’images » est-elle gratuite ?

Oui — le texte complet de « Invites de description et de légendage d’images » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Invites de description et de légendage d’images » ?

Orientez l’attention du modèle vers les objets, les relations, l’ambiance et les détails techniques. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.

Combien de temps prend la leçon « Invites de description et de légendage d’images » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Invites de description et de légendage d’images
  2. Réponses aux questions visuelles
  3. Invites de comparaison de plusieurs images
  4. Invites d’OCR et d’analyse de documents
← Retour à AI Prompt Engineering