Prompt per descrivere e sottotitolare immagini
Indirizzi l'attenzione del modello su oggetti, relazioni, atmosfera e dettagli tecnici
Prompt per descrivere e sottotitolare immagini è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.
Modelli visivi e prompting
I modelli linguistici visivi (VLM), come GPT-4o e Claude, possono elaborare immagini insieme al testo. Il prompt inviato insieme a un'immagine influenza notevolmente la qualità, l'attenzione e il formato della descrizione del modello.
Senza un prompt guida, il modello decide autonomamente che cosa descrivere, e ciò potrebbe non corrispondere alle Sue esigenze. Un prompt strutturato per la descrizione indica esattamente al modello su quali elementi concentrarsi e come organizzare l'output.
Inviare un'immagine con un prompt
L'API Anthropic accetta immagini come contenuto codificato in base64 o come URL. Ecco la struttura di base:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Il prompt per una descrizione non strutturata
Il prompt più semplice, Descrivi questa immagine, produce un output determinato interamente dalle priorità del modello. Per molti casi d'uso, ciò non è sufficiente:
- Il modello potrebbe concentrarsi sull'elemento visivamente più evidente, anziché su quello più rilevante
- La lunghezza e l'organizzazione delle descrizioni possono variare notevolmente tra immagini simili
- I dettagli importanti, come testo, oggetti di piccole dimensioni e contesto dello sfondo, vengono spesso omessi
I prompt strutturati per la descrizione risolvono tutti questi problemi.
Descrizione strutturata: indirizzare l'attenzione
Un prompt strutturato per la descrizione indirizza esplicitamente l'attenzione del modello verso specifici elementi visivi:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Controllare la lunghezza della descrizione
La stessa immagine può richiedere descrizioni di lunghezza diversa in base al caso d'uso. Controlli esplicitamente la lunghezza nel prompt:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Prompt per descrizioni specifiche del dominio
Domini diversi richiedono un vocabolario descrittivo e aree di attenzione differenti:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Output strutturato dalle descrizioni delle immagini
Per le pipeline automatizzate, chieda un output JSON strutturato dalla descrizione dell'immagine anziché una risposta in prosa:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Descrizioni focalizzate sull'accessibilità
Scrivere descrizioni delle immagini accessibili richiede uno stile di prompt specifico, che dia priorità alle informazioni utili per le persone con disabilità visive:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Evitare gli errori comuni nei prompt per la descrizione
Errori comuni nei prompt per la descrizione delle immagini e come correggerli:
- Troppo vago: Descrivi l'immagine → Soluzione: specifichi quali elementi descrivere
- Nessun formato: il modello scrive in prosa quando serve JSON → Soluzione: specifichi esplicitamente il formato dell'output
- Nessun limite di lunghezza: il modello scrive 1000 parole → Soluzione: specifichi la lunghezza desiderata
- Nessun focus: tutti gli elementi vengono descritti allo stesso modo → Soluzione: specifichi quale elemento è principale
- Nessun contesto di dominio: descrizione generica per un'immagine specialistica → Soluzione: includa il vocabolario del dominio e i criteri di attenzione
Pipeline batch per la descrizione delle immagini
Per elaborare più immagini in una pipeline automatizzata:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Testare la qualità dei prompt per la descrizione
Testi i prompt per la descrizione su un insieme diversificato di immagini per garantire copertura e coerenza:
- Prodotto semplice su sfondo bianco
- Foto di vita quotidiana con più persone
- Documento o cartello con molto testo
- Immagine scura o di bassa qualità
- Contenuto astratto o ambiguo
Per ogni immagine di test, verifichi che l'output includa tutti gli elementi richiesti, rispetti i limiti di lunghezza e utilizzi il formato richiesto. Modifichi il prompt quando una categoria presenta sistematicamente dei problemi.
Verifica rapida
Qual è il principale vantaggio di un prompt strutturato per la descrizione delle immagini rispetto a un semplice prompt «Descrivi questa immagine»?
Prompt per la descrizione delle immagini — Punti chiave
I prompt strutturati per la descrizione delle immagini sono essenziali per ottenere output di IA visiva coerenti e utili:
- Indichi esplicitamente quali elementi visivi descrivere (primo piano, sfondo, colori, atmosfera, testo, persone)
- Specifichi il formato dell'output: prosa, JSON o intestazioni di sezione specifiche
- Controlli esplicitamente la lunghezza, adattandola al caso d'uso (didascalia di 15 parole rispetto ad analisi di 250 parole)
- I prompt specifici del dominio (medico, immobiliare, sicurezza) richiedono il vocabolario del dominio e criteri di attenzione
- Per l'accessibilità, dia priorità alle informazioni rispetto all'estetica e includa tutto il testo visibile alla lettera
- Esegua test su tipi di immagini diversi: prodotti, scene di vita quotidiana, immagini ricche di testo, immagini di bassa qualità e astratte
Domande Frequenti
La lezione «Prompt per descrivere e sottotitolare immagini» è gratuita?
Sì — il testo completo di «Prompt per descrivere e sottotitolare immagini» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.
Cosa imparerò in «Prompt per descrivere e sottotitolare immagini»?
Indirizzi l'attenzione del modello su oggetti, relazioni, atmosfera e dettagli tecnici Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Prompt Engineering?
Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.
Quanto tempo richiede la lezione «Prompt per descrivere e sottotitolare immagini»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?
Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Prompt per descrivere e sottotitolare immagini
- Visual Question Answering
- Prompt per il confronto tra più immagini
- Prompt per OCR e analisi dei documenti