Prompts für Bildbeschreibung und Captioning
Lenken Sie den Fokus des Modells auf Objekte, Beziehungen, Stimmung und technische Details
Prompts für Bildbeschreibung und Captioning ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Sichtmodelle und Prompting
Bild-Sprach-Modelle (VLMs) wie GPT-4o und Claude können Bilder zusammen mit Text verarbeiten. Der Prompt, den Sie zusammen mit einem Bild senden, beeinflusst die Qualität, den Fokus und das Format der Modellbeschreibung erheblich.
Ohne einen leitenden Prompt entscheidet das Modell selbst, was es beschreibt – was möglicherweise nicht dem entspricht, was Sie benötigen. Ein strukturierter Beschreibungs-Prompt teilt dem Modell genau mit, welchen Elementen es Aufmerksamkeit schenken und wie es seine Ausgabe organisieren soll.
Ein Bild mit einem Prompt senden
Die Anthropic API akzeptiert Bilder als base64-kodierten Inhalt oder als URLs. Hier ist die grundlegende Struktur:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Der unstrukturierte Beschreibungs-Prompt
Der einfachste Prompt – Beschreiben Sie dieses Bild – erzeugt eine Ausgabe, die vollständig durch die Prioritäten des Modells bestimmt wird. Für viele Anwendungsfälle reicht das nicht aus:
- Das Modell konzentriert sich möglicherweise auf das visuell auffälligste Element und nicht auf das relevanteste
- Beschreibungen können sich bei ähnlichen Bildern in Länge und Aufbau stark unterscheiden
- Wichtige Details (Text, kleine Objekte, Kontext des Hintergrunds) werden häufig ausgelassen
Strukturierte Beschreibungs-Prompts lösen all diese Probleme.
Strukturierte Beschreibung: Aufmerksamkeit lenken
Ein strukturierter Beschreibungs-Prompt lenkt die Aufmerksamkeit des Modells ausdrücklich auf bestimmte visuelle Elemente:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Länge der Beschreibung steuern
Dasselbe Bild kann für unterschiedliche Anwendungsfälle unterschiedlich lange Beschreibungen erfordern. Steuern Sie die Länge ausdrücklich im Prompt:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Domänenspezifische Beschreibungs-Prompts
Unterschiedliche Domänen erfordern ein jeweils anderes beschreibendes Vokabular und unterschiedliche Schwerpunkte:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Strukturierte Ausgabe aus Bildbeschreibungen
Fordern Sie für automatisierte Pipelines eine strukturierte JSON-Ausgabe der Bildbeschreibung statt Fließtext an:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Auf Barrierefreiheit ausgerichtete Beschreibung
Das Verfassen von Bildbeschreibungen für die Barrierefreiheit erfordert einen bestimmten Prompt-Stil, bei dem Informationen für Menschen mit Sehbehinderung priorisiert werden:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Häufige Fehler bei Beschreibungs-Prompts vermeiden
Häufige Fehler bei Bildbeschreibungs-Prompts und wie Sie sie beheben:
- Zu vage: Beschreiben Sie das Bild → Lösung: Geben Sie an, welche Elemente beschrieben werden sollen
- Kein Format: Das Modell schreibt Fließtext, obwohl Sie JSON benötigen → Lösung: Geben Sie das Ausgabeformat ausdrücklich an
- Keine Längenbegrenzung: Das Modell schreibt 1000 Wörter → Lösung: Geben Sie eine Ziellänge an
- Kein Fokus: Alle Elemente werden gleich ausführlich beschrieben → Lösung: Geben Sie an, welches Element im Mittelpunkt steht
- Kein Domänenkontext: Allgemeine Beschreibung eines spezialisierten Bildes → Lösung: Fügen Sie Fachvokabular und Kriterien für den Fokus hinzu
Pipeline zur Batch-Bildbeschreibung
Bei der Verarbeitung mehrerer Bilder in einer automatisierten Pipeline:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Qualität von Beschreibungs-Prompts testen
Testen Sie Beschreibungs-Prompts mit einer vielfältigen Auswahl an Bildern, um eine umfassende Abdeckung und Konsistenz sicherzustellen:
- Einfaches Produkt vor weißem Hintergrund
- Lebensstilfoto mit mehreren Personen
- Textreiches Dokument oder Schild
- Dunkles oder qualitativ minderwertiges Bild
- Abstrakter oder mehrdeutiger Inhalt
Prüfen Sie bei jedem Testbild, ob die Ausgabe alle erforderlichen Elemente abdeckt, die Längenvorgaben einhält und das erforderliche Format verwendet. Passen Sie den Prompt an, wenn eine Kategorie systematisch fehlschlägt.
Kurze Überprüfung
Was ist der wichtigste Vorteil eines strukturierten Bildbeschreibungs-Prompts gegenüber einem einfachen Prompt wie „Beschreiben Sie dieses Bild“?
Bildbeschreibungs-Prompts – die wichtigsten Erkenntnisse
Strukturierte Bildbeschreibungs-Prompts sind entscheidend für konsistente und nützliche Ausgaben visueller KI-Systeme:
- Listen Sie ausdrücklich auf, welche visuellen Elemente beschrieben werden sollen (Vordergrund, Hintergrund, Farben, Stimmung, Text, Personen)
- Geben Sie das Ausgabeformat an – Fließtext, JSON oder bestimmte Abschnittsüberschriften
- Steuern Sie die Länge ausdrücklich – passen Sie sie an den Anwendungsfall an (Bildunterschrift mit 15 Wörtern gegenüber Analyse mit 250 Wörtern)
- Domänenspezifische Prompts (medizinisch, Immobilien, Sicherheit) erfordern Fachvokabular und Kriterien für den Fokus
- Bei der Barrierefreiheit sollten Sie Informationen gegenüber ästhetischen Aspekten priorisieren und den gesamten sichtbaren Text wortgetreu aufnehmen
- Testen Sie verschiedene Bildtypen: Produktbilder, Lebensstilfotos, textlastige Bilder, Bilder mit geringer Qualität und abstrakte Bilder
Lerne AI Prompt Engineering mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 53
- Lektionen
- 199
Häufig gestellte Fragen
Ist die Lektion „Prompts für Bildbeschreibung und Captioning“ kostenlos?
Ja — der vollständige Text von „Prompts für Bildbeschreibung und Captioning“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Prompts für Bildbeschreibung und Captioning“?
Lenken Sie den Fokus des Modells auf Objekte, Beziehungen, Stimmung und technische Details Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Prompts für Bildbeschreibung und Captioning“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Prompts für Bildbeschreibung und Captioning
- Visuelle Fragebeantwortung
- Prompts zum Vergleich mehrerer Bilder
- Prompts für OCR und Dokumentenanalyse