Prompts til billedbeskrivelse og billedtekster
Ret modellens fokus mod objekter, relationer, stemning og tekniske detaljer.
Prompts til billedbeskrivelse og billedtekster er en gratis Promptteknik til AI-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Promptteknik til AI, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Promptteknik til AI-kurset indeholder 4 lektioner i alt.
Synsmodeller og prompting
Vision language-modeller (VLM'er) som GPT-4o og Claude kan behandle billeder sammen med tekst. Den prompt, du sender sammen med et billede, påvirker i høj grad kvaliteten, fokuset og formatet af modellens beskrivelse.
Uden en styrende prompt beslutter modellen selv, hvad den vil beskrive — og det passer måske ikke med det, du har brug for. En struktureret beskrivelsesprompt fortæller modellen præcis, hvilke elementer den skal fokusere på, og hvordan den skal organisere sit resultat.
Sådan sender du et billede med en prompt
Anthropic API accepterer billeder som base64-kodet indhold eller URL'er. Her er grundstrukturen:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Den ustrukturerede beskrivelsesprompt
Den enkleste prompt — Beskriv dette billede — producerer et resultat, der udelukkende formes af modellens prioriteter. Til mange anvendelser er det utilstrækkeligt:
- Modellen fokuserer måske på det visuelt mest iøjnefaldende element i stedet for det mest relevante
- Beskrivelser kan variere meget i længde og opbygning på tværs af lignende billeder
- Vigtige detaljer (tekst, små objekter og kontekst fra baggrunden) udelades ofte
Strukturerede beskrivelsesprompter løser alle disse problemer.
Struktureret beskrivelse: Styring af opmærksomheden
En struktureret beskrivelsesprompt styrer eksplicit modellens opmærksomhed mod bestemte visuelle elementer:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Styring af beskrivelsens længde
Det samme billede kan kræve forskellige beskrivelseslængder til forskellige anvendelser. Styr længden eksplicit i prompten:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Domænespecifikke beskrivelsesprompter
Forskellige domæner kræver forskelligt beskrivende ordforråd og forskellige fokusområder:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Strukturerede resultater fra billedbeskrivelser
Til automatiserede arbejdsgange skal du bede om et struktureret JSON-resultat fra billedbeskrivelsen i stedet for brødtekst:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Tilgænghedsfokuseret beskrivelse
At skrive billedbeskrivelser med fokus på tilgængelighed kræver en bestemt promptstil, der prioriterer information til brugere med synshandicap:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Undgå almindelige fejl i beskrivelsesprompter
Almindelige fejl i prompter til billedbeskrivelse og sådan løser du dem:
- For vag: Beskriv billedet → Løsning: angiv, hvilke elementer der skal beskrives
- Intet format: Modellen skriver brødtekst, når du har brug for JSON → Løsning: angiv resultatformatet eksplicit
- Ingen længdegrænse: Modellen skriver 1000 ord → Løsning: angiv den ønskede længde
- Intet fokus: Alle elementer beskrives lige udførligt → Løsning: angiv, hvilket element der er det primære
- Ingen domænekontekst: En generisk beskrivelse af et specialiseret billede → Løsning: medtag domænespecifik terminologi og fokuskriterier
Arbejdsgang til batchbilledbeskrivelse
Til behandling af flere billeder i en automatiseret arbejdsgang:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Afprøvning af kvaliteten af beskrivelsesprompter
Afprøv beskrivelsesprompter på forskellige billeder for at sikre dækning og ensartethed:
- Enkelt produkt på hvid baggrund
- Livsstilsfoto med flere personer
- Teksttæt dokument eller skilt
- Mørkt billede eller billede af lav kvalitet
- Abstrakt eller tvetydigt indhold
Kontrollér for hvert billede i afprøvningen, at resultatet dækker alle nødvendige elementer, overholder længdebegrænsningerne og bruger det krævede format. Tilpas prompten, hvis en kategori konsekvent mislykkes.
Hurtigt tjek
Hvad er den primære fordel ved en struktureret prompt til billedbeskrivelse sammenlignet med en simpel prompt med teksten 'Beskriv dette billede'?
Prompter til billedbeskrivelse — vigtigste pointer
Strukturerede prompter til billedbeskrivelse er afgørende for ensartede og nyttige visuelle AI-resultater:
- Angiv eksplicit, hvilke visuelle elementer der skal beskrives (forgrund, baggrund, farver, stemning, tekst og personer)
- Angiv resultatformatet — brødtekst, JSON eller bestemte sektionsoverskrifter
- Styr længden eksplicit — tilpas længden til anvendelsen (billedtekst på 15 ord eller analyse på 250 ord)
- Domænespecifikke prompter (medicinske, ejendoms- og sikkerhedsrelaterede) kræver domænespecifik terminologi og fokuskriterier
- Ved tilgængelighed skal du prioritere information over æstetik og medtage al synlig tekst ordret
- Afprøv på forskellige billedtyper: produktbilleder, livsstilsbilleder, teksttunge billeder, billeder af lav kvalitet og abstrakte billeder
Lær Promptteknik til AI med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 199
Ofte stillede spørgsmål
Er lektionen “Prompts til billedbeskrivelse og billedtekster” gratis?
Ja — alle 3 lektioner i læringssporet Promptteknik til AI, inklusive “Prompts til billedbeskrivelse og billedtekster”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Promptteknik til AI-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Prompts til billedbeskrivelse og billedtekster”?
Ret modellens fokus mod objekter, relationer, stemning og tekniske detaljer. Du øver dig i Promptteknik til AI med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Promptteknik til AI?
Der kræves ingen tidligere erfaring. Promptteknik til AI på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.
Hvor lang tid tager lektionen “Prompts til billedbeskrivelse og billedtekster”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Promptteknik til AI-lektion?
Ja. Alle Promptteknik til AI-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Prompts til billedbeskrivelse og billedtekster
- Visuel spørgsmålbesvarelse
- Prompts til sammenligning af flere billeder
- Prompts til OCR og dokumentanalyse