Prompty do opisu obrazów i tworzenia podpisów
Kieruj uwagę modelu na obiekty, relacje, nastrój i szczegóły techniczne.
Prompty do opisu obrazów i tworzenia podpisów to bezpłatna lekcja AI Prompt Engineering na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Prompt Engineering, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.
Modele wizyjne i tworzenie promptów
Modele językowo-wizyjne (VLM), takie jak GPT-4o i Claude, mogą przetwarzać obrazy wraz z tekstem. Prompt wysyłany wraz z obrazem znacząco wpływa na jakość, zakres i format opisu wygenerowanego przez model.
Bez promptu wskazującego kierunek model sam decyduje, co opisać — a to może nie odpowiadać Państwa potrzebom. Ustrukturyzowany prompt do opisu informuje model dokładnie, na których elementach ma się skupić i jak zorganizować wynik.
Wysyłanie obrazu wraz z promptem
Anthropic API akceptuje obrazy jako treść zakodowaną w formacie base64 lub jako adresy URL. Oto podstawowa struktura:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Nieustrukturyzowany prompt do opisu
Najprostszy prompt — Opisz ten obraz — daje wynik całkowicie zależny od priorytetów modelu. W wielu zastosowaniach jest to niewystarczające:
- Model może skupić się na najbardziej przyciągającym wzrok elemencie, a nie na elemencie najistotniejszym
- Opisy podobnych obrazów mogą znacznie różnić się długością i strukturą
- Ważne szczegóły (tekst, małe obiekty, kontekst tła) są często pomijane
Ustrukturyzowane prompty do opisu rozwiązują wszystkie te problemy.
Ustrukturyzowany opis: kierowanie uwagi
Ustrukturyzowany prompt do opisu jawnie kieruje uwagę modelu na określone elementy wizualne:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Kontrolowanie długości opisu
Ten sam obraz może wymagać opisów o różnej długości w zależności od zastosowania. Długość należy jawnie określać w prompcie:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Prompty do opisów specyficznych dla domeny
Różne domeny wymagają odmiennego słownictwa opisowego i skupienia na innych obszarach:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Ustrukturyzowany wynik opisów obrazów
W przypadku zautomatyzowanych potoków należy żądać ustrukturyzowanego wyniku JSON z opisu obrazu zamiast tekstu prozą:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Opis ukierunkowany na dostępność
Tworzenie opisów obrazów na potrzeby dostępności wymaga określonego stylu promptu, który nadaje priorytet informacjom przydatnym osobom z niepełnosprawnością wzroku:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Unikanie typowych błędów w promptach do opisu
Typowe błędy w promptach do opisu obrazów i sposoby ich naprawy:
- Zbyt ogólny prompt: Opisz obraz → Rozwiązanie: określić, które elementy należy opisać
- Brak formatu: Model tworzy tekst prozą, choć potrzebny jest JSON → Rozwiązanie: jawnie określić format wyniku
- Brak limitu długości: Model tworzy tekst o długości 1000 słów → Rozwiązanie: określić docelową długość
- Brak wskazanego obszaru zainteresowania: Wszystkie elementy są opisywane jednakowo → Rozwiązanie: określić, który element jest najważniejszy
- Brak kontekstu domenowego: Ogólny opis specjalistycznego obrazu → Rozwiązanie: uwzględnić słownictwo domenowe i kryteria skupienia uwagi
Potok wsadowego opisywania obrazów
Do przetwarzania wielu obrazów w zautomatyzowanym potoku:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Testowanie jakości promptów do opisu
Prompty do opisu należy testować na zróżnicowanym zbiorze obrazów, aby zapewnić kompletność i spójność:
- Prosty produkt na białym tle
- Zdjęcie przedstawiające codzienne życie z wieloma osobami
- Dokument lub znak zawierający dużo tekstu
- Ciemny obraz lub obraz niskiej jakości
- Treść abstrakcyjna lub niejednoznaczna
Dla każdego obrazu testowego należy sprawdzić, czy wynik obejmuje wszystkie wymagane elementy, respektuje ograniczenia długości i ma wymagany format. Prompt należy dostosować, gdy dowolna kategoria systematycznie wypada nieprawidłowo.
Szybki test
Jaka jest główna zaleta ustrukturyzowanego promptu do opisu obrazu w porównaniu z prostym promptem Opisz ten obraz?
Prompty do opisu obrazów — najważniejsze wnioski
Ustrukturyzowane prompty do opisu obrazów są niezbędne do uzyskiwania spójnych i użytecznych wyników wizualnej AI:
- Należy jawnie wymienić elementy wizualne, które mają zostać opisane (pierwszy plan, tło, kolory, nastrój, tekst, osoby)
- Należy określić format wyniku — tekst prozą, JSON lub konkretne nagłówki sekcji
- Długość należy określać jawnie — dopasować ją do zastosowania (podpis o długości 15 słów lub analiza o długości 250 słów)
- Prompty specyficzne dla domeny (medycznej, nieruchomości, bezpieczeństwa) wymagają słownictwa domenowego i kryteriów skupienia uwagi
- W przypadku dostępności należy przedkładać informacje nad estetykę i uwzględniać dosłownie cały widoczny tekst
- Należy testować różne typy obrazów: produktowe, przedstawiające codzienne życie, zawierające dużo tekstu, niskiej jakości i abstrakcyjne
Ucz się AI Prompt Engineering dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 53
- Lekcje
- 199
Często zadawane pytania
Czy lekcja „Prompty do opisu obrazów i tworzenia podpisów” jest bezpłatna?
Tak — pełny tekst „Prompty do opisu obrazów i tworzenia podpisów” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Prompt Engineering, przejdź na CoddyKit PRO. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.
Co nauczysz się w „Prompty do opisu obrazów i tworzenia podpisów”?
Kieruj uwagę modelu na obiekty, relacje, nastrój i szczegóły techniczne. Ćwiczysz AI Prompt Engineering z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Prompt Engineering?
Nie wymagamy żadnego doświadczenia. AI Prompt Engineering w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Prompty do opisu obrazów i tworzenia podpisów”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Prompt Engineering?
Tak. Każda lekcja AI Prompt Engineering zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Prompty do opisu obrazów i tworzenia podpisów
- Wizualne odpowiadanie na pytania
- Prompty do porównywania wielu obrazów
- Prompty do OCR i analizy dokumentów