AI Prompt Engineering · Lekcja

Prompty do opisu obrazów i tworzenia podpisów

Kieruj uwagę modelu na obiekty, relacje, nastrój i szczegóły techniczne.

Lekcja 1 z 413 kroki

Prompty do opisu obrazów i tworzenia podpisów to bezpłatna lekcja AI Prompt Engineering na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Prompt Engineering, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.

Modele wizyjne i tworzenie promptów

Modele językowo-wizyjne (VLM), takie jak GPT-4o i Claude, mogą przetwarzać obrazy wraz z tekstem. Prompt wysyłany wraz z obrazem znacząco wpływa na jakość, zakres i format opisu wygenerowanego przez model.

Bez promptu wskazującego kierunek model sam decyduje, co opisać — a to może nie odpowiadać Państwa potrzebom. Ustrukturyzowany prompt do opisu informuje model dokładnie, na których elementach ma się skupić i jak zorganizować wynik.

Wysyłanie obrazu wraz z promptem

Anthropic API akceptuje obrazy jako treść zakodowaną w formacie base64 lub jako adresy URL. Oto podstawowa struktura:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

Nieustrukturyzowany prompt do opisu

Najprostszy prompt — Opisz ten obraz — daje wynik całkowicie zależny od priorytetów modelu. W wielu zastosowaniach jest to niewystarczające:

  • Model może skupić się na najbardziej przyciągającym wzrok elemencie, a nie na elemencie najistotniejszym
  • Opisy podobnych obrazów mogą znacznie różnić się długością i strukturą
  • Ważne szczegóły (tekst, małe obiekty, kontekst tła) są często pomijane

Ustrukturyzowane prompty do opisu rozwiązują wszystkie te problemy.

Ustrukturyzowany opis: kierowanie uwagi

Ustrukturyzowany prompt do opisu jawnie kieruje uwagę modelu na określone elementy wizualne:

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

Kontrolowanie długości opisu

Ten sam obraz może wymagać opisów o różnej długości w zależności od zastosowania. Długość należy jawnie określać w prompcie:

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

Prompty do opisów specyficznych dla domeny

Różne domeny wymagają odmiennego słownictwa opisowego i skupienia na innych obszarach:

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

Ustrukturyzowany wynik opisów obrazów

W przypadku zautomatyzowanych potoków należy żądać ustrukturyzowanego wyniku JSON z opisu obrazu zamiast tekstu prozą:

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

Opis ukierunkowany na dostępność

Tworzenie opisów obrazów na potrzeby dostępności wymaga określonego stylu promptu, który nadaje priorytet informacjom przydatnym osobom z niepełnosprawnością wzroku:

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

Unikanie typowych błędów w promptach do opisu

Typowe błędy w promptach do opisu obrazów i sposoby ich naprawy:

  • Zbyt ogólny prompt: Opisz obraz → Rozwiązanie: określić, które elementy należy opisać
  • Brak formatu: Model tworzy tekst prozą, choć potrzebny jest JSON → Rozwiązanie: jawnie określić format wyniku
  • Brak limitu długości: Model tworzy tekst o długości 1000 słów → Rozwiązanie: określić docelową długość
  • Brak wskazanego obszaru zainteresowania: Wszystkie elementy są opisywane jednakowo → Rozwiązanie: określić, który element jest najważniejszy
  • Brak kontekstu domenowego: Ogólny opis specjalistycznego obrazu → Rozwiązanie: uwzględnić słownictwo domenowe i kryteria skupienia uwagi

Potok wsadowego opisywania obrazów

Do przetwarzania wielu obrazów w zautomatyzowanym potoku:

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

Testowanie jakości promptów do opisu

Prompty do opisu należy testować na zróżnicowanym zbiorze obrazów, aby zapewnić kompletność i spójność:

  • Prosty produkt na białym tle
  • Zdjęcie przedstawiające codzienne życie z wieloma osobami
  • Dokument lub znak zawierający dużo tekstu
  • Ciemny obraz lub obraz niskiej jakości
  • Treść abstrakcyjna lub niejednoznaczna

Dla każdego obrazu testowego należy sprawdzić, czy wynik obejmuje wszystkie wymagane elementy, respektuje ograniczenia długości i ma wymagany format. Prompt należy dostosować, gdy dowolna kategoria systematycznie wypada nieprawidłowo.

Szybki test

Jaka jest główna zaleta ustrukturyzowanego promptu do opisu obrazu w porównaniu z prostym promptem Opisz ten obraz?

Prompty do opisu obrazów — najważniejsze wnioski

Ustrukturyzowane prompty do opisu obrazów są niezbędne do uzyskiwania spójnych i użytecznych wyników wizualnej AI:

  • Należy jawnie wymienić elementy wizualne, które mają zostać opisane (pierwszy plan, tło, kolory, nastrój, tekst, osoby)
  • Należy określić format wyniku — tekst prozą, JSON lub konkretne nagłówki sekcji
  • Długość należy określać jawnie — dopasować ją do zastosowania (podpis o długości 15 słów lub analiza o długości 250 słów)
  • Prompty specyficzne dla domeny (medycznej, nieruchomości, bezpieczeństwa) wymagają słownictwa domenowego i kryteriów skupienia uwagi
  • W przypadku dostępności należy przedkładać informacje nad estetykę i uwzględniać dosłownie cały widoczny tekst
  • Należy testować różne typy obrazów: produktowe, przedstawiające codzienne życie, zawierające dużo tekstu, niskiej jakości i abstrakcyjne
Bezpłatny start

Ucz się AI Prompt Engineering dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
53
Lekcje
199

Często zadawane pytania

Czy lekcja „Prompty do opisu obrazów i tworzenia podpisów” jest bezpłatna?

Tak — pełny tekst „Prompty do opisu obrazów i tworzenia podpisów” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Prompt Engineering, przejdź na CoddyKit PRO. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.

Co nauczysz się w „Prompty do opisu obrazów i tworzenia podpisów”?

Kieruj uwagę modelu na obiekty, relacje, nastrój i szczegóły techniczne. Ćwiczysz AI Prompt Engineering z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Prompt Engineering?

Nie wymagamy żadnego doświadczenia. AI Prompt Engineering w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Prompty do opisu obrazów i tworzenia podpisów”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Prompt Engineering?

Tak. Każda lekcja AI Prompt Engineering zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Prompty do opisu obrazów i tworzenia podpisów
  2. Wizualne odpowiadanie na pytania
  3. Prompty do porównywania wielu obrazów
  4. Prompty do OCR i analizy dokumentów
← Powrót do AI Prompt Engineering