0Pricing
AI Prompt Engineering · Урок

Запросы для описания изображений и создания подписей

Задавайте направление внимания модели: объекты, связи, настроение и технические детали

«Запросы для описания изображений и создания подписей» — бесплатный урок AI Prompt Engineering на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Prompt Engineering, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Prompt Engineering содержит 4 уроков всего.

Модели для работы с изображениями и составление промптов

Мультимодальные языковые модели, такие как GPT-4o и Клод, могут обрабатывать изображения вместе с текстом. Промпт, который Вы отправляете вместе с изображением, существенно влияет на качество, направленность и формат описания модели.

Без направляющего промпта модель сама решает, что описывать, — и это может не соответствовать Вашим потребностям. Структурированный промпт для описания точно указывает модели, на какие элементы обратить внимание и как организовать результат.

Отправка изображения вместе с промптом

Программный интерфейс Anthropic принимает изображения в виде содержимого, закодированного в base64, или адресов. Вот базовая структура:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

Неструктурированный промпт для описания

Самый простой промпт — Опишите это изображение — создаёт результат, полностью зависящий от приоритетов модели. Для многих сценариев этого недостаточно:

  • Модель может сосредоточиться на самом визуально заметном элементе, а не на самом важном
  • Длина и структура описаний могут сильно различаться у похожих изображений
  • Важные детали (текст, небольшие объекты, контекст фона) часто пропускаются

Структурированные промпты для описания решают все эти проблемы.

Структурированное описание: управление вниманием

Структурированный промпт для описания явно направляет внимание модели на определённые визуальные элементы:

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

Управление длиной описания

Для разных сценариев использования одному и тому же изображению могут требоваться описания разной длины. Явно задавайте длину в промпте:

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

Промпты для описания с учётом предметной области

Для разных предметных областей требуются разные описательные термины и области внимания:

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

Структурированный вывод описаний изображений

Для автоматизированных конвейеров запрашивайте структурированный вывод в формате JSON из описания изображения, а не связный текст:

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

Описание с учётом доступности

Написание описаний изображений с учётом доступности требует особого стиля промптов, в котором приоритет отдаётся информации для пользователей с нарушениями зрения:

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

Как избежать распространённых ошибок в промптах для описания

Распространённые ошибки в промптах для описания изображений и способы их исправления:

  • Слишком расплывчато: Опишите изображение → Исправление: укажите, какие элементы нужно описать
  • Нет формата: модель пишет связный текст, когда Вам нужен JSON → Исправление: явно укажите формат результата
  • Нет ограничения длины: модель пишет 1000 слов → Исправление: укажите целевую длину
  • Нет фокуса: все элементы описываются одинаково подробно → Исправление: укажите основной элемент
  • Нет контекста предметной области: для специализированного изображения создаётся общее описание → Исправление: добавьте термины предметной области и критерии внимания

Конвейер пакетного описания изображений

Для обработки нескольких изображений в автоматизированном конвейере:

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

Проверка качества промптов для описания

Проверяйте промпты для описания на разнообразной подборке изображений, чтобы обеспечить полноту и согласованность:

  • Простой товар на белом фоне
  • Фотография из повседневной жизни с несколькими людьми
  • Документ или вывеска с большим количеством текста
  • Тёмное изображение или изображение низкого качества
  • Абстрактное или неоднозначное содержимое

Для каждого тестового изображения проверьте, охватывает ли результат все необходимые элементы, соблюдает ли ограничения длины и использует ли требуемый формат. Скорректируйте промпт, если какая-либо категория систематически обрабатывается неправильно.

Быстрая проверка

Каково главное преимущество структурированного промпта для описания изображения по сравнению с простым промптом «Опишите это изображение»?

Промпты для описания изображений — основные выводы

Структурированные промпты для описания изображений необходимы для получения согласованных и полезных результатов работы визуального ИИ:

  • Явно перечисляйте, какие визуальные элементы нужно описать (передний план, фон, цвета, настроение, текст, люди)
  • Указывайте формат результата — связный текст, JSON или определённые заголовки разделов
  • Явно управляйте длиной — подбирайте её под сценарий использования (подпись из 15 слов или анализ на 250 слов)
  • Промпты с учётом предметной области (медицинской, недвижимости, безопасности) требуют соответствующих терминов и критериев внимания
  • При работе с доступностью отдавайте приоритет информации, а не эстетике, и включайте весь видимый текст дословно
  • Проверяйте промпты на разных типах изображений: товары, повседневная жизнь, большое количество текста, низкое качество, абстрактное содержимое

Часто задаваемые вопросы

Урок «Запросы для описания изображений и создания подписей» бесплатный?

Да — полный текст урока «Запросы для описания изображений и создания подписей» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Prompt Engineering, подпишись на CoddyKit PRO. Курс AI Prompt Engineering содержит 4 уроков всего.

Чему я научусь в уроке «Запросы для описания изображений и создания подписей»?

Задавайте направление внимания модели: объекты, связи, настроение и технические детали Ты практикуешь AI Prompt Engineering с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Prompt Engineering?

Предыдущий опыт не требуется. AI Prompt Engineering на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Запросы для описания изображений и создания подписей»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Prompt Engineering?

Да. Каждый урок AI Prompt Engineering включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Запросы для описания изображений и создания подписей
  2. Визуальные вопросы и ответы
  3. Запросы для сравнения нескольких изображений
  4. Запросы для OCR и анализа документов
← Назад к AI Prompt Engineering