Запросы для описания изображений и создания подписей
Задавайте направление внимания модели: объекты, связи, настроение и технические детали
«Запросы для описания изображений и создания подписей» — бесплатный урок AI Prompt Engineering на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Prompt Engineering, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Prompt Engineering содержит 4 уроков всего.
Модели для работы с изображениями и составление промптов
Мультимодальные языковые модели, такие как GPT-4o и Клод, могут обрабатывать изображения вместе с текстом. Промпт, который Вы отправляете вместе с изображением, существенно влияет на качество, направленность и формат описания модели.
Без направляющего промпта модель сама решает, что описывать, — и это может не соответствовать Вашим потребностям. Структурированный промпт для описания точно указывает модели, на какие элементы обратить внимание и как организовать результат.
Отправка изображения вместе с промптом
Программный интерфейс Anthropic принимает изображения в виде содержимого, закодированного в base64, или адресов. Вот базовая структура:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Неструктурированный промпт для описания
Самый простой промпт — Опишите это изображение — создаёт результат, полностью зависящий от приоритетов модели. Для многих сценариев этого недостаточно:
- Модель может сосредоточиться на самом визуально заметном элементе, а не на самом важном
- Длина и структура описаний могут сильно различаться у похожих изображений
- Важные детали (текст, небольшие объекты, контекст фона) часто пропускаются
Структурированные промпты для описания решают все эти проблемы.
Структурированное описание: управление вниманием
Структурированный промпт для описания явно направляет внимание модели на определённые визуальные элементы:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Управление длиной описания
Для разных сценариев использования одному и тому же изображению могут требоваться описания разной длины. Явно задавайте длину в промпте:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Промпты для описания с учётом предметной области
Для разных предметных областей требуются разные описательные термины и области внимания:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Структурированный вывод описаний изображений
Для автоматизированных конвейеров запрашивайте структурированный вывод в формате JSON из описания изображения, а не связный текст:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Описание с учётом доступности
Написание описаний изображений с учётом доступности требует особого стиля промптов, в котором приоритет отдаётся информации для пользователей с нарушениями зрения:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Как избежать распространённых ошибок в промптах для описания
Распространённые ошибки в промптах для описания изображений и способы их исправления:
- Слишком расплывчато: Опишите изображение → Исправление: укажите, какие элементы нужно описать
- Нет формата: модель пишет связный текст, когда Вам нужен JSON → Исправление: явно укажите формат результата
- Нет ограничения длины: модель пишет 1000 слов → Исправление: укажите целевую длину
- Нет фокуса: все элементы описываются одинаково подробно → Исправление: укажите основной элемент
- Нет контекста предметной области: для специализированного изображения создаётся общее описание → Исправление: добавьте термины предметной области и критерии внимания
Конвейер пакетного описания изображений
Для обработки нескольких изображений в автоматизированном конвейере:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Проверка качества промптов для описания
Проверяйте промпты для описания на разнообразной подборке изображений, чтобы обеспечить полноту и согласованность:
- Простой товар на белом фоне
- Фотография из повседневной жизни с несколькими людьми
- Документ или вывеска с большим количеством текста
- Тёмное изображение или изображение низкого качества
- Абстрактное или неоднозначное содержимое
Для каждого тестового изображения проверьте, охватывает ли результат все необходимые элементы, соблюдает ли ограничения длины и использует ли требуемый формат. Скорректируйте промпт, если какая-либо категория систематически обрабатывается неправильно.
Быстрая проверка
Каково главное преимущество структурированного промпта для описания изображения по сравнению с простым промптом «Опишите это изображение»?
Промпты для описания изображений — основные выводы
Структурированные промпты для описания изображений необходимы для получения согласованных и полезных результатов работы визуального ИИ:
- Явно перечисляйте, какие визуальные элементы нужно описать (передний план, фон, цвета, настроение, текст, люди)
- Указывайте формат результата — связный текст, JSON или определённые заголовки разделов
- Явно управляйте длиной — подбирайте её под сценарий использования (подпись из 15 слов или анализ на 250 слов)
- Промпты с учётом предметной области (медицинской, недвижимости, безопасности) требуют соответствующих терминов и критериев внимания
- При работе с доступностью отдавайте приоритет информации, а не эстетике, и включайте весь видимый текст дословно
- Проверяйте промпты на разных типах изображений: товары, повседневная жизнь, большое количество текста, низкое качество, абстрактное содержимое
Часто задаваемые вопросы
Урок «Запросы для описания изображений и создания подписей» бесплатный?
Да — полный текст урока «Запросы для описания изображений и создания подписей» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Prompt Engineering, подпишись на CoddyKit PRO. Курс AI Prompt Engineering содержит 4 уроков всего.
Чему я научусь в уроке «Запросы для описания изображений и создания подписей»?
Задавайте направление внимания модели: объекты, связи, настроение и технические детали Ты практикуешь AI Prompt Engineering с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Prompt Engineering?
Предыдущий опыт не требуется. AI Prompt Engineering на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Запросы для описания изображений и создания подписей»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Prompt Engineering?
Да. Каждый урок AI Prompt Engineering включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Запросы для описания изображений и создания подписей
- Визуальные вопросы и ответы
- Запросы для сравнения нескольких изображений
- Запросы для OCR и анализа документов