Solicitações para descrição e legendagem de imagens
Oriente o foco do modelo: objetos, relações, clima e detalhes técnicos.
Solicitações para descrição e legendagem de imagens é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.
Modelos de visão e instruções
Modelos de linguagem visuais (VLMs), como GPT-4o e Claude, podem processar imagens junto com texto. A instrução enviada com uma imagem afeta significativamente a qualidade, o foco e o formato da descrição do modelo.
Sem uma instrução orientadora, o modelo decide o que descrever — o que pode não corresponder ao que você precisa. Uma instrução estruturada de descrição informa exatamente ao modelo quais elementos devem receber atenção e como organizar sua saída.
Enviando uma imagem com uma instrução
A API da Anthropic aceita imagens como conteúdo codificado em base64 ou como URLs. Esta é a estrutura básica:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)A instrução de descrição não estruturada
A instrução mais simples — Descreva esta imagem — produz uma saída moldada inteiramente pelas prioridades do modelo. Para muitos casos de uso, isso é insuficiente:
- O modelo pode se concentrar no elemento visualmente mais marcante, e não no mais relevante
- As descrições podem variar muito em extensão e organização entre imagens semelhantes
- Detalhes importantes (texto, objetos pequenos e contexto do plano de fundo) são frequentemente omitidos
As instruções estruturadas de descrição resolvem todos esses problemas.
Descrição estruturada: direcionando a atenção
Uma instrução estruturada de descrição direciona explicitamente a atenção do modelo para elementos visuais específicos:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Controlando o tamanho da descrição
A mesma imagem pode exigir descrições de tamanhos diferentes para casos de uso distintos. Controle o tamanho explicitamente na instrução:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Instruções de descrição específicas do domínio
Diferentes domínios exigem vocabulário descritivo e áreas de foco diferentes:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Saída estruturada de descrições de imagens
Para fluxos de processamento automatizados, solicite uma saída estruturada em JSON para a descrição da imagem, em vez de prosa:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Descrição com foco em acessibilidade
Escrever descrições de imagens para acessibilidade exige um estilo específico de instrução que priorize informações para usuários com deficiência visual:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Evitando erros comuns em instruções de descrição
Erros comuns em instruções de descrição de imagens e como corrigi-los:
- Muito vaga: Descreva a imagem → Correção: especifique quais elementos devem ser descritos
- Sem formato: o modelo escreve prosa quando você precisa de JSON → Correção: especifique explicitamente o formato da saída
- Sem limite de tamanho: o modelo escreve 1.000 palavras → Correção: especifique o tamanho desejado
- Sem foco: todos os elementos são descritos igualmente → Correção: especifique qual elemento é o principal
- Sem contexto do domínio: descrição genérica para uma imagem especializada → Correção: inclua o vocabulário do domínio e os critérios de foco
Fluxo de processamento em lote de descrições de imagens
Para processar várias imagens em um fluxo de processamento automatizado:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Testando a qualidade das instruções de descrição
Teste as instruções de descrição em um conjunto diversificado de imagens para garantir abrangência e consistência:
- Produto simples sobre um plano de fundo branco
- Foto cotidiana com várias pessoas
- Documento ou placa com muito texto
- Imagem escura ou de baixa qualidade
- Conteúdo abstrato ou ambíguo
Para cada imagem de teste, verifique se a saída abrange todos os elementos necessários, respeita as restrições de tamanho e usa o formato exigido. Ajuste a instrução quando alguma categoria falhar sistematicamente.
Verificação rápida
Qual é o principal benefício de uma instrução estruturada de descrição de imagens em comparação com uma instrução simples, como “Descreva esta imagem”?
Instruções de descrição de imagens — principais conclusões
Instruções estruturadas de descrição de imagens são essenciais para obter saídas de IA visual consistentes e úteis:
- Liste explicitamente quais elementos visuais devem ser descritos (primeiro plano, plano de fundo, cores, clima, texto e pessoas)
- Especifique o formato da saída — prosa, JSON ou títulos de seção específicos
- Controle explicitamente o tamanho — adapte-o ao caso de uso (legenda de 15 palavras versus análise de 250 palavras)
- Instruções específicas do domínio (médico, imobiliário e de segurança) exigem vocabulário do domínio e critérios de foco
- Para acessibilidade, priorize informações em vez de estética e inclua todo o texto visível literalmente
- Teste com tipos diversificados de imagens: produtos, cenas cotidianas, imagens com muito texto, imagens de baixa qualidade e imagens abstratas
Perguntas Frequentes
A aula “Solicitações para descrição e legendagem de imagens” é grátis?
Sim — o texto completo de “Solicitações para descrição e legendagem de imagens” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que vou aprender em “Solicitações para descrição e legendagem de imagens”?
Oriente o foco do modelo: objetos, relações, clima e detalhes técnicos. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Solicitações para descrição e legendagem de imagens”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Solicitações para descrição e legendagem de imagens
- Perguntas e respostas visuais
- Solicitações para comparação de várias imagens
- Solicitações para OCR e análise de documentos