0Pricing
AI Prompt Engineering · Aula

Solicitações para descrição e legendagem de imagens

Oriente o foco do modelo: objetos, relações, clima e detalhes técnicos.

Solicitações para descrição e legendagem de imagens é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.

Modelos de visão e instruções

Modelos de linguagem visuais (VLMs), como GPT-4o e Claude, podem processar imagens junto com texto. A instrução enviada com uma imagem afeta significativamente a qualidade, o foco e o formato da descrição do modelo.

Sem uma instrução orientadora, o modelo decide o que descrever — o que pode não corresponder ao que você precisa. Uma instrução estruturada de descrição informa exatamente ao modelo quais elementos devem receber atenção e como organizar sua saída.

Enviando uma imagem com uma instrução

A API da Anthropic aceita imagens como conteúdo codificado em base64 ou como URLs. Esta é a estrutura básica:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

A instrução de descrição não estruturada

A instrução mais simples — Descreva esta imagem — produz uma saída moldada inteiramente pelas prioridades do modelo. Para muitos casos de uso, isso é insuficiente:

  • O modelo pode se concentrar no elemento visualmente mais marcante, e não no mais relevante
  • As descrições podem variar muito em extensão e organização entre imagens semelhantes
  • Detalhes importantes (texto, objetos pequenos e contexto do plano de fundo) são frequentemente omitidos

As instruções estruturadas de descrição resolvem todos esses problemas.

Descrição estruturada: direcionando a atenção

Uma instrução estruturada de descrição direciona explicitamente a atenção do modelo para elementos visuais específicos:

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

Controlando o tamanho da descrição

A mesma imagem pode exigir descrições de tamanhos diferentes para casos de uso distintos. Controle o tamanho explicitamente na instrução:

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

Instruções de descrição específicas do domínio

Diferentes domínios exigem vocabulário descritivo e áreas de foco diferentes:

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

Saída estruturada de descrições de imagens

Para fluxos de processamento automatizados, solicite uma saída estruturada em JSON para a descrição da imagem, em vez de prosa:

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

Descrição com foco em acessibilidade

Escrever descrições de imagens para acessibilidade exige um estilo específico de instrução que priorize informações para usuários com deficiência visual:

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

Evitando erros comuns em instruções de descrição

Erros comuns em instruções de descrição de imagens e como corrigi-los:

  • Muito vaga: Descreva a imagem → Correção: especifique quais elementos devem ser descritos
  • Sem formato: o modelo escreve prosa quando você precisa de JSON → Correção: especifique explicitamente o formato da saída
  • Sem limite de tamanho: o modelo escreve 1.000 palavras → Correção: especifique o tamanho desejado
  • Sem foco: todos os elementos são descritos igualmente → Correção: especifique qual elemento é o principal
  • Sem contexto do domínio: descrição genérica para uma imagem especializada → Correção: inclua o vocabulário do domínio e os critérios de foco

Fluxo de processamento em lote de descrições de imagens

Para processar várias imagens em um fluxo de processamento automatizado:

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

Testando a qualidade das instruções de descrição

Teste as instruções de descrição em um conjunto diversificado de imagens para garantir abrangência e consistência:

  • Produto simples sobre um plano de fundo branco
  • Foto cotidiana com várias pessoas
  • Documento ou placa com muito texto
  • Imagem escura ou de baixa qualidade
  • Conteúdo abstrato ou ambíguo

Para cada imagem de teste, verifique se a saída abrange todos os elementos necessários, respeita as restrições de tamanho e usa o formato exigido. Ajuste a instrução quando alguma categoria falhar sistematicamente.

Verificação rápida

Qual é o principal benefício de uma instrução estruturada de descrição de imagens em comparação com uma instrução simples, como “Descreva esta imagem”?

Instruções de descrição de imagens — principais conclusões

Instruções estruturadas de descrição de imagens são essenciais para obter saídas de IA visual consistentes e úteis:

  • Liste explicitamente quais elementos visuais devem ser descritos (primeiro plano, plano de fundo, cores, clima, texto e pessoas)
  • Especifique o formato da saída — prosa, JSON ou títulos de seção específicos
  • Controle explicitamente o tamanho — adapte-o ao caso de uso (legenda de 15 palavras versus análise de 250 palavras)
  • Instruções específicas do domínio (médico, imobiliário e de segurança) exigem vocabulário do domínio e critérios de foco
  • Para acessibilidade, priorize informações em vez de estética e inclua todo o texto visível literalmente
  • Teste com tipos diversificados de imagens: produtos, cenas cotidianas, imagens com muito texto, imagens de baixa qualidade e imagens abstratas

Perguntas Frequentes

A aula “Solicitações para descrição e legendagem de imagens” é grátis?

Sim — o texto completo de “Solicitações para descrição e legendagem de imagens” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.

O que vou aprender em “Solicitações para descrição e legendagem de imagens”?

Oriente o foco do modelo: objetos, relações, clima e detalhes técnicos. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Prompt Engineering?

Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Solicitações para descrição e legendagem de imagens”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Prompt Engineering?

Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Solicitações para descrição e legendagem de imagens
  2. Perguntas e respostas visuais
  3. Solicitações para comparação de várias imagens
  4. Solicitações para OCR e análise de documentos
← Voltar para AI Prompt Engineering