Combinando texto e imagens
Solicitações multimodais unificadas.
Combinando texto e imagens é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.
Instrução multimodal unificada
Uma instrução multimodal não é texto mais uma imagem anexada. É uma sequência única intercalada, na qual tokens de imagem e tokens de texto ocupam o mesmo contexto e interagem entre si. O modelo não 'olha para a imagem e depois lê o texto' — ele processa um fluxo de tokens combinado.
- Os fragmentos da imagem são projetados no mesmo espaço de representações que os tokens de texto.
- A ordem é importante: uma pergunta colocada antes de uma imagem direciona a atenção de forma diferente de uma pergunta colocada depois.
- O senhor está criando uma única instrução com duas formas de apresentação, não duas instruções.
Ordem de intercalação e ancoragem
O local onde a imagem é colocada em relação à instrução altera o comportamento. Colocar a instrução depois da imagem permite que o modelo condicione a pergunta ao que já codificou; colocá-la antes transforma a imagem em evidência para uma tarefa declarada previamente.
Em instruções com várias imagens, identifique cada imagem na própria sequência para que o texto posterior possa fazer referência a ela sem ambiguidade ([Image 1], [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]Enquadramento da tarefa antes da codificação
Os codificadores de visão têm perdas: detalhes que não são relevantes para a tarefa implícita podem ser descartados durante a agregação. Se você declarar a tarefa antes da imagem, direcionará o modelo a prestar atenção às regiões importantes.
- Solicitações genéricas de legendas produzem características genéricas.
- Uma pergunta específica ('conte os resistores na placa') concentra o orçamento representacional nas sub-regiões relevantes.
Antecipe a especificidade quando forem necessários detalhes minuciosos.
Orçamentos de resolução e divisão em blocos
A maioria dos modelos de visão divide imagens de alta resolução em blocos de tamanho fixo, cada um consumindo tokens. Uma imagem de 2000x2000 pode ser dividida em muitos blocos, cada um com resolução reduzida. O orçamento de tokens é a restrição silenciosa das instruções multimodais.
- Faça crop na região de interesse antes de enviar — não conte com o modelo para ampliar a imagem.
- Para documentos densos, envie recortes de páginas em vez de uma única imagem da página inteira.
- Saiba qual é o número máximo de blocos do seu provedor; além desse limite, o texto pequeno se torna ilegível.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailTexto como esquema estruturado para visão
Combine a imagem com um esquema explícito de saída no canal de texto. A imagem fornece o conteúdo; o texto fornece o contrato. Isso é muito mais confiável do que uma descrição livre.
Peça JSON com chaves correspondentes às entidades que você espera encontrar e instrua o modelo a emitir null para campos não visíveis — isso suprime detalhes alucinados.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)Desambiguando com dêixis
Referências dêiticas ('esta', 'a da esquerda', 'a caixa destacada') vinculam o texto às regiões da imagem. Quando for possível anotar previamente a imagem (desenhar uma caixa, adicionar uma seta), a referência textual se torna muito mais robusta do que usar apenas linguagem espacial.
- Palavras espaciais ('canto superior direito') são propensas a erros quando há rotação ou recorte.
- Um marcador numerado sobreposto, junto de 'objeto nº 3', não deixa margem para ambiguidade.
- Pré-processar a imagem para adicionar marcadores é uma técnica legítima de engenharia de instruções.
Poucos exemplos com modalidades mistas
Você pode fornecer exemplos de imagem para texto para fixar o formato e o estilo de raciocínio. Cada exemplo é um par intercalado (imagem, resposta ideal). O modelo infere a relação a partir das demonstrações.
Mantenha as imagens de exemplo representativas da distribuição real — um exemplo de um domínio diferente ensina a seleção inadequada de características.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]Fundamentação de afirmações nos pixels
Para extrações de alto risco, exija que o modelo cite onde na imagem cada afirmação se origina. Caixas delimitadoras aproximadas ou texto citado da imagem funcionam como evidência verificável e reduzem drasticamente a fabricação confiante.
- 'Para cada valor, cite exatamente o texto do rótulo que você leu.'
- 'Forneça uma caixa normalizada aproximada [x0,y0,x1,y1] para cada campo.'
A fundamentação transforma uma resposta opaca em uma resposta auditável.
Modos de falha a evitar
Os modelos multimodais falham de maneiras características:
- Desvio do OCR em fontes pequenas ou estilizadas — dígitos como 1/7 e 0/O são confundidos.
- Colapso da contagem além de aproximadamente 6 objetos semelhantes.
- Viés de legenda: descrever a cena típica em vez da cena real.
- Sobrescrita pelo canal de texto: uma afirmação textual errada e confiante pode suprimir evidências visuais corretas.
Mitigue isso pedindo ao modelo que extraia primeiro da imagem e só depois reconcilie o resultado com quaisquer afirmações textuais.
Instruções de reconciliação
Quando o contexto textual e a imagem entrarem em conflito, você deverá decidir explicitamente qual tem precedência — não há uma política padrão do modelo em que se possa confiar. Declare-a: 'Se a imagem contradisser os metadados fornecidos, confie na imagem e sinalize a discrepância.'
Essa única frase converte um erro silencioso em um conflito explícito e exposto, que seu fluxo de processamento posterior pode encaminhar para análise.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)Projetando um fluxo de processamento de fusão
Criar instruções multimodais para produção é um fluxo de processamento, não uma única chamada:
- Pré-processe: faça crop, anote e reduza a resolução para caber no orçamento.
- Combine: intercale com uma instrução que priorize a tarefa e com um esquema de saída.
- Fundamente: exija evidências para cada afirmação.
- Reconcilie: declare a precedência entre as modalidades.
- Valide: analise o JSON e verifique valores nulos e sinalizadores de conflito.
Cada etapa reduz a superfície de falhas que apenas as instruções não conseguem eliminar.
Verificação rápida
Você precisa extrair o texto pequeno de um contrato digitalizado em alta resolução e necessita de números confiáveis.
Recapitulação: combinando texto e imagens
Uma instrução multimodal unificada é um único fluxo de tokens intercalados. Principais técnicas: enquadramento que prioriza a tarefa para direcionar o codificador de visão, consciência da resolução e da divisão em blocos por meio de recortes, esquemas de saída explícitos com campos que aceitam valores nulos, fundamentação nos pixels para cada afirmação e precedência declarada entre modalidades em caso de conflitos. Trate tudo como um fluxo de processamento — pré-processar, combinar, fundamentar, reconciliar, validar — e as partes frágeis das instruções de visão se tornarão controláveis.
Perguntas Frequentes
A aula “Combinando texto e imagens” é grátis?
Sim — o texto completo de “Combinando texto e imagens” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que vou aprender em “Combinando texto e imagens”?
Solicitações multimodais unificadas. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Combinando texto e imagens”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Combinando texto e imagens
- Fundamentação entre modalidades
- Áudio, texto e visão em conjunto
- Controle de saídas multimodais