Fundamentação entre modalidades
Faça referência a evidências visuais no texto.
Fundamentação entre modalidades é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que significa fundamentação
Fundamentação é o requisito de que toda afirmação textual possa ser rastreada até uma evidência específica em outra modalidade. Uma resposta multimodal sem fundamentação é um palpite fluente; uma resposta fundamentada é uma afirmação defensável, com uma referência aos pixels (ou ao quadro de áudio) que a justificam.
- A fundamentação transforma uma saída opaca em uma saída auditável.
- É o recurso isolado mais eficaz contra alucinações visuais confiantes.
Ordem de raciocínio que prioriza evidências
Force o modelo a extrair evidências antes de chegar a uma conclusão. Se a conclusão for gerada primeiro, a 'evidência' se tornará uma racionalização posterior que combina com a resposta, possivelmente errada.
Estruture a resposta para que as regiões observadas apareçam primeiro, a interpretação venha em segundo lugar e a resposta final fique por último.
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.Citações de caixas delimitadoras e regiões
Peça ao modelo que emita coordenadas normalizadas aproximadas para cada afirmação visual. Mesmo caixas imperfeitas são valiosas: um sistema posterior pode recortar novamente e verificar, e uma caixa completamente errada revela imediatamente uma alucinação.
- Use [x0,y0,x1,y1] normalizadas no intervalo de 0..1 para que a resolução seja irrelevante.
- Trate as caixas como dicas de localização, não como detecção com precisão de pixels.
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)Verificação citando os pixels
Para qualquer texto visível na imagem, exija uma citação literal do que o modelo leu. Uma citação literal pode ser verificada: você pode conferir pontualmente com OCR, e o modelo terá muito menos probabilidade de inventar um valor que também precise transcrever exatamente.
Essa restrição de 'ler de volta' é barata e desproporcionalmente eficaz para documentos, gráficos e sinalização.
Verificações de consistência entre modalidades
Quando o mesmo fato aparecer em duas modalidades (uma imagem de apresentação e sua narração falada), peça ao modelo que faça uma verificação cruzada. A concordância aumenta a confiança; a discordância é, por si só, um sinal que vale a pena expor.
- 'A legenda da figura corresponde ao que o gráfico mostra?'
- 'A narração está de acordo com o número exibido na tela?'
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)Recusa como resultado da fundamentação
Um sistema fundamentado deve ter permissão para dizer 'não visível'. Sem uma saída explícita, o modelo preenche as lacunas com uma fabricação plausível. Ofereça essa opção e recompense seu uso.
Instrua-o: 'Se a evidência não existir ou estiver ilegível, retorne NOT_FOUND em vez de adivinhar.' Em seguida, trate NÃO_ENCONTRADO como uma saída de primeira classe, sem penalização, no seu fluxo de processamento.
Fundamentando relações espaciais
Afirmações relacionais ('a válvula está à esquerda do manômetro') são mais difíceis de fundamentar do que a presença de um objeto. Peça ao modelo que fundamente ambos os referentes de forma independente, usando caixas, e depois derive a relação a partir das coordenadas em vez de afirmá-la diretamente.
Essa decomposição transforma um julgamento relacional frágil em duas tarefas mais simples de localização, seguidas de aritmética.
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]Fundamentação de áudio e temporal
A fundamentação se generaliza para além das imagens. Para áudio ou vídeo, exija marcas de tempo como evidência: 'cite o [mm:ss] em que isso foi dito.' Referências temporais permitem conferir a afirmação no segmento de origem.
- As marcas de tempo ancoram afirmações de transcrição e diarização.
- Elas expõem resumos que se afastam do que foi realmente dito.
A armadilha da sobrescrita pelo texto
Uma afirmação confiante no canal de texto pode suprimir evidências visuais corretas — o modelo se submete à informação prévia que você forneceu. Se o seu contexto disser 'o total da fatura é $400' e a imagem mostrar $450, um modelo sem fundamentação poderá repetir $400.
Defesa: instrua o modelo a extrair primeiro apenas da imagem, depois comparar com o texto fornecido e sinalizar divergências em vez de reconciliá-las silenciosamente.
Verificando a fundamentação no processamento posterior
A fundamentação só é útil se você agir com base nela. Crie um verificador que consuma as evidências estruturadas:
- Faça crop novamente em cada caixa e aplique OCR novamente ao texto citado; se houver divergência -> rejeite.
- Reproduza a marca de tempo citada usando uma segunda passagem de ASR.
- Trate NÃO_ENCONTRADO e os sinalizadores de conflito como sinais para encaminhamento à análise humana.
A instrução produz evidências; seu sistema as impõe.
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9Modelo de contrato de fundamentação
Um contrato de fundamentação reutilizável reúne todas as técnicas:
- Observações antes das conclusões.
- Caixa + citação literal para cada afirmação.
- Saída NÃO_ENCONTRADO, sem nunca adivinhar.
- Derivação priorizando a imagem; depois, reconciliação com o texto fornecido e sinalização de conflitos.
- Marcas de tempo para qualquer afirmação sobre áudio ou vídeo.
Codifique-o uma vez e reutilize-o em todas as tarefas multimodais.
Verificação rápida
Os metadados do seu contexto afirmam que o total do pedido é $400, mas você suspeita que a imagem digitalizada possa mostrar um valor diferente.
Recapitulação: fundamentação entre modalidades
A fundamentação torna a saída multimodal auditável: observações antes das conclusões, caixas e citações literais para cada afirmação, marcas de tempo para áudio e vídeo, uma saída NÃO_ENCONTRADO e derivação priorizando a imagem, com sinalização de conflitos em relação ao texto fornecido. Combine o contrato de fundamentação com um verificador posterior que faça novos recortes, novas leituras e encaminhe os sinalizadores para análise. Evidências na instrução, aplicação no sistema — juntas, elas neutralizam alucinações confiantes.
Perguntas Frequentes
A aula “Fundamentação entre modalidades” é grátis?
Sim — o texto completo de “Fundamentação entre modalidades” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que vou aprender em “Fundamentação entre modalidades”?
Faça referência a evidências visuais no texto. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Fundamentação entre modalidades”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Combinando texto e imagens
- Fundamentação entre modalidades
- Áudio, texto e visão em conjunto
- Controle de saídas multimodais