0Pricing
AI Prompt Engineering · Aula

Fundamentação entre modalidades

Faça referência a evidências visuais no texto.

Fundamentação entre modalidades é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.

O que significa fundamentação

Fundamentação é o requisito de que toda afirmação textual possa ser rastreada até uma evidência específica em outra modalidade. Uma resposta multimodal sem fundamentação é um palpite fluente; uma resposta fundamentada é uma afirmação defensável, com uma referência aos pixels (ou ao quadro de áudio) que a justificam.

  • A fundamentação transforma uma saída opaca em uma saída auditável.
  • É o recurso isolado mais eficaz contra alucinações visuais confiantes.

Ordem de raciocínio que prioriza evidências

Force o modelo a extrair evidências antes de chegar a uma conclusão. Se a conclusão for gerada primeiro, a 'evidência' se tornará uma racionalização posterior que combina com a resposta, possivelmente errada.

Estruture a resposta para que as regiões observadas apareçam primeiro, a interpretação venha em segundo lugar e a resposta final fique por último.

schema = {
  'observations': '[{region: str, text_read: str}]',
  'inference': 'str — reasoning over observations only',
  'answer': 'str'
}
# Order in the prompt enforces order in generation.

Citações de caixas delimitadoras e regiões

Peça ao modelo que emita coordenadas normalizadas aproximadas para cada afirmação visual. Mesmo caixas imperfeitas são valiosas: um sistema posterior pode recortar novamente e verificar, e uma caixa completamente errada revela imediatamente uma alucinação.

  • Use [x0,y0,x1,y1] normalizadas no intervalo de 0..1 para que a resolução seja irrelevante.
  • Trate as caixas como dicas de localização, não como detecção com precisão de pixels.
instruction = (
  'For each extracted field, return '
  '{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
  'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)

Verificação citando os pixels

Para qualquer texto visível na imagem, exija uma citação literal do que o modelo leu. Uma citação literal pode ser verificada: você pode conferir pontualmente com OCR, e o modelo terá muito menos probabilidade de inventar um valor que também precise transcrever exatamente.

Essa restrição de 'ler de volta' é barata e desproporcionalmente eficaz para documentos, gráficos e sinalização.

Verificações de consistência entre modalidades

Quando o mesmo fato aparecer em duas modalidades (uma imagem de apresentação e sua narração falada), peça ao modelo que faça uma verificação cruzada. A concordância aumenta a confiança; a discordância é, por si só, um sinal que vale a pena expor.

  • 'A legenda da figura corresponde ao que o gráfico mostra?'
  • 'A narração está de acordo com o número exibido na tela?'
prompt = (
  'You have a slide image and its transcript. '
  'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
  'Flag any disagreement explicitly.'
)

Recusa como resultado da fundamentação

Um sistema fundamentado deve ter permissão para dizer 'não visível'. Sem uma saída explícita, o modelo preenche as lacunas com uma fabricação plausível. Ofereça essa opção e recompense seu uso.

Instrua-o: 'Se a evidência não existir ou estiver ilegível, retorne NOT_FOUND em vez de adivinhar.' Em seguida, trate NÃO_ENCONTRADO como uma saída de primeira classe, sem penalização, no seu fluxo de processamento.

Fundamentando relações espaciais

Afirmações relacionais ('a válvula está à esquerda do manômetro') são mais difíceis de fundamentar do que a presença de um objeto. Peça ao modelo que fundamente ambos os referentes de forma independente, usando caixas, e depois derive a relação a partir das coordenadas em vez de afirmá-la diretamente.

Essa decomposição transforma um julgamento relacional frágil em duas tarefas mais simples de localização, seguidas de aritmética.

# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
    return a['box'][2] < b['box'][0]

Fundamentação de áudio e temporal

A fundamentação se generaliza para além das imagens. Para áudio ou vídeo, exija marcas de tempo como evidência: 'cite o [mm:ss] em que isso foi dito.' Referências temporais permitem conferir a afirmação no segmento de origem.

  • As marcas de tempo ancoram afirmações de transcrição e diarização.
  • Elas expõem resumos que se afastam do que foi realmente dito.

A armadilha da sobrescrita pelo texto

Uma afirmação confiante no canal de texto pode suprimir evidências visuais corretas — o modelo se submete à informação prévia que você forneceu. Se o seu contexto disser 'o total da fatura é $400' e a imagem mostrar $450, um modelo sem fundamentação poderá repetir $400.

Defesa: instrua o modelo a extrair primeiro apenas da imagem, depois comparar com o texto fornecido e sinalizar divergências em vez de reconciliá-las silenciosamente.

Verificando a fundamentação no processamento posterior

A fundamentação só é útil se você agir com base nela. Crie um verificador que consuma as evidências estruturadas:

  • Faça crop novamente em cada caixa e aplique OCR novamente ao texto citado; se houver divergência -> rejeite.
  • Reproduza a marca de tempo citada usando uma segunda passagem de ASR.
  • Trate NÃO_ENCONTRADO e os sinalizadores de conflito como sinais para encaminhamento à análise humana.

A instrução produz evidências; seu sistema as impõe.

def verify(field):
    crop = image.crop(field['box'])
    read = ocr(crop)
    return similar(read, field['value']) > 0.9

Modelo de contrato de fundamentação

Um contrato de fundamentação reutilizável reúne todas as técnicas:

  • Observações antes das conclusões.
  • Caixa + citação literal para cada afirmação.
  • Saída NÃO_ENCONTRADO, sem nunca adivinhar.
  • Derivação priorizando a imagem; depois, reconciliação com o texto fornecido e sinalização de conflitos.
  • Marcas de tempo para qualquer afirmação sobre áudio ou vídeo.

Codifique-o uma vez e reutilize-o em todas as tarefas multimodais.

Verificação rápida

Os metadados do seu contexto afirmam que o total do pedido é $400, mas você suspeita que a imagem digitalizada possa mostrar um valor diferente.

Recapitulação: fundamentação entre modalidades

A fundamentação torna a saída multimodal auditável: observações antes das conclusões, caixas e citações literais para cada afirmação, marcas de tempo para áudio e vídeo, uma saída NÃO_ENCONTRADO e derivação priorizando a imagem, com sinalização de conflitos em relação ao texto fornecido. Combine o contrato de fundamentação com um verificador posterior que faça novos recortes, novas leituras e encaminhe os sinalizadores para análise. Evidências na instrução, aplicação no sistema — juntas, elas neutralizam alucinações confiantes.

Perguntas Frequentes

A aula “Fundamentação entre modalidades” é grátis?

Sim — o texto completo de “Fundamentação entre modalidades” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.

O que vou aprender em “Fundamentação entre modalidades”?

Faça referência a evidências visuais no texto. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Prompt Engineering?

Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Fundamentação entre modalidades”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Prompt Engineering?

Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Combinando texto e imagens
  2. Fundamentação entre modalidades
  3. Áudio, texto e visão em conjunto
  4. Controle de saídas multimodais
← Voltar para AI Prompt Engineering