Controle de saídas multimodais
Dê forma a respostas em mídias combinadas.
Controle de saídas multimodais é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.
Controlando a saída de mídia mista
O controle da saída é a disciplina de moldar qual forma a resposta assume quando ela abrange texto, dados estruturados e referências a mídia gerada ou selecionada. O modelo adotará como padrão a prosa; sistemas de produção precisam de artefatos analisáveis, renderizáveis e componíveis.
- Você está especificando um contrato de renderização, não apenas fazendo uma pergunta.
- A confiabilidade do formato é mais importante que sua riqueza — estruturas previsíveis são melhores.
Separe o conteúdo da apresentação
Faça o modelo emitir conteúdo estruturado e renderize a mídia do seu lado. Pedir a um modelo de texto que emita bytes brutos de imagem ou layouts carregados de marcação é frágil; pedir uma descrição tipada que seu renderizador transforme em mídia é robusto.
O modelo decide o quê; seu fluxo de processamento decide como isso será exibido.
block = {
'type': 'figure',
'caption': 'Quarterly revenue',
'chart': {'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10, 14]},
'alt_text': 'Bar chart rising from 10 to 14.'
}Esquemas de resposta com blocos tipados
Modele respostas ricas como uma lista ordenada de blocos tipados: text, code, image_ref, table, chart_spec. Cada bloco contém apenas os campos necessários ao seu tipo. Seu renderizador percorre a lista e emite o componente adequado para cada tipo.
É assim que interfaces de bate-papo, relatórios e geradores de apresentações permanecem confiáveis em milhares de respostas.
schema = {
'blocks': [
{'type': 'text', 'value': '...'},
{'type': 'code', 'lang': 'python', 'value': '...'},
{'type': 'image_ref', 'id': 'fig1', 'alt': '...'},
{'type': 'table', 'columns': [...], 'rows': [...]}
]
}Referenciar em vez de incorporar mídia
Prefira referências a incorporações. O modelo emite um identificador ou uma especificação de geração; seu sistema o resolve para um recurso real. Isso desacopla a etapa linguística da etapa de mídia e permite armazenar recursos para reutilização, gerá-los novamente ou trocá-los sem fazer nova solicitação.
- Incorporação: a resposta carrega o recurso diretamente (pesado, frágil).
- Referência: a resposta carrega um ponteiro ou uma receita (leve, componível).
image_block = {
'type': 'image_ref',
'spec': {'prompt': 'minimal line icon of a gear', 'size': '512x512'},
'alt': 'Settings gear icon'
}
# Pipeline calls the image model with spec, fills in the URL.Restringindo especificações de geração
Quando o modelo escrever uma especificação para um gerador posterior (imagem, gráfico, TTS), restrinja-a rigorosamente. Especificações abertas se desviam; opções enumeradas permanecem alinhadas à identidade e ao orçamento.
Forneça ao modelo um vocabulário controlado: tipos de gráficos permitidos, estilos de imagem permitidos, vozes permitidas — e proíba desvios de formato livre.
chart_spec = {
'kind': 'one of [bar, line, scatter]', # enumerated
'palette': 'brand_default', # not a hex free-for-all
'max_series': 4
}Campos obrigatórios de acessibilidade
Cada bloco de mídia deve conter um texto alternativo ou campo de transcrição, e você deve torná-lo obrigatório no esquema. Isso é tanto um requisito de acessibilidade quanto um recurso de verificação — o texto alternativo revela o que o modelo pretendia transmitir com a mídia, e você pode conferir isso na especificação.
Ordem de intercalação e intenção de disposição
A ordem dos blocos é a disposição. Se o modelo retornar um gráfico antes do parágrafo que o explica, o documento renderizado ficará errado. Declare a intenção de disposição: 'o texto explicativo precede a figura que descreve; uma figura é sempre seguida por uma conclusão de uma linha.'
Codifique regras de ordem de leitura para que a lista de blocos seja renderizada como uma narrativa coerente.
Orçamentos de comprimento e densidade por bloco
Controle a verbosidade no nível do bloco, não globalmente. Uma legenda ocupa uma linha; a introdução de uma seção é um parágrafo curto; uma tabela é limitada a N linhas. Os orçamentos por bloco impedem que o modelo infle um componente enquanto deixa outro sem conteúdo.
- 'Legendas: no máximo 12 palavras.'
- 'Tabelas: no máximo 8 linhas; resuma o restante em uma linha final.'
limits = {'caption_words': 12, 'table_rows': 8, 'intro_sentences': 3}Ciclos de validação e reparo
A qualidade de um esquema de mídia mista não pode superar a do seu validador. Analise a lista de blocos, use validate em cada bloco segundo o esquema do seu tipo e, em caso de falha, envie uma solicitação de reparo direcionada que nomeie a violação exata.
Reparar é melhor que gerar novamente: pedir toda a resposta outra vez desperdiça tokens e pode quebrar as partes corretas.
def validate(blocks):
for b in blocks:
if b['type'] == 'image_ref' and 'alt' not in b:
return f'Block {b} missing required alt text'
return None # okTransmissão contínua de mídia mista
Ao transmitir em fluxo, os blocos devem ser analisáveis individualmente para que a interface possa renderizar cada um assim que for concluído, em vez de esperar a resposta inteira. Emita um objeto JSON bem-formado por bloco (delimitado por quebras de linha), em vez de uma única lista enorme que só é válida após o colchete final.
A transmissão bloco a bloco oferece interfaces responsivas e validação antecipada.
{'type': 'text', 'value': 'Revenue grew this quarter.'}
{'type': 'chart_spec', 'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10,14], 'alt': '...'}
{'type': 'text', 'value': 'The bulk came from new accounts.'}Um contrato de controle da saída
Um contrato completo de mídia mista especifica: o vocabulário de blocos tipados, referências em vez de incorporações, especificações de geração enumeradas, texto alternativo/transcrição obrigatórios, regras de ordem de leitura, orçamentos por bloco e uma serialização adequada à transmissão em fluxo. Agrupe-o como um bloco de sistema reutilizável, e seu renderizador se tornará um destino estável para muitas tarefas.
Verificação rápida
Você está criando um gerador de relatórios cujas respostas combinam parágrafos, tabelas e figuras, renderizados pela sua própria interface.
Recapitulação: moldando respostas de mídia mista
Trate a saída rica como um contrato de renderização: um vocabulário de blocos tipados, mídia como referências ou especificações de geração restritas, em vez de incorporações, campos obrigatórios de texto alternativo/transcrição, regras explícitas de ordem de leitura e orçamentos por bloco, além de uma serialização adequada à transmissão em fluxo, com validação e reparo. Separe o que o modelo decide de como seu fluxo de processamento renderiza isso, e as respostas de mídia mista se tornarão previsíveis, auditáveis e fáceis de compor.
Perguntas Frequentes
A aula “Controle de saídas multimodais” é grátis?
Sim — o texto completo de “Controle de saídas multimodais” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que vou aprender em “Controle de saídas multimodais”?
Dê forma a respostas em mídias combinadas. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Controle de saídas multimodais”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Combinando texto e imagens
- Fundamentação entre modalidades
- Áudio, texto e visão em conjunto
- Controle de saídas multimodais