0Pricing
AI Prompt Engineering · Aula

Lendo e avaliando resultados de IA

Critérios para avaliar a relevância, a precisão e a completude das respostas da IA.

Lendo e avaliando resultados de IA é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.

Por que a avaliação é importante

Obter uma resposta de IA é apenas metade do trabalho. A segunda metade é avaliar se essa resposta é realmente boa.

Sem uma estrutura de avaliação clara, você pode aceitar uma resposta que parece bem elaborada, mas responde à pergunta errada, ou rejeitar uma resposta realmente útil porque ela não está formatada da maneira esperada.

Desenvolver um olhar confiável para a qualidade das saídas de IA é uma das habilidades mais práticas da engenharia de instruções.

Os quatro critérios de avaliação

Ao ler uma resposta de IA, avalie-a em quatro dimensões:

  • Relevância — ela respondeu à pergunta que você realmente fez?
  • Exatidão — as informações estão factualmente corretas?
  • Completude — ela abordou todas as partes da solicitação?
  • Formato — está estruturada da maneira de que você precisa?

Uma resposta pode ter uma pontuação alta em três critérios e falhar no quarto. Cada critério é importante de forma independente.

Critério 1: Relevância

Relevância pergunta: o modelo respondeu à pergunta que você realmente fez ou respondeu a uma pergunta relacionada, mas diferente?

Exemplo: você pergunta "Quais são os riscos de usar LLMs na área da saúde?" e o modelo responde com uma visão geral de como os LLMs funcionam. Essa resposta pode estar correta, mas não é relevante — ela não entendeu o ponto principal.

Para verificar a relevância, releia sua instrução original e pergunte: a resposta aborda diretamente o que eu perguntei?

Critério 2: Exatidão

Exatidão pergunta: os fatos, números e afirmações da resposta estão corretos?

Os modelos de IA podem alucinar — podem afirmar com confiança coisas que estão simplesmente erradas. Problemas comuns de exatidão incluem:

  • Estatísticas ou datas incorretas
  • Citações atribuídas à pessoa errada
  • Informações desatualizadas apresentadas como atuais
  • Referências ou citações inventadas

Em assuntos factuais, sempre verifique as afirmações importantes com uma fonte confiável antes de usar o resultado.

Critério 3: Completude

Completude pergunta: a resposta abordou todas as partes da sua solicitação?

Se sua instrução tinha várias partes — "Explique X, liste três exemplos e sugira um próximo passo" — verifique se o modelo abordou as três, e não apenas a primeira.

Às vezes, os modelos deixam de fora a última parte de uma solicitação com várias partes, especialmente quando a instrução é longa. Comparar a resposta com sua instrução, ponto a ponto, é a maneira mais confiável de verificar a completude.

Critério 4: Formato

Formato pergunta: a resposta está estruturada da maneira de que você precisa?

Mesmo uma resposta perfeitamente exata e completa pode ser difícil de usar se o formato estiver errado. Incompatibilidades comuns de formato:

  • Texto corrido quando você precisava de uma lista com marcadores
  • Um ensaio longo quando você precisava de um resumo
  • Ausência de títulos que ajudariam na navegação
  • Código sem explicações ou explicações sem código

Os problemas de formato costumam ser os mais fáceis de corrigir com uma nova instrução.

Uma lista de verificação simples para avaliação

Depois de receber qualquer resposta de IA, percorra mentalmente esta lista de verificação:

  • Relevância: ela responde à minha pergunta real?
  • Exatidão: posso confiar nos fatos? O que eu precisaria verificar?
  • Completude: ela abordou todas as partes da minha solicitação?
  • Formato: está estruturada de uma maneira que posso usar?

Se algum critério falhar, isso indica exatamente que tipo de nova instrução você deve escrever. Cada critério aponta para um tipo específico de correção.

Avaliação em código: atribuindo uma pontuação a uma resposta

Você pode criar um mecanismo leve de avaliação em Python que atribui uma pontuação a uma resposta em cada critério usando uma segunda chamada a um LLM:

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

Falhas de relevância: padrões comuns

As falhas de relevância tendem a seguir padrões previsíveis. Reconhecê-los torna sua avaliação mais rápida:

  • Desvio de tópico — o modelo começa corretamente e depois passa para um tópico relacionado
  • Troca de pergunta — o modelo responde a uma versão mais simples ou fácil da sua pergunta
  • Generalização excessiva — você perguntou sobre um caso específico, mas o modelo responde sobre o caso geral
  • Ignorar a restrição — você especificou um contexto (por exemplo, "para iniciantes"), mas o modelo o ignorou

Cada padrão sugere uma correção específica para sua instrução de acompanhamento.

Sinais de alerta de exatidão aos quais prestar atenção

Mesmo quando você não consegue verificar imediatamente uma afirmação, certos sinais sugerem menor exatidão:

  • Números muito específicos citados sem uma fonte
  • Afirmações que parecem convenientes demais ou perfeitamente adequadas
  • Referências a estudos, artigos ou livros com título e autor
  • Datas e números de versão (eles mudam com frequência)
  • Detalhes jurídicos, médicos ou financeiros

Isso não prova que há um erro, mas são os itens que merecem uma segunda verificação antes de você usar o resultado em um contexto de alto risco.

Usando a avaliação para escrever melhores acompanhamentos

O verdadeiro valor da avaliação é que cada critério que falha corresponde diretamente a um tipo de instrução de acompanhamento:

  • Falha de relevância → "Você respondeu sobre X, mas eu estava perguntando sobre Y. Concentre-se em Y."
  • Problema de exatidão → "Verifique novamente a afirmação sobre Z e cite sua base."
  • Falha de completude → "Você não abordou a terceira parte da minha pergunta. Por favor, acrescente essa parte."
  • Falha de formato → "Reescreva isto como uma lista com marcadores e um resumo de uma linha no início."

A avaliação e a elaboração de instruções de acompanhamento funcionam como um ciclo de feedback.

Verificação de conhecimento: critérios de avaliação

Você pede ao modelo: "Liste as 5 principais estruturas de desenvolvimento web em Python com uma descrição de uma frase para cada uma." O modelo responde com um ensaio bem escrito sobre a história do Python e sua ascensão no desenvolvimento web, mencionando brevemente Flask e Django, mas sem listar 5 estruturas.

Em qual critério essa resposta falha de forma mais crítica?

Recapitulação: lendo e avaliando resultados de IA

Uma boa elaboração de instruções é um processo de duas etapas: criar a instrução e avaliar a resposta.

Os quatro critérios — Relevância, Exatidão, Completude e Formato — oferecem uma maneira sistemática de avaliar qualquer resultado de IA. Cada critério que falha indica exatamente que tipo de acompanhamento você deve escrever.

Na próxima lição, você praticará a escrita dessas instruções de acompanhamento para corrigir tipos específicos de falhas.

Perguntas Frequentes

A aula “Lendo e avaliando resultados de IA” é grátis?

Sim — o texto completo de “Lendo e avaliando resultados de IA” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.

O que vou aprender em “Lendo e avaliando resultados de IA”?

Critérios para avaliar a relevância, a precisão e a completude das respostas da IA. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Prompt Engineering?

Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Lendo e avaliando resultados de IA”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Prompt Engineering?

Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Lendo e avaliando resultados de IA
  2. Escrevendo solicitações eficazes de acompanhamento
  3. Desenvolvendo respostas anteriores
  4. Quando refinar ou começar de novo
← Voltar para AI Prompt Engineering