0Pricing
AI Agents · Aula

Avaliação de modelos ajustados em comparação com a base

Compare com o modelo base em seu conjunto de avaliação — às vezes o ajuste fino atrapalha mais do que ajuda.

Avaliação de modelos ajustados em comparação com a base é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Não confie na perda de treinamento

Uma perda de treinamento baixa não significa um desempenho melhor em produção. O modelo pode sofrer sobreajuste, perder capacidade geral ou prejudicar tarefas não observadas.

Sempre avalie o modelo ajustado em um conjunto de avaliação separado.

Três divisões indispensáveis para avaliação

  1. Treinamento — usado no ajuste fino
  2. Validação — usada para escolher o melhor ponto de verificação
  3. Teste — nunca visto durante o treinamento; usado ONLY para a avaliação final

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Fique atento ao esquecimento catastrófico

Fazer ajuste fino com dados restritos pode piorar o modelo em OUTRAS tarefas. Teste também em um conjunto de avaliação amplo — não apenas na sua nova especialização.

Relatórios por categoria

Adicione etiquetas ao seu conjunto de avaliação; informe as pontuações por categoria:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Calibração

Modelos ajustados frequentemente se tornam excessivamente confiantes. Compare a probabilidade prevista com a probabilidade real de correção — faça a calibração se necessário.

Variação de extensão e estilo

Modelos ajustados tendem a se aproximar da distribuição dos dados de treinamento. Se os dados de treinamento forem mais curtos, as saídas ficarão mais curtas. Às vezes isso é desejável; às vezes, não.

Teste A/B no mundo real

Além das avaliações offline, faça um teste A/B em produção:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Compare qualidade e custo

O modelo ajustado pode ser menor e mais barato. Relação total entre custo e qualidade:

  • GPT-4o-base: US$ X por chamada, qualidade Y
  • Llama 8B ajustado (hospedado por você): US$ X/10 por chamada, qualidade 0,9Y
  • Provavelmente será o vencedor se Y continuar alto o suficiente

Modos de falha ocultos

Experimente entradas adversariais:

  • Prompts que tentam contornar as proteções
  • Entradas fora da distribuição
  • Prompts de casos extremos

Às vezes, ajustes finos enfraquecem a segurança; verifique antes de disponibilizar o modelo.

ressalva sobre LLM como avaliador

Se você usar um avaliador LLM, use uma família de modelos DIFFERENT daquela do seu modelo ajustado. Caso contrário, o avaliador atribuirá pontuações altas de forma tendenciosa.

Quando iterar o conjunto de dados

Se a avaliação mostrar regressão em categorias específicas:

  1. Encontre exemplos semelhantes nos rastros de produção
  2. Adicione-os ao conjunto de treinamento
  3. Treine novamente
  4. Faça uma nova avaliação

Reverter é OK

Se o ajuste tiver desempenho inferior, descarte-o e tente novamente. O custo irrecuperável não é motivo para disponibilizar um modelo pior.

Esquecimento catastrófico

O que é esquecimento catastrófico no ajuste fino?

Recapitulação

Avalie o modelo ajustado em comparação com o modelo-base usando seu conjunto de referência YOUR. Observe as regressões por categoria. Faça testes A/B em produção. Reverta se o modelo perder desempenho; itere o conjunto de dados se ele vencer apenas parcialmente.

Perguntas Frequentes

A aula “Avaliação de modelos ajustados em comparação com a base” é grátis?

Sim — o texto completo de “Avaliação de modelos ajustados em comparação com a base” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Avaliação de modelos ajustados em comparação com a base”?

Compare com o modelo base em seu conjunto de avaliação — às vezes o ajuste fino atrapalha mais do que ajuda. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Avaliação de modelos ajustados em comparação com a base”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Quando o ajuste fino supera a criação de instruções
  2. Coleta de dados: trajetórias e reprodução de rastros
  3. LoRA e QLoRA para ajuste eficiente em custos
  4. Avaliação de modelos ajustados em comparação com a base
← Voltar para AI Agents