Avaliação de modelos ajustados em comparação com a base
Compare com o modelo base em seu conjunto de avaliação — às vezes o ajuste fino atrapalha mais do que ajuda.
Avaliação de modelos ajustados em comparação com a base é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Não confie na perda de treinamento
Uma perda de treinamento baixa não significa um desempenho melhor em produção. O modelo pode sofrer sobreajuste, perder capacidade geral ou prejudicar tarefas não observadas.
Sempre avalie o modelo ajustado em um conjunto de avaliação separado.
Três divisões indispensáveis para avaliação
- Treinamento — usado no ajuste fino
- Validação — usada para escolher o melhor ponto de verificação
- Teste — nunca visto durante o treinamento; usado ONLY para a avaliação final
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')Fique atento ao esquecimento catastrófico
Fazer ajuste fino com dados restritos pode piorar o modelo em OUTRAS tarefas. Teste também em um conjunto de avaliação amplo — não apenas na sua nova especialização.
Relatórios por categoria
Adicione etiquetas ao seu conjunto de avaliação; informe as pontuações por categoria:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)Calibração
Modelos ajustados frequentemente se tornam excessivamente confiantes. Compare a probabilidade prevista com a probabilidade real de correção — faça a calibração se necessário.
Variação de extensão e estilo
Modelos ajustados tendem a se aproximar da distribuição dos dados de treinamento. Se os dados de treinamento forem mais curtos, as saídas ficarão mais curtas. Às vezes isso é desejável; às vezes, não.
Teste A/B no mundo real
Além das avaliações offline, faça um teste A/B em produção:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)Compare qualidade e custo
O modelo ajustado pode ser menor e mais barato. Relação total entre custo e qualidade:
- GPT-4o-base: US$ X por chamada, qualidade Y
- Llama 8B ajustado (hospedado por você): US$ X/10 por chamada, qualidade 0,9Y
- Provavelmente será o vencedor se Y continuar alto o suficiente
Modos de falha ocultos
Experimente entradas adversariais:
- Prompts que tentam contornar as proteções
- Entradas fora da distribuição
- Prompts de casos extremos
Às vezes, ajustes finos enfraquecem a segurança; verifique antes de disponibilizar o modelo.
ressalva sobre LLM como avaliador
Se você usar um avaliador LLM, use uma família de modelos DIFFERENT daquela do seu modelo ajustado. Caso contrário, o avaliador atribuirá pontuações altas de forma tendenciosa.
Quando iterar o conjunto de dados
Se a avaliação mostrar regressão em categorias específicas:
- Encontre exemplos semelhantes nos rastros de produção
- Adicione-os ao conjunto de treinamento
- Treine novamente
- Faça uma nova avaliação
Reverter é OK
Se o ajuste tiver desempenho inferior, descarte-o e tente novamente. O custo irrecuperável não é motivo para disponibilizar um modelo pior.
Esquecimento catastrófico
O que é esquecimento catastrófico no ajuste fino?
Recapitulação
Avalie o modelo ajustado em comparação com o modelo-base usando seu conjunto de referência YOUR. Observe as regressões por categoria. Faça testes A/B em produção. Reverta se o modelo perder desempenho; itere o conjunto de dados se ele vencer apenas parcialmente.
Perguntas Frequentes
A aula “Avaliação de modelos ajustados em comparação com a base” é grátis?
Sim — o texto completo de “Avaliação de modelos ajustados em comparação com a base” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Avaliação de modelos ajustados em comparação com a base”?
Compare com o modelo base em seu conjunto de avaliação — às vezes o ajuste fino atrapalha mais do que ajuda. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Avaliação de modelos ajustados em comparação com a base”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Quando o ajuste fino supera a criação de instruções
- Coleta de dados: trajetórias e reprodução de rastros
- LoRA e QLoRA para ajuste eficiente em custos
- Avaliação de modelos ajustados em comparação com a base