Evaluación de modelos ajustados frente al modelo base
Compare mediante pruebas A/B con el modelo base en su conjunto de evaluación: a veces el ajuste fino perjudica más de lo que ayuda.
Evaluación de modelos ajustados frente al modelo base es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
No confíe en la pérdida de entrenamiento
Una pérdida de entrenamiento baja no implica un mejor rendimiento en producción. El modelo puede sobreajustarse, perder capacidades generales o perjudicar tareas que no haya visto.
Evalúe siempre el modelo ajustado con un conjunto de evaluación reservado.
Tres divisiones de evaluación imprescindibles
- Entrenamiento — se usa durante el ajuste fino
- Validación — se usa para elegir el mejor checkpoint
- Prueba — nunca se ve durante el entrenamiento; SOLO se usa para la evaluación final
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')Atención al olvido catastrófico
Aplicar ajuste fino con datos muy específicos puede empeorar el rendimiento del modelo en OTRAS tareas. Pruébelo también con un conjunto de evaluación amplio, no solo con su nueva especialización.
Informes por categoría
Etiquete su conjunto de evaluación e informe de las puntuaciones por categoría:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)Calibración
Los modelos ajustados suelen mostrar un exceso de confianza. Compare la probabilidad predicha de acierto con la probabilidad real y calibre el modelo si es necesario.
Deriva de longitud y estilo
Los modelos ajustados se desplazan hacia la distribución de entrenamiento. Si los datos de entrenamiento son más cortos, las salidas también se acortan. A veces es conveniente y a veces no.
Prueba A/B en el mundo real
Además de las evaluaciones fuera de línea, realice pruebas A/B en producción:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)Comparación de calidad y costes
El modelo ajustado puede ser más pequeño y barato. Coste y calidad totales:
- GPT-4o base: X $ por llamada, calidad Y
- Llama 8B ajustado (autoalojado): X/10 $ por llamada, calidad 0.9Y
- Probablemente sea el ganador si Y se mantiene lo bastante alta
Modos de fallo ocultos
Pruebe entradas adversarias:
- Prompts que intenten eludir las barreras de seguridad
- Entradas fuera de distribución
- Prompts para casos límite
A veces los ajustes finos debilitan la seguridad; verifíquelo antes de poner el modelo en producción.
Advertencia sobre los jueces basados en LLM
Si utiliza un LLM como juez, use una familia de modelos DIFERENTE de la del modelo ajustado. De lo contrario, el juez otorgará puntuaciones altas de forma sesgada.
Cuándo iterar el conjunto de datos
Si la evaluación muestra regresiones en categorías concretas:
- Busque ejemplos similares en las trazas de producción
- Añádalos al conjunto de entrenamiento
- Vuelva a entrenar
- Vuelva a evaluar
Está bien revertir
Si el ajuste tiene un rendimiento inferior, descártelo e inténtelo de nuevo. El coste hundido no es una razón para poner en producción un modelo peor.
Olvido catastrófico
¿Qué es el olvido catastrófico en el ajuste fino?
Resumen
Evalúe el modelo ajustado frente al modelo base en SU conjunto de referencia. Vigile las regresiones por categoría. Realice pruebas A/B en producción. Revierta los cambios si el modelo pierde rendimiento; itere el conjunto de datos si solo mejora en parte.
Preguntas frecuentes
¿La lección «Evaluación de modelos ajustados frente al modelo base» es gratis?
Sí — el texto completo de «Evaluación de modelos ajustados frente al modelo base» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Evaluación de modelos ajustados frente al modelo base»?
Compare mediante pruebas A/B con el modelo base en su conjunto de evaluación: a veces el ajuste fino perjudica más de lo que ayuda. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Evaluación de modelos ajustados frente al modelo base»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Cuándo el ajuste fino supera al prompting
- Recopilación de datos: trayectorias y reproducción de trazas
- LoRA y QLoRA para un ajuste eficiente en costes
- Evaluación de modelos ajustados frente al modelo base