0Pricing
AI Prompt Engineering · Lección

Cuándo aplicar fine-tuning

Identifique las señales de que el prompting ha alcanzado sus límites.

Cuándo aplicar fine-tuning es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

El fine-tuning es una decisión basada en evidencia

El fine-tuning solo está justificado cuando puede señalar datos que demuestren que el prompting ha llegado a un límite. El desencadenante nunca es una intuición: es una evaluación con datos reservados en la que el mejor prompt elaborado de forma rigurosa se estanca por debajo del nivel de calidad requerido a pesar de haber recorrido la escalera de optimización.

  • El fine-tuning intercambia flexibilidad por consistencia, menor coste por llamada y comportamiento aprendido
  • El coste incluye un pipeline de datos, infraestructura de evaluación y nuevos ajustes cuando cambia el modelo base
  • Debe poder identificar el fallo específico que el prompting no pudo corregir

Señal 1: el estancamiento del prompt

La señal más clara es un estancamiento en un conjunto de evaluación congelado. Añade ejemplos, descompone la tarea y agrega verificadores, pero la puntuación deja de mejorar mientras los errores siguen siendo sistemáticos y no aleatorios.

Los errores residuales sistemáticos (el modelo gestiona mal de forma constante el mismo tipo de estructura) indican que el comportamiento es difícil de obtener mediante instrucciones. Es un problema propio del fine-tuning. Los errores aleatorios y dispersos suelen indicar que el prompt o los datos aún contienen ruido; siga iterando en su lugar.

# Track eval score vs prompt-iteration; flat tail = plateau
scores = [0.62, 0.71, 0.78, 0.79, 0.795, 0.796]  # diminishing returns
def plateaued(scores, window=3, eps=0.01):
    tail = scores[-window:]
    return (max(tail) - min(tail)) < eps

print(plateaued(scores))  # True -> prompting has stalled

Señal 2: la longitud del prompt se convierte en el producto

Cuando el prompt ha crecido hasta alcanzar miles de tokens de ejemplos y reglas solo para mantener la calidad, está asumiendo un coste de latencia y dinero en cada llamada para simular un comportamiento aprendido.

Si esos tokens codifican un comportamiento estable y repetitivo (un formato fijo, un estilo coherente o una decisión de enrutamiento), el fine-tuning puede integrarlo en los pesos: el prompt se reduce en un orden de magnitud y se conserva el comportamiento. Esta destilación del prompt es el caso de uso legítimo más habitual del fine-tuning.

Señal 3: umbral estricto de latencia o coste

Si necesita que un modelo más pequeño, rápido y barato reproduzca el comportamiento de un modelo más grande en una tarea acotada, el fine-tuning es la herramienta adecuada. Destila las salidas del modelo grande en un modelo pequeño ajustado.

Esto está justificado cuando el volumen supera el punto de equilibrio, el presupuesto de latencia es ajustado y la tarea está lo bastante acotada como para que un modelo pequeño pueda dominarla. Fuera de esas condiciones, la sobrecarga de ingeniería no compensa.

# Distillation data: teacher (big model) labels -> student (small) trains
def make_distill_pair(prompt, teacher_fn):
    completion = teacher_fn(prompt)  # high-quality big-model output
    return {'messages': [
        {'role': 'user', 'content': prompt},
        {'role': 'assistant', 'content': completion},
    ]}

Señal 4: formato o estilo idiosincrásico

Algunas salidas son tan específicas que describirlas cuesta más que demostrarlas a escala: un DSL propietario, una voz editorial propia con miles de microrreglas o un esquema rígido de dominio con innumerables campos condicionales.

Cuando el cumplimiento del formato debe ser casi perfecto y las reglas son demasiado numerosas para enumerarlas en un prompt, cientos de ejemplos enseñan el patrón de forma más fiable que la prosa. El fine-tuning destaca a la hora de internalizar estructuras implícitas que se resisten a las instrucciones explícitas.

Señal 5: comportamiento al que el modelo se resiste

En ocasiones, un modelo se opone a una instrucción: sigue añadiendo advertencias que usted ha prohibido, se niega a realizar una tarea inofensiva o vuelve a un estilo predeterminado bajo carga. Si una instrucción firme y repetida, junto con ejemplos, no puede suprimir el comportamiento de forma fiable, esa resistencia es un prior incorporado en los pesos base.

El fine-tuning puede anular esos priors. Pero compruebe primero que la resistencia sea genuina y no un problema de claridad del prompt; atribuirla erróneamente a una resistencia del modelo conduce a ejecuciones de entrenamiento innecesarias.

Señales en contra: cuándo NO hacer fine-tuning

Reconocer las falsas alarmas es igual de importante. NO haga fine-tuning cuando:

  • La diferencia está en el conocimiento: recupérelo en su lugar; el fine-tuning incorpora hechos obsoletos y con pérdidas
  • La especificación sigue cambiando cada semana: tendrá que volver a entrenar constantemente
  • Tiene menos de unos cientos de ejemplos limpios: hay poca señal y un alto riesgo de sobreajuste
  • Los errores son aleatorios, no sistemáticos: los datos o el prompt aún contienen ruido
  • Carece de un marco de evaluación: no puede saber si el fine-tuning siquiera ayudó

Control de preparación de los datos

La calidad del fine-tuning está limitada por la calidad de los datos. Antes de comprometerse, supere un control de preparación: debe contar con suficientes ejemplos, equilibrados entre los casos relevantes, coherentes en el etiquetado y libres de filtraciones que inflen las puntuaciones de evaluación.

Unos cientos de ejemplos seleccionados meticulosamente son mejores que decenas de miles con ruido. Si las etiquetas se contradicen, el modelo aprenderá el ruido.

def data_ready(examples, min_n=300, max_dupe_ratio=0.05):
    n = len(examples)
    texts = [e['messages'][0]['content'] for e in examples]
    dupe_ratio = 1 - (len(set(texts)) / n)
    return n >= min_n and dupe_ratio <= max_dupe_ratio

# Returns False until you have enough deduped, curated examples

Elija el método de fine-tuning

No todo el fine-tuning consiste en entrenar todos los pesos. Adapte el método a la señal:

  • LoRA / adaptadores - baratos, rápidos y reversibles; ideales para destilar estilo y formato
  • Fine-tuning completo - más pesado; para cambios profundos de comportamiento en modelos abiertos capaces
  • Ajuste por preferencias (al estilo DPO) - cuando dispone de evaluaciones por pares de respuestas buenas y malas en lugar de respuestas de referencia

Comience con el método más ligero que requiera la señal. Los adaptadores al estilo LoRA cubren la mayoría de los casos de producción con una fracción del coste.

Protocolo previo al compromiso

Antes de iniciar una ejecución de entrenamiento, deje fijado el experimento para que el resultado sea interpretable:

  • Congele un conjunto de evaluación reservado que el modelo nunca verá durante el entrenamiento
  • Registre la mejor puntuación de referencia obtenida solo con prompting en ese conjunto
  • Establezca de antemano la mejora objetivo y el límite de coste
  • Defina la reversión: si el modelo ajustado no supera la referencia en la mejora objetivo, ponga el prompt en producción

Sin una referencia y un objetivo establecidos de antemano, no puede demostrar que el fine-tuning haya compensado su coste.

Integre las señales

Combine las señales en un único criterio de continuar o no continuar. El fine-tuning solo debe avanzar cuando el prompting se haya estancado, los datos estén preparados y la diferencia corresponda al comportamiento; no basta con que se active una sola señal de forma aislada.

def should_fine_tune(plateaued, data_ready, gap_is_behavior,
                     spec_stable, has_eval_harness):
    return all([
        plateaued,        # prompting stalled on frozen eval
        data_ready,       # enough clean, deduped examples
        gap_is_behavior,  # not a knowledge gap (else use RAG)
        spec_stable,      # task definition has settled
        has_eval_harness, # can measure the lift
    ])

print(should_fine_tune(True, True, True, True, True))  # True -> proceed

Comprobación rápida

En un conjunto de evaluación congelado, los errores de un modelo son aleatorios y dispersos entre muchos tipos de entrada diferentes, y la puntuación sigue aumentando cuando ajusta los ejemplos. ¿Qué indica esto sobre la preparación para el fine-tuning?

Resumen

Haga fine-tuning basándose en evidencia, no en intuición. Las señales legítimas son: un verdadero estancamiento con errores sistemáticos, una longitud del prompt que se ha convertido en el producto, un umbral estricto de latencia o coste, formatos idiosincrásicos o un comportamiento al que el modelo base se resiste.

  • Señales en contra: lagunas de conocimiento, especificaciones cambiantes, pocos datos, errores aleatorios y ausencia de un marco de evaluación
  • Supere un control de preparación de los datos antes del entrenamiento: el resultado está limitado por la calidad
  • Elija primero el método más ligero, como los adaptadores al estilo LoRA, que requiera la señal
  • Establezca de antemano una evaluación congelada, una referencia, una mejora objetivo y una reversión
  • Avance solo cuando se cumplan las tres condiciones: estancamiento, datos preparados y diferencia de comportamiento

Preguntas frecuentes

¿La lección «Cuándo aplicar fine-tuning» es gratis?

Sí — el texto completo de «Cuándo aplicar fine-tuning» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Cuándo aplicar fine-tuning»?

Identifique las señales de que el prompting ha alcanzado sus límites. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Cuándo aplicar fine-tuning»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Cuándo basta con prompting
  2. Cuándo aplicar fine-tuning
  3. Híbrido: prompt y ajuste ligero
  4. Evaluación de la decisión
← Volver a AI Prompt Engineering