AI Agents · Lección

Problemas de los LLM como jueces

Los jueces muestran sesgo hacia las respuestas extensas, tienen dificultades con sus propias salidas y necesitan una calibración cuidadosa.

Lección 3 de 415 pasos

Problemas de los LLM como jueces es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

¿Por qué usar jueces LLM?

Para salidas abiertas (ensayos, revisiones de código y respuestas conversacionales), no existe una única respuesta correcta. Contratar a personas para evaluar miles de salidas es caro.

LLM-as-a-Judge — usar un modelo potente para puntuar las salidas — cubre esa carencia.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Problema 1: sesgo de posición

Los jueces prefieren la PRIMERA respuesta en una comparación por pares. Aleatorice siempre el orden y ejecute la comparación dos veces:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Problema 2: sesgo de longitud

Los jueces prefieren las respuestas MÁS LARGAS, incluso cuando las más cortas son mejores. Calibre el sistema normalizando la longitud o dando instrucciones al juez:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Problema 3: preferencia por uno mismo

Los modelos prefieren sus propias salidas. Si GPT-4 evalúa su propio trabajo, se asigna una puntuación mayor de la debida. Use una familia de modelos diferente para evaluar:

  • Salidas de GPT-4 -> evaluadas por Claude
  • Salidas de Claude -> evaluadas por GPT-4

Problema 4: adulación

Los jueces coinciden con las opiniones contundentes de la respuesta. «Estoy 100 % seguro...» obtiene puntuaciones más altas que «Creo que...». Elimine las palabras que expresan confianza antes de evaluar.

Problema 5: inflación de puntuaciones

En las escalas del 1 al 5, los jueces se agrupan alrededor del 4. Use una puntuación binaria (correcto/incorrecto) para obtener una señal más precisa:

judge_prompt = '... Return PASS or FAIL only ...'

Problema 6: sesgo de formato

Las respuestas en forma de lista con viñetas reciben puntuaciones más altas que la prosa, independientemente de su corrección. Téngalo en cuenta; a veces conviene exigir un formato para eliminar esta variable.

Calibre con respecto a evaluaciones humanas

Mida en una muestra hasta qué punto las evaluaciones del juez se correlacionan con las valoraciones humanas:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Use comparaciones por pares cuando sea posible

«¿Es A mejor que B?» es más fiable que «Puntúe A del 1 al 5». Al elegir entre dos prompts, la comparación por pares es mejor que la puntuación absoluta.

Evaluación con cadena de pensamiento

Haga que el juez razone primero:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Coste

Evaluar con GPT-4 duplica el coste de las evaluaciones. Para las comprobaciones rutinarias, use jueces más económicos (gpt-4o-mini o claude-haiku) y reserve los jueces grandes para las versiones.

Combínelo con reglas

No dependa únicamente del juez. Combine:

  • Reglas («contiene “30 días”»)
  • Heurísticas (rango de longitud)
  • Un juez LLM para la parte abierta

Calibración de un juez LLM

¿Cómo comprueba si su juez LLM es fiable?

Resumen

Los jueces LLM son útiles, pero tienen sesgos. Aleatorice las posiciones, normalice la longitud, use familias de modelos diferentes, calibre con respecto a evaluaciones humanas y combine el juez con reglas estrictas.

Gratis para empezar

Aprende AI Agents con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
60
Lecciones
239

Preguntas frecuentes

¿La lección «Problemas de los LLM como jueces» es gratis?

Sí — el texto completo de «Problemas de los LLM como jueces» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Problemas de los LLM como jueces»?

Los jueces muestran sesgo hacia las respuestas extensas, tienen dificultades con sus propias salidas y necesitan una calibración cuidadosa. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Problemas de los LLM como jueces»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Desarrollo de agentes guiado por evaluaciones
  2. Crear un conjunto de pruebas de referencia
  3. Problemas de los LLM como jueces
  4. Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench
← Volver a AI Agents