0Pricing
AI Prompt Engineering · Lección

Lectura y evaluación de resultados de IA

Criterios para juzgar la relevancia, exactitud y exhaustividad de las respuestas de IA.

Lectura y evaluación de resultados de IA es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

Por qué es importante evaluar

Obtener una respuesta de IA es solo la mitad del trabajo. La otra mitad consiste en juzgar si esa respuesta es realmente buena.

Sin un marco de evaluación claro, podría aceptar una respuesta que parece pulida pero responde a la pregunta equivocada, o rechazar una respuesta realmente útil porque no tiene el formato que esperaba.

Desarrollar un criterio fiable para evaluar la calidad de los resultados de la IA es una de las habilidades más prácticas de la ingeniería de prompts.

Los cuatro criterios de evaluación

Al leer una respuesta de IA, evalúela según cuatro dimensiones:

  • Relevancia: ¿respondió a la pregunta que realmente formuló?
  • Precisión: ¿la información es objetivamente correcta?
  • Integridad: ¿abarcó todas las partes de la solicitud?
  • Formato: ¿está estructurada de la forma que necesita?

Una respuesta puede obtener una puntuación alta en tres dimensiones y fallar en la cuarta. Cada criterio es importante por separado.

Criterio 1: Relevancia

La relevancia plantea la siguiente pregunta: ¿el modelo respondió a la pregunta que realmente hizo o respondió a una pregunta relacionada, pero diferente?

Ejemplo: usted pregunta "¿Cuáles son los riesgos de usar LLMs en el ámbito sanitario?" y el modelo responde con una explicación general de cómo funcionan los LLMs. La respuesta puede ser precisa, pero no es relevante: no abordó el punto principal.

Para comprobar la relevancia, vuelva a leer su prompt original y pregúntese: ¿la respuesta aborda directamente lo que pregunté?

Criterio 2: Precisión

La precisión plantea la siguiente pregunta: ¿son correctos los hechos, las cifras y las afirmaciones de la respuesta?

Los modelos de IA pueden alucinar: pueden afirmar con seguridad cosas que sencillamente son incorrectas. Entre los problemas habituales de precisión se incluyen:

  • Estadísticas o fechas incorrectas
  • Citas atribuidas a la persona equivocada
  • Información desactualizada presentada como vigente
  • Referencias o citas inventadas

En temas factuales, verifique siempre las afirmaciones clave con una fuente confiable antes de utilizar el resultado.

Criterio 3: Completitud

La completitud plantea la siguiente pregunta: ¿la respuesta cubrió todas las partes de su solicitud?

Si su prompt tenía varias partes —"Explique X, enumere tres ejemplos y sugiera el siguiente paso"—, compruebe que el modelo haya abordado las tres, no solo la primera.

A veces los modelos omiten la última parte de una solicitud con varias indicaciones, especialmente si el prompt es largo. Comparar la respuesta con su prompt punto por punto es la forma más fiable de comprobar la completitud.

Criterio 4: Formato

El formato plantea la siguiente pregunta: ¿la respuesta está estructurada de la manera que necesita?

Incluso una respuesta perfectamente precisa y completa puede ser difícil de utilizar si el formato no es el adecuado. Estas son algunas discrepancias habituales de formato:

  • Texto redactado en prosa cuando necesitaba una lista con viñetas
  • Un ensayo largo cuando necesitaba un resumen
  • Ausencia de encabezados que facilitarían la navegación
  • Código sin explicaciones o explicaciones sin código

Los problemas de formato suelen ser los más fáciles de corregir con un prompt de seguimiento.

Una lista de comprobación sencilla para la evaluación

Después de recibir cualquier respuesta de IA, repase mentalmente esta lista de comprobación:

  • Relevancia: ¿responde a mi pregunta real?
  • Precisión: ¿puedo confiar en los hechos? ¿Qué tendría que verificar?
  • Completitud: ¿cubrió todas las partes de mi solicitud?
  • Formato: ¿está estructurada de una manera que pueda utilizar?

Si algún criterio falla, eso le indica exactamente qué tipo de prompt de seguimiento debe escribir. Cada criterio apunta a un tipo específico de corrección.

Evaluación en código: asignar una puntuación a una respuesta

Puede crear en Python un envoltorio de evaluación ligero que asigne una puntuación a cada criterio mediante una segunda llamada a un LLM:

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

Fallos de relevancia: patrones habituales

Los fallos de relevancia suelen seguir patrones predecibles. Reconocerlos agiliza la evaluación:

  • Desviación del tema: el modelo comienza correctamente y luego se desvía hacia un tema relacionado
  • Sustitución de la pregunta: el modelo responde a una versión más sencilla o fácil de su pregunta
  • Generalización excesiva: usted preguntó por un caso específico y el modelo responde sobre el caso general
  • Ignorar restricciones: usted especificó un contexto (por ejemplo, "para principiantes") y el modelo lo ignoró

Cada patrón sugiere una corrección específica para su prompt de seguimiento.

Señales de alerta de falta de precisión

Incluso cuando no puede verificar inmediatamente una afirmación, ciertas señales sugieren una menor precisión:

  • Números muy específicos citados sin indicar una fuente
  • Afirmaciones que parecen demasiado convenientes o perfectamente adecuadas
  • Referencias a estudios, artículos o libros con título y autor
  • Fechas y números de versión (cambian con frecuencia)
  • Datos específicos de carácter legal, médico o financiero

Estas señales no demuestran que haya un error, pero son los elementos que conviene comprobar dos veces antes de utilizar el resultado en un contexto de alto riesgo.

Usar la evaluación para redactar mejores prompts de seguimiento

El verdadero valor de la evaluación es que cada criterio que falla se corresponde directamente con un tipo de prompt de seguimiento:

  • Fallo de relevancia → "Usted respondió X, pero yo preguntaba por Y. Céntrese en Y."
  • Duda sobre la precisión → "Compruebe de nuevo la afirmación sobre Z y cite en qué se basa."
  • Fallo de completitud → "No abordó la tercera parte de mi pregunta. Añádala, por favor."
  • Fallo de formato → "Reescriba esto como una lista con viñetas y coloque un resumen de una línea al principio."

La evaluación y los prompts de seguimiento funcionan como un ciclo de retroalimentación.

Comprobación de conocimientos: criterios de evaluación

Usted pregunta al modelo: "Enumere los 5 principales frameworks web de Python con una descripción de una oración para cada uno." El modelo responde con un ensayo bien redactado sobre la historia de Python y su auge en el desarrollo web. Menciona brevemente Flask y Django, pero no enumera 5 frameworks.

¿Qué criterio incumple esta respuesta de forma más crítica?

Recapitulación: leer y evaluar los resultados de la IA

La creación de buenos prompts es un proceso de dos pasos: redactar el prompt y evaluar la respuesta.

Los cuatro criterios —relevancia, precisión, completitud y formato— le proporcionan una forma sistemática de evaluar cualquier resultado de IA. Cada criterio que falla le indica exactamente qué tipo de prompt de seguimiento debe redactar.

En la próxima lección, practicará la redacción de esos prompts de seguimiento para corregir tipos específicos de fallos.

Preguntas frecuentes

¿La lección «Lectura y evaluación de resultados de IA» es gratis?

Sí — el texto completo de «Lectura y evaluación de resultados de IA» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Lectura y evaluación de resultados de IA»?

Criterios para juzgar la relevancia, exactitud y exhaustividad de las respuestas de IA. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «Lectura y evaluación de resultados de IA»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Lectura y evaluación de resultados de IA
  2. Redacción de prompts de seguimiento eficaces
  3. Basarse en respuestas anteriores
  4. Cuándo perfeccionar y cuándo empezar de nuevo
← Volver a AI Prompt Engineering