Evaluación de generación con ROUGE y BLEU
Medir la calidad de resúmenes y traducciones
Evaluación de generación con ROUGE y BLEU es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Why Score Generation?
Summaries and translations are free-form text, so there is no single right answer. We need metrics to compare output against reference text. 📏
Compare to a Reference
Both ROUGE and BLEU compare your generated text to one or more human references. More overlap with the reference means a higher score.
BLEU for Translation
BLEU measures how many short word sequences in your output also appear in the reference. It is the classic metric for machine translation.
BLEU Rewards Precision
BLEU is precision-focused: it asks how much of your output matches the reference. A brevity penalty stops models from cheating with very short text.
ROUGE for Summaries
ROUGE is the go-to metric for summarization. It checks how much of the reference content your summary managed to recover.
ROUGE Rewards Recall
ROUGE leans on recall: did your summary capture the important words from the reference? ROUGE-1 counts single-word overlap.
ROUGE-L and Sequences
ROUGE-L looks at the longest matching word sequence, rewarding output that keeps the reference's order, not just its words.
Computing ROUGE
The evaluate library makes scoring a one-liner. Load rouge and pass your predictions with their references.
import evaluate
rouge = evaluate.load("rouge")
print(rouge.compute(predictions=preds, references=refs))Computing BLEU
BLEU works the same way. Note each prediction needs a list of references, since several translations can be correct.
bleu = evaluate.load("bleu")
print(bleu.compute(predictions=preds, references=refs))Higher Is Better
Both scores rise with overlap. They are useful for comparing models, but a single absolute number means little on its own.
Metrics Miss Meaning
These metrics count word overlap, not true meaning. A perfect paraphrase using different words can still score low, so pair them with human review.
Quick Check
Which metric is recall-focused and standard for summarization?
Recap
You learned to score generated text: BLEU for translation precision, ROUGE for summary recall, and why both still need human judgment. 🎯
Preguntas frecuentes
¿La lección «Evaluación de generación con ROUGE y BLEU» es gratis?
Sí — el texto completo de «Evaluación de generación con ROUGE y BLEU» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Evaluación de generación con ROUGE y BLEU»?
Medir la calidad de resúmenes y traducciones Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar NLP Academy?
No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Evaluación de generación con ROUGE y BLEU»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de NLP Academy?
Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Resúmenes extractivos frente a abstractivos
- Resumen con un modelo Seq2Seq
- Traducción automática en la práctica
- Evaluación de generación con ROUGE y BLEU