Avaliando gerações com ROUGE e BLEU
Meça a qualidade de resumos e traduções.
Avaliando gerações com ROUGE e BLEU é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Why Score Generation?
Summaries and translations are free-form text, so there is no single right answer. We need metrics to compare output against reference text. 📏
Compare to a Reference
Both ROUGE and BLEU compare your generated text to one or more human references. More overlap with the reference means a higher score.
BLEU for Translation
BLEU measures how many short word sequences in your output also appear in the reference. It is the classic metric for machine translation.
BLEU Rewards Precision
BLEU is precision-focused: it asks how much of your output matches the reference. A brevity penalty stops models from cheating with very short text.
ROUGE for Summaries
ROUGE is the go-to metric for summarization. It checks how much of the reference content your summary managed to recover.
ROUGE Rewards Recall
ROUGE leans on recall: did your summary capture the important words from the reference? ROUGE-1 counts single-word overlap.
ROUGE-L and Sequences
ROUGE-L looks at the longest matching word sequence, rewarding output that keeps the reference's order, not just its words.
Computing ROUGE
The evaluate library makes scoring a one-liner. Load rouge and pass your predictions with their references.
import evaluate
rouge = evaluate.load("rouge")
print(rouge.compute(predictions=preds, references=refs))Computing BLEU
BLEU works the same way. Note each prediction needs a list of references, since several translations can be correct.
bleu = evaluate.load("bleu")
print(bleu.compute(predictions=preds, references=refs))Higher Is Better
Both scores rise with overlap. They are useful for comparing models, but a single absolute number means little on its own.
Metrics Miss Meaning
These metrics count word overlap, not true meaning. A perfect paraphrase using different words can still score low, so pair them with human review.
Quick Check
Which metric is recall-focused and standard for summarization?
Recap
You learned to score generated text: BLEU for translation precision, ROUGE for summary recall, and why both still need human judgment. 🎯
Perguntas Frequentes
A aula “Avaliando gerações com ROUGE e BLEU” é grátis?
Sim — o texto completo de “Avaliando gerações com ROUGE e BLEU” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Avaliando gerações com ROUGE e BLEU”?
Meça a qualidade de resumos e traduções. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Avaliando gerações com ROUGE e BLEU”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Resumos extrativos versus abstrativos
- Resumindo com um modelo Seq2Seq
- Tradução automática na prática
- Avaliando gerações com ROUGE e BLEU