Оценка генерации с помощью ROUGE и BLEU
Измеряйте качество резюме и перевода
«Оценка генерации с помощью ROUGE и BLEU» — бесплатный урок NLP Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Why Score Generation?
Summaries and translations are free-form text, so there is no single right answer. We need metrics to compare output against reference text. 📏
Compare to a Reference
Both ROUGE and BLEU compare your generated text to one or more human references. More overlap with the reference means a higher score.
BLEU for Translation
BLEU measures how many short word sequences in your output also appear in the reference. It is the classic metric for machine translation.
BLEU Rewards Precision
BLEU is precision-focused: it asks how much of your output matches the reference. A brevity penalty stops models from cheating with very short text.
ROUGE for Summaries
ROUGE is the go-to metric for summarization. It checks how much of the reference content your summary managed to recover.
ROUGE Rewards Recall
ROUGE leans on recall: did your summary capture the important words from the reference? ROUGE-1 counts single-word overlap.
ROUGE-L and Sequences
ROUGE-L looks at the longest matching word sequence, rewarding output that keeps the reference's order, not just its words.
Computing ROUGE
The evaluate library makes scoring a one-liner. Load rouge and pass your predictions with their references.
import evaluate
rouge = evaluate.load("rouge")
print(rouge.compute(predictions=preds, references=refs))Computing BLEU
BLEU works the same way. Note each prediction needs a list of references, since several translations can be correct.
bleu = evaluate.load("bleu")
print(bleu.compute(predictions=preds, references=refs))Higher Is Better
Both scores rise with overlap. They are useful for comparing models, but a single absolute number means little on its own.
Metrics Miss Meaning
These metrics count word overlap, not true meaning. A perfect paraphrase using different words can still score low, so pair them with human review.
Quick Check
Which metric is recall-focused and standard for summarization?
Recap
You learned to score generated text: BLEU for translation precision, ROUGE for summary recall, and why both still need human judgment. 🎯
Часто задаваемые вопросы
Урок «Оценка генерации с помощью ROUGE и BLEU» бесплатный?
Да — полный текст урока «Оценка генерации с помощью ROUGE и BLEU» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Оценка генерации с помощью ROUGE и BLEU»?
Измеряйте качество резюме и перевода Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Оценка генерации с помощью ROUGE и BLEU»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Экстрактивные и абстрактивные резюме
- Создание резюме с моделью Seq2Seq
- Машинный перевод на практике
- Оценка генерации с помощью ROUGE и BLEU