Generierung mit ROUGE und BLEU bewerten
Qualität von Zusammenfassungen und Übersetzungen messen
Generierung mit ROUGE und BLEU bewerten ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Warum die Generierung bewertet wird
Zusammenfassungen und Übersetzungen sind freie Texte, daher gibt es nicht genau eine richtige Antwort. Wir benötigen Metriken, um die Ausgabe mit Referenztexten zu vergleichen. 📏
Mit einer Referenz vergleichen
Sowohl ROUGE als auch BLEU vergleichen Ihren generierten Text mit einer oder mehreren menschlichen Referenzen. Je größer die Übereinstimmung mit der Referenz, desto höher der Score.
BLEU für Übersetzungen
BLEU misst, wie viele kurze Wortfolgen in Ihrer Ausgabe auch in der Referenz vorkommen. Es ist die klassische Metrik für maschinelle Übersetzung.
BLEU belohnt Präzision
BLEU ist präzisionsorientiert: Die Metrik fragt, wie viel von Ihrer Ausgabe mit der Referenz übereinstimmt. Eine Kürzungsstrafe verhindert, dass Modelle mit sehr kurzen Texten zu gute Ergebnisse erzielen.
ROUGE für Zusammenfassungen
ROUGE ist die Standardmetrik für Zusammenfassungen. Sie prüft, wie viel des Inhalts der Referenz Ihre Zusammenfassung wiedergeben konnte.
ROUGE belohnt Recall
ROUGE setzt auf Recall: Hat Ihre Zusammenfassung die wichtigen Wörter aus der Referenz erfasst? ROUGE-1 zählt die Übereinstimmung einzelner Wörter.
ROUGE-L und Sequenzen
ROUGE-L betrachtet die längste übereinstimmende Wortsequenz und bewertet Ausgaben höher, die die Reihenfolge der Referenz beibehalten, nicht nur deren Wörter.
ROUGE berechnen
Mit der Bibliothek evaluate wird die Bewertung zu einer einzigen Codezeile. Laden Sie rouge und übergeben Sie Ihre Vorhersagen zusammen mit den Referenzen.
import evaluate
rouge = evaluate.load("rouge")
print(rouge.compute(predictions=preds, references=refs))BLEU berechnen
BLEU funktioniert genauso. Beachten Sie, dass jede Vorhersage eine Liste von Referenzen benötigt, da mehrere Übersetzungen korrekt sein können.
bleu = evaluate.load("bleu")
print(bleu.compute(predictions=preds, references=refs))Höher ist besser
Beide Werte steigen mit zunehmender Übereinstimmung. Sie eignen sich zum Vergleichen von Modellen, aber eine einzelne absolute Zahl sagt für sich genommen wenig aus.
Metriken erfassen keine Bedeutung
Diese Metriken zählen die Übereinstimmung von Wörtern, nicht die tatsächliche Bedeutung. Eine perfekte Paraphrase mit anderen Wörtern kann trotzdem einen niedrigen Wert erzielen. Kombinieren Sie die Metriken daher mit einer menschlichen Prüfung.
Kurze Überprüfung
Welche Metrik ist auf Recall ausgerichtet und für die Zusammenfassung standardmäßig geeignet?
Zusammenfassung
Sie haben gelernt, generierten Text zu bewerten: BLEU für die Präzision bei Übersetzungen, ROUGE für den Recall bei Zusammenfassungen und warum beide weiterhin menschliche Beurteilung benötigen. 🎯
Lerne Python mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 30
- Lektionen
- 120
Häufig gestellte Fragen
Ist die Lektion „Generierung mit ROUGE und BLEU bewerten“ kostenlos?
Ja — der vollständige Text von „Generierung mit ROUGE und BLEU bewerten“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Generierung mit ROUGE und BLEU bewerten“?
Qualität von Zusammenfassungen und Übersetzungen messen Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um NLP Academy zu starten?
Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Generierung mit ROUGE und BLEU bewerten“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?
Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Extraktive und abstraktive Zusammenfassungen
- Mit einem Seq2Seq-Modell zusammenfassen
- Maschinelle Übersetzung in der Praxis
- Generierung mit ROUGE und BLEU bewerten