Als nächstesNächster Leitfaden
RAG Evaluation Metrics and RAGAS
Technisch
Technischer Leitfaden
ROUGE und BLEU sind die leistungsstarken automatischen Metriken für den Vergleich von maschinengeneriertem Text mit menschlichen Referenzen.
BLEU wurde für Übersetzung entwickelt und setzt auf Präzision; ROUGE wurde für Zusammenfassungen entwickelt und setzt auf Rückruf.
Beide Metriken messen die N-Gramm-Überlappung zwischen einem Kandidatentext und einem oder mehreren Referenztexten, betonen jedoch unterschiedliche Richtungen. BLEU (Bilingual Evaluation Understudy) berechnet die modifizierte n-Gramm-Präzision (normalerweise 1 bis 4 Gramm), multipliziert sie geometrisch und wendet einen Kürzelwert an, sodass ein System die Punktzahl nicht durch die Erzeugung einer sehr kurzen Ausgabe austricksen kann. ROUGE (Recall-Oriented Understudy for Gisting Evaluation) bevorzugt stattdessen den Rückruf: ROUGE-N zählt überlappende n-Gramm, ROUGE-L verwendet die längste gemeinsame Teilsequenz, um Übereinstimmungen in der Reihenfolge zu belohnen, ohne dass Kontiguität erforderlich ist. BLEU fragt: „Wie viel von dem, was das System gesagt hat, ist richtig?“ während ROUGE fragt: „Wie viel von der Referenz hat das System erfasst?“. Beide sind billig und reproduzierbar, weisen jedoch nur oberflächliche Wortüberschneidungen auf und es fehlen Paraphrasen und Bedeutungen.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Da N-Gramm-Metriken genaue Wortübereinstimmungen belohnen, unterschätzen sie gültige Paraphrasen und fließende Umschreibungen, ein wachsendes Problem, da LLM-Ausgaben lexikalisch von Referenzen abweichen. Einbettungsbasierte Metriken wie BERTScore und erlernte Metriken wie BLEURT und COMET sowie die LLM-as-Judge-Bewertung ergänzen oder ersetzen diese zunehmend. Dennoch bleiben ROUGE und BLEU als schnelle, transparente Basislinien bestehen, über die in fast jeder Veröffentlichung berichtet wird.
Forscher für maschinelle Übersetzung berichten über BLEU-Ergebnisse bei WMT-Benchmarks, um die Systemqualität zu vergleichen
Zusammenfassungspapiere berichten über ROUGE-1, ROUGE-2 und ROUGE-L im CNN/DailyMail-Datensatz
Ein Ingenieurteam verfolgt BLEU in CI, um Regressionen bei der Feinabstimmung eines Übersetzungsmodells zu erkennen
Ein Zusammenfassungsprodukt verwendet ROUGE-L als kostengünstige automatische Prüfung, bevor eine kostspieligere menschliche Bewertung durchgeführt wird
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ROUGE und BLEU sind die leistungsstarken automatischen Metriken für den Vergleich von maschinengeneriertem Text mit menschlichen Referenzen. BLEU wurde für die Übersetzung entwickelt und setzt auf Präzision. ROUGE wurde für die Zusammenfassung entwickelt und basiert auf der Erinnerung.
BLEU wurde für die Übersetzung erstellt und basiert auf einer modifizierten N-Gramm-Präzision mit einem Kürzel.
ROUGE steht für Recall-Oriented Understudy for Gisting Evaluation und betont, wie viel von der Referenz erfasst wird.
Der Kürze-Abzug senkt BLEU, wenn der Kandidat kürzer als die Referenz ist, und verhindert so, dass Systeme die Präzision durch knappe Ausgabe erhöhen.
ROUGE-L verwendet die längste gemeinsame Teilsequenz, belohnt Übereinstimmungen in der richtigen Reihenfolge und lässt gleichzeitig Lücken zu.
Beide beruhen auf einer exakten Wort-/N-Gramm-Übereinstimmung und unterschätzen daher gültige Paraphrasen, die sich lexikalisch von der Referenz unterscheiden.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
RAG Evaluation Metrics and RAGAS
Technisch