Teknik KILAVUZ

ROUGE ve BLEU Değerlendirme Metrikleri

ROUGE ve BLEU, makine tarafından oluşturulan metni insan referanslarıyla karşılaştırmak için kullanılan güçlü otomatik ölçümlerdir.

2 min readSon güncelleme

Genel Bakış

BLEU was built for translation and leans on precision; ROUGE was built for summarization and leans on recall.

Derin Dalış

Her iki ölçüm de aday metin ile bir veya daha fazla referans metni arasındaki n-gram örtüşmeyi ölçer, ancak farklı yönleri vurgularlar. BLEU (İki Dilli Değerlendirme Alt Çalışması), değiştirilmiş n-gram hassasiyetini (tipik olarak 1'den 4 grama kadar) hesaplar, bunları geometrik olarak çarpar ve bir kısalık cezası uygular, böylece sistem çok kısa çıktı üreterek skorla oynayamaz. ROUGE (Özet Değerlendirmesi için Geri Çağırma Odaklı Yedek Çalışma) bunun yerine hatırlamayı tercih eder: ROUGE-N, örtüşen n-gramları sayar, ROUGE-L, bitişiklik gerektirmeden sıralı eşleşmeleri ödüllendirmek için en uzun ortak alt diziyi kullanır. BLEU 'sistemin söylediklerinin ne kadarının doğru olduğunu' sorar. ROUGE 'sistem referansın ne kadarını yakaladı?' diye sorar. Her ikisi de ucuz ve tekrarlanabilir, ancak yalnızca yüzeysel sözcük örtüşmesi, eksik anlatım ve anlam görülür.

Teknik Bilgi

BLEU'nun değiştirilmiş hassaslığı, her aday n-gram sayısını herhangi bir referanstaki maksimum sayısına kadar keserek tekrarlanan oyunları önler; Kısalık cezası, çıktının referanstan daha kısa olması durumunda devreye girer. ROUGE-L'nin en uzun ortak alt dizisi, boşluklara izin verirken cümle düzeyindeki yapıyı ve kelime sırasını yakalar ve ROUGE sıklıkla F1'in hassasiyet ve hatırlamayı birleştirdiğini bildirir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

ROUGE ve BLEU Değerlendirme Metriklerinin Geleceği

N-gram metrikleri tam kelime eşleşmelerini ödüllendirdiğinden, geçerli açıklamaları ve akıcı yeniden yazmaları hafife alırlar; LLM çıktıları sözcüksel olarak referanslardan farklılaştıkça büyüyen bir sorundur. BERTScore gibi yerleştirmeye dayalı metrikler ve BLEURT ve COMET gibi öğrenilmiş metriklerin yanı sıra jüri olarak yüksek lisans değerlendirmesi, bunları giderek daha fazla tamamlıyor veya onların yerine geçiyor. Yine de ROUGE ve BLEU neredeyse her makalede bildirilen hızlı ve şeffaf temel çizgileri sürdürüyor.

Gerçek Dünya Uygulaması

Makine çevirisi araştırmacıları, sistem kalitesini karşılaştırmak için WMT karşılaştırmalarındaki BLEU puanlarını rapor ediyor

Özetleme makaleleri CNN/DailyMail veri kümesinde ROUGE-1, ROUGE-2 ve ROUGE-L'yi rapor ediyor

Bir mühendislik ekibi, bir çeviri modelinde ince ayar yaparken gerilemeleri tespit etmek için CI'da BLEU'yu izliyor

Bir özetleme ürünü, daha maliyetli insan değerlendirmesini çalıştırmadan önce ucuz bir otomatik kontrol olarak ROUGE-L'yi kullanıyor

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ROUGE and BLEU Evaluation Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Doğrusal Problama ve Dondurulmuş Özellik Değerlendirmesi

Sık sorulan sorular

What is ROUGE and BLEU Evaluation Metrics?

ROUGE ve BLEU, makine tarafından oluşturulan metni insan referanslarıyla karşılaştırmak için kullanılan güçlü otomatik ölçümlerdir. BLEU çeviri için tasarlandı ve hassasiyete dayanıyor; ROUGE özetleme için tasarlandı ve hatırlamaya dayanıyor.

Hangi metrik başlangıçta makine çevirisi için tasarlanmıştı ve kesinliği vurguluyordu?

BLEU çeviri için yaratılmıştır ve kısalık cezasıyla birlikte değiştirilmiş n-gram hassasiyetine dayanmaktadır.

ROUGE öncelikli olarak neye odaklanıyor?

ROUGE, Özet Değerlendirme için Geri Çağırma Odaklı Yedek Çalışma anlamına gelir ve referansın ne kadarının yakalandığını vurgular.

BLEU'nun kısalık cezası neyi önler?

Kısalık cezası, aday referanstan kısa olduğunda BLEU'yu düşürür ve sistemlerin kısa çıktıyla hassasiyeti artırmasını engeller.

ROUGE-L neyi ölçer?

ROUGE-L, boşluklara izin verirken sıralı eşleşmeleri ödüllendiren en uzun ortak alt diziyi kullanır.

Hem BLEU hem de ROUGE'un ortak önemli sınırlaması nedir?

Her ikisi de tam kelime/n-gram eşleşmesine dayanır, bu nedenle sözcüksel olarak referanstan farklı olan geçerli açıklamaları küçümserler.