तकनीकी गाइड

रूज और ब्लू मूल्यांकन मेट्रिक्स

ROUGE और BLEU मानव संदर्भों के विरुद्ध मशीन-जनित पाठ की तुलना करने के लिए वर्कहॉर्स स्वचालित मेट्रिक्स हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

BLEU was built for translation and leans on precision; ROUGE was built for summarization and leans on recall.

गहरा गोता

दोनों मेट्रिक्स एक उम्मीदवार पाठ और एक या अधिक संदर्भ ग्रंथों के बीच एन-ग्राम ओवरलैप को मापते हैं, लेकिन वे विभिन्न दिशाओं पर जोर देते हैं। BLEU (द्विभाषी मूल्यांकन अंडरस्टूडी) संशोधित एन-ग्राम परिशुद्धता (आमतौर पर 1- से 4-ग्राम) की गणना करता है, उन्हें ज्यामितीय रूप से गुणा करता है, और एक संक्षिप्तता जुर्माना लागू करता है ताकि सिस्टम बहुत कम आउटपुट उत्पन्न करके स्कोर को गेम न कर सके। रूज (रिकॉल-ओरिएंटेड अंडरस्टडी फॉर गिस्टिंग इवैल्यूएशन) इसके बजाय रिकॉल का समर्थन करता है: रूज-एन ओवरलैपिंग एन-ग्राम की गणना करता है, रूज-एल आकस्मिकता की आवश्यकता के बिना इन-ऑर्डर मैचों को पुरस्कृत करने के लिए सबसे लंबे सामान्य अनुक्रम का उपयोग करता है। BLEU पूछता है 'सिस्टम ने जो कहा वह कितना सही है?' जबकि ROUGE पूछता है 'सिस्टम ने कितना संदर्भ कैप्चर किया?'। दोनों सस्ते और प्रतिलिपि प्रस्तुत करने योग्य हैं, लेकिन केवल सतही शब्द ओवरलैप देखते हैं, व्याख्या और अर्थ गायब हैं।

तकनीकी अंतर्दृष्टि

BLEU की संशोधित परिशुद्धता प्रत्येक उम्मीदवार एन-ग्राम गिनती को किसी भी संदर्भ में उसकी अधिकतम गिनती तक क्लिप करती है, पुनरावृत्ति गेमिंग को रोकती है; जब आउटपुट संदर्भ से छोटा होता है तो संक्षिप्तता दंड लागू होता है। ROUGE-L का सबसे लंबा-सामान्य-अनुवर्ती अंतराल की अनुमति देते हुए वाक्य-स्तरीय संरचना और शब्द क्रम को कैप्चर करता है, और ROUGE अक्सर सटीकता और रिकॉल के संयोजन से F1 की रिपोर्ट करता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

ROUGE और BLEU मूल्यांकन मेट्रिक्स का भविष्य

क्योंकि एन-ग्राम मेट्रिक्स सटीक शब्द मिलान को पुरस्कृत करते हैं, वे वैध पैराफ्रेज़ और धाराप्रवाह पुनर्लेखन को कम महत्व देते हैं, एलएलएम आउटपुट के रूप में एक बढ़ती हुई समस्या संदर्भों से शाब्दिक रूप से भिन्न होती है। BERTScore जैसे एंबेडिंग-आधारित मेट्रिक्स और BLEURT और COMET जैसे सीखे गए मेट्रिक्स, साथ ही LLM-ए-जज मूल्यांकन, तेजी से उन्हें पूरक या प्रतिस्थापित कर रहे हैं। फिर भी, ROUGE और BLEU लगभग हर पेपर में रिपोर्ट की गई तेज़, पारदर्शी आधार रेखाएँ बनी हुई हैं।

वास्तविक विश्व कार्यान्वयन

मशीनी अनुवाद शोधकर्ता सिस्टम गुणवत्ता की तुलना करने के लिए WMT बेंचमार्क पर BLEU स्कोर की रिपोर्ट करते हैं

सारांश पेपर सीएनएन/डेलीमेल डेटासेट पर ROUGE-1, ROUGE-2, और ROUGE-L की रिपोर्ट करते हैं

एक इंजीनियरिंग टीम अनुवाद मॉडल को ठीक करते समय प्रतिगमन का पता लगाने के लिए सीआई में BLEU को ट्रैक करती है

एक सारांशीकरण उत्पाद महंगा मानव मूल्यांकन चलाने से पहले एक सस्ते स्वचालित जांच के रूप में ROUGE-L का उपयोग करता है

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ROUGE and BLEU Evaluation Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

रैखिक जांच और जमे हुए फ़ीचर मूल्यांकन

अक्सर पूछे जाने वाले प्रश्नों

What is ROUGE and BLEU Evaluation Metrics?

ROUGE और BLEU मानव संदर्भों के विरुद्ध मशीन-जनित पाठ की तुलना करने के लिए वर्कहॉर्स स्वचालित मेट्रिक्स हैं। BLEU अनुवाद के लिए बनाया गया था और परिशुद्धता पर आधारित था; ROUGE को संक्षेपण और स्मरण पर आधारित होने के लिए बनाया गया था।

कौन सी मीट्रिक मूल रूप से मशीनी अनुवाद के लिए डिज़ाइन की गई थी और सटीकता पर जोर देती है?

BLEU को अनुवाद के लिए बनाया गया था और यह संक्षिप्तता दंड के साथ संशोधित एन-ग्राम परिशुद्धता पर आधारित है।

ROUGE मुख्य रूप से किस ओर उन्मुख है?

ROUGE का मतलब रिकॉल-ओरिएंटेड अंडरस्टडी फॉर गिस्टिंग इवैल्यूएशन है और इस बात पर जोर देता है कि संदर्भ का कितना हिस्सा कैप्चर किया गया है।

BLEU का संक्षिप्तता दंड क्या रोकता है?

जब उम्मीदवार संदर्भ से छोटा होता है तो संक्षिप्तता दंड BLEU को कम कर देता है, जिससे सिस्टम को संक्षिप्त आउटपुट के साथ सटीकता बढ़ाने से रोक दिया जाता है।

रूज-एल क्या मापता है?

रूज-एल सबसे लंबे सामान्य अनुवर्ती का उपयोग करता है, अंतराल की अनुमति देते हुए इन-ऑर्डर मैचों को पुरस्कृत करता है।

BLEU और ROUGE दोनों की प्रमुख साझा सीमा क्या है?

दोनों सटीक शब्द/एन-ग्राम मिलान पर भरोसा करते हैं, इसलिए वे मान्य पैराफ्रेश को कम महत्व देते हैं जो संदर्भ से शाब्दिक रूप से भिन्न होते हैं।