ٹیکنیکل گائیڈ

ROUGE اور BLEU تشخیصی میٹرکس

ROUGE اور BLEU مشین سے تیار کردہ متن کا انسانی حوالوں سے موازنہ کرنے کے لیے ورک ہارس آٹومیٹک میٹرکس ہیں۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

BLEU was built for translation and leans on precision; ROUGE was built for summarization and leans on recall.

گہرا غوطہ

دونوں میٹرکس امیدوار کے متن اور ایک یا زیادہ حوالہ جات کے درمیان n-gram اوورلیپ کی پیمائش کرتے ہیں، لیکن وہ مختلف سمتوں پر زور دیتے ہیں۔ BLEU (دو لسانی تشخیص انڈر اسٹڈی) ترمیم شدہ n-گرام درستگی کی گنتی کرتا ہے (عام طور پر 1- سے 4-گرام)، ان کو ہندسی طور پر ضرب دیتا ہے، اور اختصار کا جرمانہ لاگو کرتا ہے تاکہ کوئی نظام بہت مختصر آؤٹ پٹ پیدا کر کے اسکور کو گیم نہ کر سکے۔ ROUGE (Recal-Oriented Understudy for Gisting Evaluation) اس کے بجائے یاد کرنے کی حمایت کرتا ہے: ROUGE-N اوور لیپنگ n-grams کو شمار کرتا ہے، ROUGE-L ان آرڈر میچوں کو انعام دینے کے لیے سب سے لمبے لمبے عام سیکوئینس کا استعمال کرتا ہے بغیر کسی مطابقت کی ضرورت کے۔ BLEU پوچھتا ہے کہ 'نظام نے جو کہا ہے اس میں سے کتنا درست ہے؟' جبکہ ROUGE پوچھتا ہے کہ 'سسٹم نے کتنا حوالہ حاصل کیا؟'۔ دونوں سستے اور دوبارہ پیدا کرنے کے قابل ہیں لیکن صرف سطحی لفظ اوورلیپ، لاپتہ پیرا فریز اور معنی دیکھیں۔

تکنیکی بصیرت

BLEU کی ترمیم شدہ درستگی ہر امیدوار کے n-gram کی گنتی کو کسی بھی حوالے سے اس کی زیادہ سے زیادہ گنتی تک لے جاتی ہے، تکرار گیمنگ کو روکتی ہے۔ اختصار کا جرمانہ اس وقت شروع ہوتا ہے جب آؤٹ پٹ ریفرنس سے چھوٹا ہوتا ہے۔ ROUGE-L کا سب سے لمبا کامن-Subsequence جملے کی سطح کے ڈھانچے اور الفاظ کی ترتیب کو پکڑتا ہے جبکہ فرق کو اجازت دیتا ہے، اور ROUGE اکثر F1 کی درستگی اور یاد کو ملا کر رپورٹ کرتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

ROUGE اور BLEU تشخیصی میٹرکس کا مستقبل

چونکہ n-gram میٹرکس صحیح الفاظ کے مماثلت کا بدلہ دیتے ہیں، اس لیے وہ درست پیرا فریسز اور روانی سے دوبارہ لکھنے کو کم اہمیت دیتے ہیں، یہ ایک بڑھتا ہوا مسئلہ ہے کیونکہ LLM آؤٹ پٹ حوالہ جات سے لفظی طور پر ہٹ جاتے ہیں۔ ایمبیڈنگ پر مبنی میٹرکس جیسے BERTScore اور سیکھے گئے میٹرکس جیسے BLEURT اور COMET کے علاوہ LLM-بطور جج تشخیص، تیزی سے ان کی تکمیل یا جگہ لے رہے ہیں۔ پھر بھی، ROUGE اور BLEU برقرار ہیں جیسا کہ تیز، شفاف بیس لائنز تقریباً ہر پیپر میں رپورٹ کی گئی ہیں۔

حقیقی دنیا کا نفاذ

مشینی ترجمہ کے محققین سسٹم کے معیار کا موازنہ کرنے کے لیے WMT بینچ مارکس پر BLEU سکور کی اطلاع دیتے ہیں۔

خلاصہ کے کاغذات CNN/DailyMail ڈیٹاسیٹ پر ROUGE-1، ROUGE-2، اور ROUGE-L کی رپورٹ کرتے ہیں

ایک انجینئرنگ ٹیم ترجمے کے ماڈل کو ٹھیک کرتے وقت رجعت کا پتہ لگانے کے لیے CI میں BLEU کو ٹریک کرتی ہے۔

ایک خلاصہ پروڈکٹ ROUGE-L کو ایک سستے خودکار چیک کے طور پر استعمال کرتا ہے اس سے پہلے کہ مہنگی انسانی تشخیص کو چلایا جائے

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ROUGE and BLEU Evaluation Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

لکیری تحقیقات اور منجمد خصوصیت کی تشخیص

اکثر پوچھے گئے سوالات

What is ROUGE and BLEU Evaluation Metrics?

ROUGE اور BLEU مشین سے تیار کردہ متن کا انسانی حوالوں سے موازنہ کرنے کے لیے ورک ہارس آٹومیٹک میٹرکس ہیں۔ BLEU ترجمہ کے لیے بنایا گیا تھا اور درستگی پر جھکاؤ رکھتا تھا۔ ROUGE کو خلاصہ کرنے اور یاد کرنے پر جھکاؤ کے لیے بنایا گیا تھا۔

کون سا میٹرک اصل میں مشینی ترجمہ کے لیے ڈیزائن کیا گیا تھا اور درستگی پر زور دیتا ہے؟

BLEU کو ترجمے کے لیے بنایا گیا تھا اور اختصار کے جرمانے کے ساتھ ترمیم شدہ n-gram precision پر مبنی ہے۔

ROUGE بنیادی طور پر کس طرف ہے؟

ROUGE کا مطلب ہے Recall-Oriented Understudy for Gisting Evaluation اور اس بات پر زور دیتا ہے کہ کتنا حوالہ حاصل کیا گیا ہے۔

BLEU کا مختصر جرمانہ کیا روکتا ہے؟

اختصار کا جرمانہ BLEU کو کم کرتا ہے جب امیدوار حوالہ سے چھوٹا ہوتا ہے، جس سے نظام کو مختصر پیداوار کے ساتھ درستگی کو بڑھانے سے روکتا ہے۔

ROUGE-L کیا پیمائش کرتا ہے؟

ROUGE-L سب سے طویل عام سیکوئینس کا استعمال کرتا ہے، وقفے کی اجازت دیتے ہوئے ان آرڈر میچوں کو انعام دیتا ہے۔

BLEU اور ROUGE دونوں کی کلیدی مشترکہ حد کیا ہے؟

دونوں درست لفظ/این-گرام مماثلت پر انحصار کرتے ہیں، اس لیے وہ درست پیرا فریسز کو کم اہمیت دیتے ہیں جو حوالہ سے لغوی طور پر مختلف ہیں۔