زبان AI گائیڈ

ریجیکشن سیمپلنگ فائن ٹیوننگ

Rejection Sampling Fine-Tuning (RFT) امیدواروں کے بہت سے جوابات تیار کرتا ہے، صرف بہترین اسکور کرنے والے کو ہی رکھتا ہے، اور ان جیتنے والوں کو ماڈل کو دوبارہ تربیت دیتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

گہرا غوطہ

ریجیکشن سیمپلنگ فائن ٹیوننگ، جسے بعض اوقات بیسٹ-آف-این فائن ٹیوننگ کہا جاتا ہے، Meta کے Llama 2 اور Llama 3 جیسے ماڈلز کو کس طرح منسلک کیا گیا اس میں ایک کلیدی جزو ہے۔ نسخہ آسان ہے: ہر ایک پرامپٹ کے لیے، موجودہ ماڈل سے کئی جوابات (4 سے 64 بولیں) کا نمونہ لیں، ہر ایک کو انعامی ماڈل یا خودکار چیکر کے ساتھ اسکور کریں، پھر سب سے اوپر والے آؤٹ پٹس کے علاوہ باقی سب کو رد ('رد کریں') کریں۔ زندہ بچ جانے والے اعلیٰ معیار کے نمونے ایک تازہ نگرانی شدہ فائن ٹیوننگ ڈیٹاسیٹ بن جاتے ہیں، اور ماڈل کو ان پر عام اگلے ٹوکن نقصان کے ساتھ تربیت دی جاتی ہے۔ اس لوپ کو دہرانے سے ماڈل خود ہی بہتر جوابات پیدا کرنے کی طرف جھک جاتا ہے۔ چونکہ ماڈل اپنے فلٹر شدہ آؤٹ پٹس سے سیکھتا ہے، RFT پالیسی گریڈینٹ RL کے عدم استحکام اور سر درد سے بچتا ہے جبکہ ابھی بھی انعامی سگنل کا فائدہ اٹھاتا ہے۔

تکنیکی بصیرت

RFT اس حقیقت کا فائدہ اٹھاتا ہے کہ کئی بار نمونے لینے اور زیادہ سے زیادہ انعام کے جواب کو برقرار رکھنا تیز، اعلیٰ معیار کی تقسیم سے منتخب ہونے کے قریب ہے۔ معیاری کراس اینٹروپی کے ذریعے ان جیتنے والوں کی تربیت مؤثر طریقے سے ماڈل کے واحد نمونے کے آؤٹ پٹس میں بہترین-ایف-این رویے کو واپس لے جاتی ہے۔ ریاضی یا کوڈ جیسے قابل تصدیق ڈومینز کے لیے، 'انعام' صرف یہ ہو سکتا ہے کہ حتمی جواب ہو یا یونٹ ٹیسٹ پاس ہو، سیکھے ہوئے انعامی ماڈل کی ضرورت کو مکمل طور پر ختم کر دیں۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

ریجیکشن سیمپلنگ فائن ٹیوننگ کا مستقبل

RFT جدید پوسٹ ٹریننگ میں مرکزی حیثیت رکھتا ہے، جو اکثر PPO اور DPO جیسے RL طریقوں سے پہلے یا اس کے ساتھ استعمال ہوتا ہے۔ اس کی اپیل سستے تخمینے اور مضبوط خودکار تصدیق کنندگان کے ساتھ بڑھتی ہے: جیسا کہ ماڈل خود پیدا کرنے اور خود جانچنے میں بہتر ہوتے ہیں، اعادہ شدہ رد کرنے کے نمونے مصنوعی ڈیٹا اور خود کو بہتر بنانے والے لوپس کو سپورٹ کرتے ہیں۔ استدلال کے ماڈلز کے ساتھ سخت انضمام کی توقع کریں جو سوچ کی قابل تصدیق زنجیریں پیدا کرتے ہیں، اور ماڈل کے اپنے آؤٹ پٹس پر بار بار تربیت کرتے وقت انعام کی ہیکنگ اور تنوع کے خاتمے سے کیسے بچنا ہے اس کا جاری مطالعہ۔

حقیقی دنیا کا نفاذ

فی پرامپٹ متعدد جوابات کے نمونے لے کر لاما طرز کے ماڈلز کو سیدھ میں لانا، سب سے زیادہ انعامی ماڈل کے اسکور کو برقرار رکھنا، پھر ان پر SFT

بہت سے حل تیار کرکے اور صرف صحیح، قابل جانچ جواب تک پہنچنے والے کو برقرار رکھ کر ریاضی کے حل کرنے والے کو بہتر بنانا

کوڈ جنریشن جہاں امیدواروں کو صرف اس صورت میں رکھا جاتا ہے جب وہ یونٹ ٹیسٹ پاس کرتے ہیں، پھر اسے تربیتی ڈیٹا کے طور پر استعمال کیا جاتا ہے۔

اگلے ٹریننگ راؤنڈ کے لیے ماڈل کے اپنے بہترین خود پیدا کردہ جوابات کو فلٹر کر کے مصنوعی انسٹرکشن ڈیٹا سیٹس بنانا

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

QLoRA اور 4 بٹ فائن ٹیوننگ

اکثر پوچھے گئے سوالات

What is Rejection Sampling Fine-Tuning?

Rejection Sampling Fine-Tuning (RFT) امیدواروں کے بہت سے جوابات تیار کرتا ہے، صرف بہترین اسکور کرنے والے کو ہی رکھتا ہے، اور ان جیتنے والوں کو ماڈل کو دوبارہ تربیت دیتا ہے۔ یہ اہمیت رکھتا ہے کیونکہ یہ پیچیدہ کمک سیکھنے کی بجائے براہ راست زیر نگرانی سیکھنے کا استعمال کرتے ہوئے RLHF کا زیادہ تر فائدہ پیش کرتا ہے۔

Rejection Sampling Fine-Tuning کا بنیادی خیال کیا ہے؟

RFT متعدد جوابات کے نمونے، سب سے زیادہ اسکور کرنے والے کو فلٹر کرتا ہے، اور ان جیتنے والوں پر ماڈل کو ٹھیک کرتا ہے۔

ریاضی یا کوڈ جیسے قابل تصدیق ڈومینز میں، انعام کے طور پر کیا کام کر سکتا ہے؟

جانچ کے قابل کاموں کے لیے، RFT ایک سیکھے ہوئے انعامی ماڈل سے گریز کرتے ہوئے، قطعی درستگی یا یونٹ ٹیسٹ پاس کر سکتا ہے۔

کس ماڈل فیملی نے سیدھ کے دوران ریجیکشن سیمپلنگ کا مشہور استعمال کیا؟

Meta نے Llama 2 اور Llama 3 ماڈلز کے لیے پوسٹ ٹریننگ ترکیب کے حصے کے طور پر مسترد ہونے کے نمونے استعمال کرنے کی وضاحت کی۔

ٹیمیں PPO جیسے پالیسی گریڈینٹ RL پر RFT کو کیوں ترجیح دے سکتی ہیں؟

RFT فلٹر شدہ نمونوں پر معیاری اگلے ٹوکن نقصان کے ساتھ دوبارہ تربیت دیتا ہے، ٹیوننگ کی دشواری اور پالیسی-گریڈینٹ طریقوں کی عدم استحکام کو پس پشت ڈالتا ہے۔

زیادہ سے زیادہ انعام کے نمونوں پر تربیت مؤثر طریقے سے کیا کرتی ہے؟

سب سے اوپر فلٹر شدہ جوابات سے سیکھ کر، ماڈل ایک نسل میں اعلیٰ معیار کے رویے کو اندرونی بناتا ہے۔