انسٹرکشن ٹیوننگ
انسٹرکشن ٹیوننگ وہ تربیتی مرحلہ ہے جو خام ٹیکسٹ پیشن گوئی کرنے والے کو ایک ایسے ماڈل میں بدل دیتا ہے جو دراصل 'اس کا خلاصہ' یا 'شائستہ جواب لکھیں' جیسی ہدایات پر عمل کرتا ہے۔ یہ وہی ہے جو ایک بیس ماڈل کو مددگار اور چلانے والا محسوس کرتا ہے۔
گہرا غوطہ
بنیادی زبان کے ماڈل کو صرف ویب ٹیکسٹ پر اگلے ٹوکن کی پیشن گوئی کرنے کے لیے تربیت دی جاتی ہے، لہذا اگر آپ کوئی سوال ٹائپ کرتے ہیں تو یہ جواب دینے کے بجائے مزید سوالات کے ساتھ جاری رہ سکتا ہے۔ انسٹرکشن ٹیوننگ اسے ٹھیک کرتی ہے۔ یہ زیر نگرانی فائن ٹیوننگ کی ایک شکل ہے: ماڈل کو ہزاروں کاموں - ترجمہ، خلاصہ، درجہ بندی، سوال و جواب، کوڈنگ اور مزید کا احاطہ کرنے والے کئی جوڑوں (ہدایت، مثالی جواب) پر تربیت دی جاتی ہے۔ ایک ہی ہدایات کے بعد مددگار جواب کے پیٹرن کو بار بار دیکھ کر، ماڈل 'جو صارف پوچھتا ہے وہ کریں' کے عمومی رویے کو سیکھتا ہے اور یہ ان ہدایات کو عام کرتا ہے جو اس نے تربیت میں کبھی نہیں دیکھا تھا۔ یہ نقطہ نظر 2021 کے آس پاس FLAN، T0، اور قدرتی ہدایات جیسے کام کے ذریعے قائم کیا گیا تھا، اور یہ OpenAI کے InstructGPT کا مرکز تھا، جس نے GPT-3 کو ہدایت کے اشارے کے کیوریٹڈ سیٹ پر ٹھیک بنایا تھا۔ یہ وہ بنیاد ہے جس پر زیادہ تر چیٹ اسسٹنٹ بنائے جاتے ہیں۔
تکنیکی بصیرت
میکانکی طور پر، انسٹرکشن ٹیوننگ معیاری زیر نگرانی سیکھنے کا کام ہے: ماڈل کے پیش گوئی شدہ ٹوکنز اور حوالہ جواب کے درمیان فرق کو کم سے کم کریں، گریڈینٹ وزن کو اپ ڈیٹ کرتے ہوئے یہ RLHF (انسانی تاثرات سے کمک سیکھنے) سے الگ ہے، جو انعام کے ماڈل کا استعمال کرتے ہوئے انسانی ترجیحات کے بعد آتا ہے اور اسے بہتر بناتا ہے۔ معمول کا نسخہ تہہ دار ہوتا ہے: پہلے سے تربیت، پھر انسٹرکشن ٹیون (SFT) ٹاسک فالونگ سکھانے کے لیے، پھر اختیاری طور پر RLHF لہجے، مدد اور حفاظت کو بہتر بنانے کے لیے۔ ڈیٹا کا تنوع سراسر حجم سے زیادہ اہمیت رکھتا ہے — وسیع ٹاسک کوریج عام ہونے کو آگے بڑھاتی ہے۔
اسٹریٹجک اثر
رفتار اور پیمانہ
زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔
رسائی اور رسائی
یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔
واضح فیصلے
ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔
انسٹرکشن ٹیوننگ کا مستقبل
یہ فیلڈ ہاتھ سے لکھے گئے بڑے ڈیٹاسیٹس سے اعلیٰ کوالٹی، جزوی طور پر مصنوعی ڈیٹا کی طرف منتقل ہو رہی ہے — بعض اوقات صرف چند ہزار احتیاط سے منتخب کردہ مثالیں — یہ جاننے کے بعد کہ ڈیٹا کا معیار مقدار کو مات دے سکتا ہے۔ مزید ڈومین سے متعلق ہدایات کی ٹیوننگ (طبی، قانونی، کوڈنگ)، کثیر لسانی اور ملٹی موڈل انسٹرکشن سیٹس، اور خودکار پائپ لائنوں کی توقع کریں جو ہدایات کے ڈیٹا کو تیار اور فلٹر کرتی ہیں۔ انسٹرکشن ٹیوننگ ایک خام پہلے سے تربیت یافتہ ماڈل اور قابل استعمال اسسٹنٹ کے درمیان ضروری پل رہے گا، جو تیزی سے صف بندی کے لیے ترجیحی اصلاح کے ساتھ مل جائے گا۔
حقیقی دنیا کا نفاذ
ایک بنیادی GPT طرز کے ماڈل کو چیٹ اسسٹنٹ میں تبدیل کرنا جو سوالات کی بازگشت کے بجائے جواب دیتا ہے۔
FLAN-T5، بہت سے کاموں میں ٹھیک ترتیب دیا گیا ہے تاکہ یہ ان ہدایات پر عمل کر سکے جن پر اسے کبھی واضح طور پر تربیت نہیں دی گئی تھی۔
InstructGPT، جہاں GPT-3 کو زیادہ مددگار جوابات پیدا کرنے کے لیے کیوریٹڈ پرامپٹس پر ہدایات کے مطابق بنایا گیا تھا۔
سپورٹ اور قانونی ٹیموں کی طرف سے لکھے گئے انسٹرکشن رسپانس جوڑوں پر فائن ٹیوننگ کے ذریعے ایک اندرونی کمپنی اسسٹنٹ بنانا
خطرات اور گارڈریلز
گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔
فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔
اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔
نفاذ کا روڈ میپ
رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔
جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔
ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔
ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Instruction Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
پریفکس ٹیوننگ
اکثر پوچھے گئے سوالات
What is Instruction Tuning?
انسٹرکشن ٹیوننگ وہ تربیتی مرحلہ ہے جو خام ٹیکسٹ پیشن گوئی کرنے والے کو ایک ایسے ماڈل میں بدل دیتا ہے جو دراصل 'اس کا خلاصہ' یا 'شائستہ جواب لکھیں' جیسی ہدایات پر عمل کرتا ہے۔ یہ وہی ہے جو ایک بیس ماڈل کو مددگار اور چلانے والا محسوس کرتا ہے۔
انسٹرکشن ٹیوننگ RLHF سے کیسے مختلف ہے؟
انسٹرکشن ٹیوننگ ہدف کے جوابات پر سیکھنے کی نگرانی کی جاتی ہے۔ RLHF بعد میں آتا ہے اور سیکھی ہوئی انسانی ترجیحات کے خلاف ماڈل کو بہتر بناتا ہے۔
انسٹرکشن ٹیوننگ ڈیٹا کی کون سی خاصیت زیادہ تر ماڈل کی نئی، غیر دیکھی ہدایات پر عمل کرنے کی صلاحیت کو آگے بڑھاتی ہے؟
مختلف قسم کے کاموں کا احاطہ کرنا مندرجہ ذیل ہدایات کے عمومی رویے کو سکھاتا ہے، جو تربیت میں کبھی نہیں دیکھی گئی ہدایات کو عام کرتا ہے۔
جدید چیٹ اسسٹنٹ کے لیے تربیتی مراحل کا عام ترتیب کون سا ہے؟
ماڈلز کو پہلے خام متن پر پہلے سے تربیت دی جاتی ہے، پھر کاموں کی پیروی کرنے کے لیے ہدایات کے مطابق بنایا جاتا ہے، اور اکثر لہجے اور حفاظت کے لیے RLHF سے بہتر کیا جاتا ہے۔