اگلااگلا گائیڈ
فائن ٹیوننگ بمقابلہ آر اے جی بمقابلہ پرامٹنگ
زبان AI
ٹیکنیکل گائیڈ
پہلے سے جاری تربیت ایک بیس ماڈل کو اسی اگلے ٹوکن مقصد کے ساتھ بڑی مقدار میں خام ڈومین ٹیکسٹ پر تربیت دیتی رہتی ہے، جب کہ طرز عمل کی شکل دینے کے لیے لیبل کی گئی مثالوں، جیسے ہدایات اور رسپانس پیئرز کے چھوٹے کیوریٹڈ سیٹ پر ٹرینوں کو ٹھیک کرنا۔
انتخاب اہمیت رکھتا ہے کیونکہ پہلا بنیادی طور پر اس بات کو تبدیل کرتا ہے کہ ماڈل کسی ڈومین اور اس کی زبان کے بارے میں کیا جانتا ہے، دوسرا بنیادی طور پر یہ بدلتا ہے کہ یہ کیسے جواب دیتا ہے، اور مطلوبہ ڈیٹا اور کمپیوٹ میں کافی فرق ہے۔
جاری پری ٹریننگ، جسے ڈومین ایڈاپٹیو پری ٹریننگ بھی کہا جاتا ہے، وہیں شروع ہوتا ہے جہاں اصل پری ٹریننگ رکی تھی۔ ماڈل ٹارگٹ ڈومین سے خام ٹیکسٹ دیکھتا ہے، جیسے میڈیکل پیپرز، سورس کوڈ یا قانونی فائلنگ، اور ہر اگلے ٹوکن کی پیشن گوئی کرنا سیکھتا ہے، بالکل اسی طرح جیسے پہلے سے تربیت میں۔ گرورنگن اور ساتھیوں نے 2020 کے پیپر ڈونٹ اسٹاپ پری ٹریننگ میں دکھایا کہ ڈومین ٹیکسٹ پر پہلے سے تربیت کے دوسرے مرحلے نے بائیو میڈیکل، کمپیوٹر سائنس، نیوز اور ریویو ڈومینز کے کاموں پر RoBERTA کو بہتر کیا۔ اسے عام طور پر متن کی بڑی مقدار، اکثر اربوں ٹوکنز، اور مکمل پیرامیٹر ٹریننگ کی ضرورت ہوتی ہے، لہذا اس کی لاگت ٹھیک ٹیوننگ سے کہیں زیادہ ہوتی ہے۔ فائن ٹیوننگ، عام طور پر زیر نگرانی فائن ٹیوننگ، فوری اور رسپانس جوڑوں کا استعمال کرتی ہے۔ نقصان کی گنتی عام طور پر صرف جوابی ٹوکنز پر کی جاتی ہے، اس لیے ماڈل سیکھتا ہے کہ ان پٹ کے بعد کیا پیدا کرنا ہے۔ ڈیٹا سیٹس کی حد چند ہزار سے لے کر سیکڑوں ہزاروں مثالوں تک ہے، اور پیرامیٹر سے موثر طریقے جیسے LoRA اسے معمولی ہارڈ ویئر پر سستی بناتے ہیں۔ یہ فارمیٹ، انداز، کام کے رویے اور ہدایات کی پیروی کرنے میں اچھا ہے۔ ترجیحی طریقے جیسے کہ RLHF یا DPO اکثر فالو کرتے ہیں۔ ایک عام پائپ لائن بیس ماڈل ہے، پھر پہلے سے تربیت جاری رکھی گئی، پھر نگرانی کی گئی فائن ٹیوننگ، پھر ترجیحی ٹیوننگ۔ مسلسل پیشگی تربیت کا ایک معروف خطرہ ہے: تباہ کن بھول جانا، جہاں عمومی مہارتیں زوال پذیر ہوتی ہیں۔ چیٹ ماڈل پر لاگو کیا جاتا ہے، یہ مندرجہ ذیل ہدایات کو بھی ختم کر سکتا ہے، لہذا ٹیمیں اکثر بیس ماڈل سے شروع ہوتی ہیں اور بعد میں انسٹرکشن ٹیوننگ کو دوبارہ کرتی ہیں۔ دو غلط فہمیاں سامنے آتی ہیں۔ سب سے پہلے، فائن ٹیوننگ بہت سے نئے حقائق کو شامل کرنے کا قابل اعتماد طریقہ نہیں ہے۔ Gekhman and colleagues (2024) جیسی تحقیق نے پایا کہ ماڈلز فائن ٹیوننگ کے ذریعے آہستہ آہستہ نئے حقائق سیکھتے ہیں اور ایسا کرنے سے فریب میں اضافہ ہو سکتا ہے۔ تیزی سے بدلتے ہوئے حقائق کے لیے، بازیافت اکثر بہتر ٹول ہوتا ہے۔ دوسرا، بلومبرگ جی پی ٹی کو بعض اوقات مسلسل پیشگی تربیت کے طور پر حوالہ دیا جاتا ہے، لیکن اسے مالی اور عمومی اعداد و شمار کے مرکب پر شروع سے تربیت دی گئی تھی۔ ایک موٹا اصول: جب ڈومین لینگویج ویب ٹیکسٹ سے بہت مختلف ہو اور بغیر لیبل والا ڈیٹا بہت زیادہ ہو تو مسلسل پیشگی تربیت کا استعمال کریں۔ جب آپ کو کسی رویے یا فارمیٹ کی ضرورت ہو تو فائن ٹیوننگ کا استعمال کریں۔
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
قابل اوپن بیس ماڈلز کی مستقل ریلیز نے مزید تنظیموں کے لیے مسلسل پہلے سے تربیت کو عملی بنا دیا ہے، حالانکہ اس کے لیے ابھی بھی کافی ڈیٹا اور کمپیوٹ کی ضرورت ہے۔ فعال تحقیقی شعبوں میں بھولنے کو کم کرنا، ڈومین کی موافقت کو سستا بنانا، اور الگ سے تربیت یافتہ ماڈلز سے وزن کو یکجا کرنا شامل ہے۔ عملی طور پر، بہت سی ٹیمیں مکمل طور پر جاری پری ٹریننگ کے بجائے بازیافت کے ساتھ لائٹ فائن ٹیوننگ جوڑتی رہیں گی، ان ڈومینز کے لیے بھاری آپشن محفوظ رکھیں گی جن کی زبان عام ویب ڈیٹا کے ذریعے خراب نہیں ہے۔
کوڈ Llama کوڈ کے ایک بڑے کارپس پر Llama 2 کی تربیت جاری رکھتے ہوئے بنایا گیا تھا، اور اس کے کچھ مختلف قسموں کو Python اور مندرجہ ذیل ہدایات کے لیے مزید تربیت دی گئی تھی۔
ایک قانونی ٹیکنالوجی کمپنی جس میں لاکھوں بغیر لیبل والے معاہدوں اور فائلنگز چلتی ہیں، ماڈل کی قانونی زبان کو سنبھالنے میں بہتری لانے کے لیے پہلے سے تربیت جاری رکھتی ہے، پھر چند ہزار تشریح شدہ شق نکالنے کی مثالوں پر فائن ٹیونز۔
ایک بینک ایک چیٹ بوٹ چاہتا ہے جو سیٹ ٹون کے ساتھ ایک مقررہ JSON فارمیٹ میں جواب دیتا ہے۔ سپروائزڈ فائن ٹیوننگ، یا یہاں تک کہ احتیاط سے اشارہ کرنا کافی ہے کیونکہ ماڈل پہلے سے ہی عام مواد کو جانتا ہے۔
EPFL کے Meditron ماڈلز نے Llama 2 کو طبی کاغذات اور طبی رہنما خطوط پر جاری تربیت کے ذریعے کسی بھی کام کے لیے مخصوص فائن ٹیوننگ سے پہلے دوا میں ڈھال لیا۔
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
پہلے سے جاری تربیت ایک بیس ماڈل کو اسی اگلے ٹوکن مقصد کے ساتھ بڑی مقدار میں خام ڈومین ٹیکسٹ پر تربیت دیتی رہتی ہے، جب کہ طرز عمل کی شکل دینے کے لیے لیبل کی گئی مثالوں، جیسے ہدایات اور رسپانس پیئرز کے چھوٹے کیوریٹڈ سیٹ پر ٹرینوں کو ٹھیک کرنا۔ انتخاب اہمیت رکھتا ہے کیونکہ پہلا بنیادی طور پر اس بات کو تبدیل کرتا ہے کہ ماڈل کسی ڈومین اور اس کی زبان کے بارے میں کیا جانتا ہے، دوسرا بنیادی طور پر یہ بدلتا ہے کہ یہ کیسے جواب دیتا ہے، اور مطلوبہ ڈیٹا اور کمپیوٹ میں کافی فرق ہے۔
جاری پری ٹریننگ خام متن پر اگلے ٹوکن کی پیشین گوئی کرتی ہے، جبکہ فائن ٹیوننگ پرامپٹ اور رسپانس جوڑوں سے سیکھتی ہے۔
پرامپٹ کو ماسک کرنے کا مطلب ہے کہ ماڈل یہ سیکھتا ہے کہ ان پٹ کو کیا پیدا کرنا ہے، نہ کہ ان پٹ کو دوبارہ پیش کرنا۔
عام اعداد و شمار کو شامل کرنے سے عام مہارتوں کو تنزلی سے بچانے میں مدد ملتی ہے جب کہ ماڈل ڈومین سیکھتا ہے۔
کوڈ Llama ایک مسلسل پیشگی تربیت کی مثال ہے، جس میں کچھ متغیرات Python اور ہدایات کے لیے مزید تربیت یافتہ ہیں۔
فائن ٹیوننگ نئے حقائق کو آہستہ آہستہ سیکھتی ہے اور فریب میں اضافہ کر سکتی ہے، لہذا معلومات کو تبدیل کرنے کے لیے بازیافت اکثر بہتر ہوتی ہے۔
سیکھتے رہیں
اس موضوع کے لیے مزید گائیڈز چنے گئے ہیں۔
اگلااگلا گائیڈ
فائن ٹیوننگ بمقابلہ آر اے جی بمقابلہ پرامٹنگ
زبان AI