ٹیکنیکل گائیڈ

جاری پری ٹریننگ بمقابلہ فائن ٹیوننگ

پہلے سے جاری تربیت ایک بیس ماڈل کو اسی اگلے ٹوکن مقصد کے ساتھ بڑی مقدار میں خام ڈومین ٹیکسٹ پر تربیت دیتی رہتی ہے، جب کہ طرز عمل کی شکل دینے کے لیے لیبل کی گئی مثالوں، جیسے ہدایات اور رسپانس پیئرز کے چھوٹے کیوریٹڈ سیٹ پر ٹرینوں کو ٹھیک کرنا۔

  • 4 منٹ پڑھیں
  • آخری بار اپ ڈیٹ کیا گیا۔
اس صفحہ پر4 منٹ پڑھیں
  1. جائزہ
  2. گہرا غوطہ
  3. اسٹریٹجک اثر
  4. مسلسل پری ٹریننگ بمقابلہ فائن ٹیوننگ کا مستقبل
  5. حقیقی دنیا کا نفاذ
  6. خطرات اور گارڈریلز
  7. نفاذ کا روڈ میپ
  8. دریافت کرتے رہیں
  9. اکثر پوچھے گئے سوالات

جائزہ

انتخاب اہمیت رکھتا ہے کیونکہ پہلا بنیادی طور پر اس بات کو تبدیل کرتا ہے کہ ماڈل کسی ڈومین اور اس کی زبان کے بارے میں کیا جانتا ہے، دوسرا بنیادی طور پر یہ بدلتا ہے کہ یہ کیسے جواب دیتا ہے، اور مطلوبہ ڈیٹا اور کمپیوٹ میں کافی فرق ہے۔

گہرا غوطہ

جاری پری ٹریننگ، جسے ڈومین ایڈاپٹیو پری ٹریننگ بھی کہا جاتا ہے، وہیں شروع ہوتا ہے جہاں اصل پری ٹریننگ رکی تھی۔ ماڈل ٹارگٹ ڈومین سے خام ٹیکسٹ دیکھتا ہے، جیسے میڈیکل پیپرز، سورس کوڈ یا قانونی فائلنگ، اور ہر اگلے ٹوکن کی پیشن گوئی کرنا سیکھتا ہے، بالکل اسی طرح جیسے پہلے سے تربیت میں۔ گرورنگن اور ساتھیوں نے 2020 کے پیپر ڈونٹ اسٹاپ پری ٹریننگ میں دکھایا کہ ڈومین ٹیکسٹ پر پہلے سے تربیت کے دوسرے مرحلے نے بائیو میڈیکل، کمپیوٹر سائنس، نیوز اور ریویو ڈومینز کے کاموں پر RoBERTA کو بہتر کیا۔ اسے عام طور پر متن کی بڑی مقدار، اکثر اربوں ٹوکنز، اور مکمل پیرامیٹر ٹریننگ کی ضرورت ہوتی ہے، لہذا اس کی لاگت ٹھیک ٹیوننگ سے کہیں زیادہ ہوتی ہے۔ فائن ٹیوننگ، عام طور پر زیر نگرانی فائن ٹیوننگ، فوری اور رسپانس جوڑوں کا استعمال کرتی ہے۔ نقصان کی گنتی عام طور پر صرف جوابی ٹوکنز پر کی جاتی ہے، اس لیے ماڈل سیکھتا ہے کہ ان پٹ کے بعد کیا پیدا کرنا ہے۔ ڈیٹا سیٹس کی حد چند ہزار سے لے کر سیکڑوں ہزاروں مثالوں تک ہے، اور پیرامیٹر سے موثر طریقے جیسے LoRA اسے معمولی ہارڈ ویئر پر سستی بناتے ہیں۔ یہ فارمیٹ، انداز، کام کے رویے اور ہدایات کی پیروی کرنے میں اچھا ہے۔ ترجیحی طریقے جیسے کہ RLHF یا DPO اکثر فالو کرتے ہیں۔ ایک عام پائپ لائن بیس ماڈل ہے، پھر پہلے سے تربیت جاری رکھی گئی، پھر نگرانی کی گئی فائن ٹیوننگ، پھر ترجیحی ٹیوننگ۔ مسلسل پیشگی تربیت کا ایک معروف خطرہ ہے: تباہ کن بھول جانا، جہاں عمومی مہارتیں زوال پذیر ہوتی ہیں۔ چیٹ ماڈل پر لاگو کیا جاتا ہے، یہ مندرجہ ذیل ہدایات کو بھی ختم کر سکتا ہے، لہذا ٹیمیں اکثر بیس ماڈل سے شروع ہوتی ہیں اور بعد میں انسٹرکشن ٹیوننگ کو دوبارہ کرتی ہیں۔ دو غلط فہمیاں سامنے آتی ہیں۔ سب سے پہلے، فائن ٹیوننگ بہت سے نئے حقائق کو شامل کرنے کا قابل اعتماد طریقہ نہیں ہے۔ Gekhman and colleagues (2024) جیسی تحقیق نے پایا کہ ماڈلز فائن ٹیوننگ کے ذریعے آہستہ آہستہ نئے حقائق سیکھتے ہیں اور ایسا کرنے سے فریب میں اضافہ ہو سکتا ہے۔ تیزی سے بدلتے ہوئے حقائق کے لیے، بازیافت اکثر بہتر ٹول ہوتا ہے۔ دوسرا، بلومبرگ جی پی ٹی کو بعض اوقات مسلسل پیشگی تربیت کے طور پر حوالہ دیا جاتا ہے، لیکن اسے مالی اور عمومی اعداد و شمار کے مرکب پر شروع سے تربیت دی گئی تھی۔ ایک موٹا اصول: جب ڈومین لینگویج ویب ٹیکسٹ سے بہت مختلف ہو اور بغیر لیبل والا ڈیٹا بہت زیادہ ہو تو مسلسل پیشگی تربیت کا استعمال کریں۔ جب آپ کو کسی رویے یا فارمیٹ کی ضرورت ہو تو فائن ٹیوننگ کا استعمال کریں۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

مسلسل پری ٹریننگ بمقابلہ فائن ٹیوننگ کا مستقبل

قابل اوپن بیس ماڈلز کی مستقل ریلیز نے مزید تنظیموں کے لیے مسلسل پہلے سے تربیت کو عملی بنا دیا ہے، حالانکہ اس کے لیے ابھی بھی کافی ڈیٹا اور کمپیوٹ کی ضرورت ہے۔ فعال تحقیقی شعبوں میں بھولنے کو کم کرنا، ڈومین کی موافقت کو سستا بنانا، اور الگ سے تربیت یافتہ ماڈلز سے وزن کو یکجا کرنا شامل ہے۔ عملی طور پر، بہت سی ٹیمیں مکمل طور پر جاری پری ٹریننگ کے بجائے بازیافت کے ساتھ لائٹ فائن ٹیوننگ جوڑتی رہیں گی، ان ڈومینز کے لیے بھاری آپشن محفوظ رکھیں گی جن کی زبان عام ویب ڈیٹا کے ذریعے خراب نہیں ہے۔

حقیقی دنیا کا نفاذ

کوڈ Llama کوڈ کے ایک بڑے کارپس پر Llama 2 کی تربیت جاری رکھتے ہوئے بنایا گیا تھا، اور اس کے کچھ مختلف قسموں کو Python اور مندرجہ ذیل ہدایات کے لیے مزید تربیت دی گئی تھی۔

ایک قانونی ٹیکنالوجی کمپنی جس میں لاکھوں بغیر لیبل والے معاہدوں اور فائلنگز چلتی ہیں، ماڈل کی قانونی زبان کو سنبھالنے میں بہتری لانے کے لیے پہلے سے تربیت جاری رکھتی ہے، پھر چند ہزار تشریح شدہ شق نکالنے کی مثالوں پر فائن ٹیونز۔

ایک بینک ایک چیٹ بوٹ چاہتا ہے جو سیٹ ٹون کے ساتھ ایک مقررہ JSON فارمیٹ میں جواب دیتا ہے۔ سپروائزڈ فائن ٹیوننگ، یا یہاں تک کہ احتیاط سے اشارہ کرنا کافی ہے کیونکہ ماڈل پہلے سے ہی عام مواد کو جانتا ہے۔

EPFL کے Meditron ماڈلز نے Llama 2 کو طبی کاغذات اور طبی رہنما خطوط پر جاری تربیت کے ذریعے کسی بھی کام کے لیے مخصوص فائن ٹیوننگ سے پہلے دوا میں ڈھال لیا۔

خطرات اور گارڈریلز

  • ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

  • بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

  • سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

  1. نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

  2. حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

  3. غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

  4. اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Continued Pretraining vs Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

مسلسل پری ٹریننگ بمقابلہ فائن ٹیوننگ کیا ہے؟

پہلے سے جاری تربیت ایک بیس ماڈل کو اسی اگلے ٹوکن مقصد کے ساتھ بڑی مقدار میں خام ڈومین ٹیکسٹ پر تربیت دیتی رہتی ہے، جب کہ طرز عمل کی شکل دینے کے لیے لیبل کی گئی مثالوں، جیسے ہدایات اور رسپانس پیئرز کے چھوٹے کیوریٹڈ سیٹ پر ٹرینوں کو ٹھیک کرنا۔ انتخاب اہمیت رکھتا ہے کیونکہ پہلا بنیادی طور پر اس بات کو تبدیل کرتا ہے کہ ماڈل کسی ڈومین اور اس کی زبان کے بارے میں کیا جانتا ہے، دوسرا بنیادی طور پر یہ بدلتا ہے کہ یہ کیسے جواب دیتا ہے، اور مطلوبہ ڈیٹا اور کمپیوٹ میں کافی فرق ہے۔

جاری پری ٹریننگ اور زیر نگرانی فائن ٹیوننگ کے درمیان بنیادی ڈیٹا فرق کیا ہے؟

جاری پری ٹریننگ خام متن پر اگلے ٹوکن کی پیشین گوئی کرتی ہے، جبکہ فائن ٹیوننگ پرامپٹ اور رسپانس جوڑوں سے سیکھتی ہے۔

زیر نگرانی فائن ٹیوننگ میں، نقصان کو عام طور پر کہاں شمار کیا جاتا ہے؟

پرامپٹ کو ماسک کرنے کا مطلب ہے کہ ماڈل یہ سیکھتا ہے کہ ان پٹ کو کیا پیدا کرنا ہے، نہ کہ ان پٹ کو دوبارہ پیش کرنا۔

جاری پری ٹریننگ میں ری پلے کیا ہے؟

عام اعداد و شمار کو شامل کرنے سے عام مہارتوں کو تنزلی سے بچانے میں مدد ملتی ہے جب کہ ماڈل ڈومین سیکھتا ہے۔

کوڈ Llama کیسے بنایا گیا؟

کوڈ Llama ایک مسلسل پیشگی تربیت کی مثال ہے، جس میں کچھ متغیرات Python اور ہدایات کے لیے مزید تربیت یافتہ ہیں۔

ایسے حقائق کے لیے جو اکثر بدلتے رہتے ہیں، گائیڈ کون سا نقطہ نظر تجویز کرتا ہے جو اکثر فائن ٹیوننگ سے بہتر ہے؟

فائن ٹیوننگ نئے حقائق کو آہستہ آہستہ سیکھتی ہے اور فریب میں اضافہ کر سکتی ہے، لہذا معلومات کو تبدیل کرنے کے لیے بازیافت اکثر بہتر ہوتی ہے۔