کیا ہوا؟
arXiv پر شائع ہونے والی ایک نئی تحقیق بڑی زبان کے ماڈلز (LLMs) میں فائن ٹیوننگ-حوصلہ افزائی کی تبدیلیوں اور کام کی کارکردگی کے لیے ذمہ دار کازل اجزاء کے درمیان تعلق کی تحقیقات کرتی ہے، جیسا کہ EAP (Edge Attribution Patching) کے ذریعے شناخت کیا گیا ہے۔
مطالعہ اس بات کا جائزہ لیتا ہے کہ کس طرح ٹھیک ٹیوننگ اندرونی میکانزم کو نئی شکل دیتی ہے، خاص طور پر توجہ کے پیٹرن اور پرت وار ایکٹیویشن پر توجہ مرکوز کرتے ہوئے۔ EAP کا استعمال کرتے ہوئے، محققین نے مخصوص اجزاء کی نشاندہی کی — جیسے توجہ کے سر اور لاگٹ سطح کے ایکٹیویشن — جو کام کی کارکردگی کو براہ راست چلاتے ہیں۔
محققین نے دریافت کیا کہ یہ کام سے متعلقہ اجزاء مخصوص تہوں کے اندر مرتکز ہوتے ہیں، جو ایک حد تک فعال لوکلائزیشن کا مشورہ دیتے ہیں۔ تاہم، وہ پرتیں جو فائن ٹیوننگ کے دوران نمایاں ترین نمائندگی کی تبدیلیوں سے گزرتی ہیں ان پرتوں کے ساتھ سیدھ میں نہیں آتیں جن میں ان کازل اجزاء ہوتے ہیں۔
مطالعہ نے کراس ٹاسک کی کارکردگی کو مزید دریافت کیا۔ اس نے پایا کہ یہاں تک کہ جب کام اپنے EAP- شناخت شدہ causal اجزاء میں اوورلیپ کی ایک اعلی ڈگری کا اشتراک کرتے ہیں، یہ مثبت کارکردگی کی منتقلی کی ضمانت نہیں دیتا ہے۔ کچھ معاملات میں، ایک کام پر فائن ٹیوننگ نے حقیقت میں دوسرے کام کی کارکردگی کو گرا دیا، اس کے باوجود کہ مشترکہ وجہ فن تعمیر ہے۔
یہ کیوں اہمیت رکھتا ہے۔
یہ تحقیق اس مفروضے کو چیلنج کرتی ہے کہ فائن ٹیوننگ کے دوران کافی اندرونی ماڈل تبدیلیاں کام کی کارکردگی کے لیے ضروری یا فائدہ مند ہیں۔ یہ ظاہر کرتے ہوئے کہ نمائندگی کی تبدیلیوں کو اکثر کازل میکانزم سے جوڑ دیا جاتا ہے، مطالعہ موجودہ تربیتی نمونوں میں ایک اہم غیر موثریت کو نمایاں کرتا ہے۔ اس سے پتہ چلتا ہے کہ فائن ٹیوننگ نادانستہ طور پر ماڈل کے استحکام میں خلل ڈال سکتی ہے، جیسا کہ اس بات کا ثبوت ہے کہ کاموں کے درمیان اوور لیپنگ کازل اجزاء مثبت منتقلی کے بجائے کارکردگی میں کمی کا باعث بن سکتے ہیں۔
کارآمد اہمیت سے نمائندگی کی تبدیلیوں کو الگ کرنے سے پتہ چلتا ہے کہ موجودہ ٹھیک ٹیوننگ کے عمل 'شور' ہوسکتے ہیں، ماڈل کے ان حصوں میں ترمیم کرتے ہیں جو مطلوبہ کام کے نتائج میں حصہ نہیں ڈالتے ہیں۔ یہ ایک نظریاتی بنیاد فراہم کرتا ہے کہ کیوں فائن ٹیوننگ تباہ کن بھول جانے یا غیر متوقع کارکردگی میں کمی کا باعث بن سکتی ہے۔
یہ پتہ لگانا کہ اوور لیپنگ کازل اجزاء کارکردگی میں کمی کا باعث بن سکتے ہیں خاص طور پر ملٹی ٹاسک لرننگ کے لیے اہم ہے۔ اس کا مطلب یہ ہے کہ کاموں کے درمیان صرف اجزاء کا اشتراک کامیابی کے لیے ناکافی ہے اور یہ کہ کاموں کی نوعیت (مثال کے طور پر، درجہ بندی بمقابلہ نسل) اس میں اہم کردار ادا کرتی ہے کہ یہ اجزاء کیسے تعامل کرتے ہیں۔
یہ کام ڈویلپرز کو ان کی فائن ٹیوننگ پائپ لائنوں کی افادیت کا بہتر انداز میں جائزہ لینے کے لیے ایک فریم ورک فراہم کرتا ہے، جو ممکنہ طور پر زیادہ موثر تربیتی طریقوں کی طرف لے جاتا ہے جو صرف سب سے زیادہ متعلقہ وجہ اجزاء میں ترمیم کرنے پر توجہ مرکوز کرتے ہیں۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
In AI, what are a model's "parameters"?
آگے کیا دیکھنا ہے۔
مزید ٹارگٹڈ فائن ٹیوننگ طریقوں میں مستقبل کی تحقیق جو وسیع نمائندگیی اپ ڈیٹس پر کارگر اجزاء کو ترجیح دیتے ہیں، اور آیا یہ نتائج مختلف ماڈل آرکیٹیکچرز میں موجود ہیں جو مطالعہ میں جانچے گئے ہیں۔
مطالعہ میں درست ماڈلز یا EAP تجزیہ کے لیے استعمال کیے گئے کوڈ کی دستیابی کی وضاحت نہیں کی گئی ہے، جس سے پریکٹیشنرز کے لیے عملی نفاذ فی الحال نامعلوم ہے۔
مبصرین کو یہ دیکھنا چاہیے کہ آیا یہ نتائج 'معیاری سے آگاہ' فائن ٹیوننگ تکنیکوں کی ترقی کا باعث بنتے ہیں جن کا مقصد غیر ضروری نمائندگی کی تبدیلیوں کو کم کرنا ہے۔
یہ دیکھنا باقی ہے کہ آیا یہ نتائج مختلف ماڈل سائز اور فن تعمیرات میں یکساں ہیں، یا اگر وہ اس تحقیق میں تجزیہ کیے گئے ماڈلز کے لیے مخصوص ہیں۔