کیا ہوا؟
ایک arXiv پیپر Agentic Tool Unlearning متعارف کراتا ہے، ایک ایسا فریم ورک جو زبان کے ماڈل ایجنٹوں کے لیے ڈیزائن کیا گیا ہے جو بیرونی ٹولز کو کال کر سکتا ہے۔ مصنفین کا استدلال ہے کہ روایتی غیر سیکھنے سے ایجنٹ کو ویب تلاش، بازیافت یا ڈیٹا بیس کی تلاش کے ذریعے وہی معلومات بازیافت کرنے سے روکے بغیر ماڈل کی معلومات کی براہ راست واپسی کو روک سکتا ہے۔
کاغذ ناکامی کے موڈ کی وضاحت کرتا ہے جسے ٹول کے ذریعے ثالثی کی بحالی کہتے ہیں۔ روایتی زبان کے ماڈل میں، عام طور پر غیر سیکھنے کا اندازہ اس جانچ کے ذریعے کیا جاتا ہے کہ آیا ماڈل اب بھی اپنے پیرامیٹرز سے مقرر کردہ ہدف کو براہ راست یاد کر سکتا ہے۔ مصنفین کا استدلال ہے کہ یہ تشخیص ایسے ایجنٹ کے لیے نامکمل ہے جس کا جواب ٹول کالز اور بیرونی مشاہدات پر منحصر ہو سکتا ہے۔ ایسا ایجنٹ میموری سے ہدف بیان کرنے میں ناکام ہو سکتا ہے لیکن ایک بیرونی ذریعہ سے وہی معلومات حاصل کر سکتا ہے۔ امتیاز اہم ہے کیونکہ قابل مشاہدہ جواب دستیاب رہ سکتا ہے یہاں تک کہ جب ماڈل کا اندرونی ردعمل تبدیل ہو گیا ہو۔ اس ترتیب میں، اس کے اعمال کا اندازہ کیے بغیر ماڈل کا جائزہ لینے سے وہ راستہ چھوٹ سکتا ہے جس سے ہدف کو بازیافت کیا جاتا ہے۔
مجوزہ طریقہ، Agentic Tool Unlearning کے دو مراحل ہیں۔ سب سے پہلے، نظام پیرامیٹرک علم غیر سیکھنے کا اطلاق کرتا ہے جس کا مقصد براہ راست یاد کو دبانا ہے۔ دوسرا، یہ نقلی ٹول سے بڑھے ہوئے ماحول میں ٹریجیکٹری لیول کمک سیکھنے کا استعمال کرتا ہے۔ مقالے کے خلاصہ کے مطابق، یہ مرحلہ ہدف تلاش کرنے والے ٹول کے رویے اور حتمی جواب میں رساو دونوں کو سزا دیتا ہے۔ مقصد یہ ہے کہ ایجنٹ کے اعمال کے ذریعے بحالی کو کم کیا جائے، نہ کہ صرف ماڈل وزن میں تبدیلی کے ذریعے۔ یہ ایجنٹ کے فیصلوں کی ترتیب کو غیر سیکھنے کے مسئلے کا حصہ بناتا ہے، بشمول معلومات حاصل کرنے کا انتخاب اور جس طرح سے حاصل کردہ مواد کو جواب میں شامل کیا جاتا ہے۔
مصنفین RWKU اور MUSE کے مختلف لینگویج ماڈل آرکیٹیکچرز میں غیر لرننگ بینچ مارکس پر تجربات کی رپورٹ کرتے ہیں۔ ان کا کہنا ہے کہ یہ طریقہ متعین ہدف کو بھول جانے اور علم کے لیے عام افادیت کو برقرار رکھنے کے درمیان بہتر توازن حاصل کرتا ہے جو دستیاب رہنا چاہیے۔ فراہم کردہ ذریعہ عددی نتائج، ماڈل کے نام، تربیتی اخراجات، بنیادی موازنہ یا نقلی ٹولز کی تفصیلات فراہم نہیں کرتا ہے، لہذا رپورٹ کردہ بہتری کی طاقت اور گنجائش کا اندازہ صرف خلاصہ سے نہیں لگایا جا سکتا۔ ان کوتاہیوں کے نتیجے میں رپورٹ شدہ تجربات کے ساتھ ایک تحقیقی تجویز کے طور پر سب سے بہتر سمجھا جاتا ہے، بجائے اس کے کہ اس بات کے ثبوت کے طور پر کہ اپروچ کو تعینات نظاموں میں درست کیا گیا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
یہ مقالہ ان سسٹمز کے لیے ایک عملی سیکیورٹی اور رازداری کے مسئلے کو اجاگر کرتا ہے جو زبان کے ماڈلز کو بیرونی ٹولز کے ساتھ جوڑتے ہیں۔ ماڈل کے پیرامیٹرز سے علم کو ہٹانا کافی نہیں ہو سکتا اگر کوئی ایجنٹ اب بھی اپنے ارد گرد کے ٹولز کے ذریعے ہدف کو تلاش کر سکتا ہے یا اس کی تشکیل نو کر سکتا ہے۔
تلاش کرنا اہمیت رکھتا ہے کیونکہ ٹول تک رسائی AI سسٹم کے لیے کچھ بھول جانے کا مطلب بدل دیتی ہے۔ ایک ماڈل اب معلومات کے کسی ٹکڑے کو براہ راست انکوڈ یا دوبارہ پیش نہیں کرسکتا ہے، پھر بھی مکمل ایجنٹ اسے کسی مربوط ڈیٹا بیس کی تلاش، بازیافت یا استفسار کرکے تیار کرسکتا ہے۔ ذاتی، ملکیتی یا دوسری صورت میں محدود معلومات کو ہینڈل کرنے والے سسٹمز کے لیے، تشخیص کی متعلقہ اکائی الگ تھلگ ماڈل کے بجائے مکمل ایجنٹ ورک فلو ہو سکتی ہے۔ یہ وسیع تر نظریہ پورے راستے کے ذریعے معلومات کی پیروی کرتا ہے جو ماڈل کے پیرامیٹرز کو واحد ممکنہ ذریعہ ماننے کے بجائے جواب پیدا کر سکتا ہے۔
اس امتیاز کے بھی مضمرات ہیں کہ تنظیمیں حذف یا ہٹانے کے دعووں کی تشریح کیسے کرتی ہیں۔ اگر کسی درخواست کا مقصد کسی ایجنٹ کو ایک خاص ہدف پیدا کرنے سے روکنا ہے، تو صرف ماڈل کے پیرامیٹرز میں ترمیم کرنے سے متبادل راستہ کھلا رہ سکتا ہے۔ کاغذ یہ ثابت نہیں کرتا ہے کہ کوئی بھی تعینات کیا گیا نظام فی الحال اس طرح ناکام ہو جاتا ہے، لیکن یہ جانچ کے لیے ایک ٹھوس تشخیصی فریم پیش کرتا ہے کہ آیا ایجنٹ کے اوزار غیر سیکھنے کے طریقہ کار کو نقصان پہنچاتے ہیں۔ یہ فریم اس تبدیلی کو الگ کرنے میں مدد کرسکتا ہے جو ماڈل کو اس تبدیلی سے یاد کرتا ہے جو جمع شدہ نظام اب بھی حاصل کرسکتا ہے۔ یہ ہٹانے کے دعوے کے دائرہ کار کو بھی اس رویے سے منسلک رکھتا ہے جس کا صارفین حقیقت میں مشاہدہ کر سکتے ہیں۔
مجوزہ مقصد میں ایک مشکل انجینئرنگ ٹریڈ آف ہے۔ ایجنٹ کے لیے اس معلومات کے بارے میں سوالات کے جوابات دینے کے لیے ٹول کا استعمال اکثر ضروری ہوتا ہے جو اسے برقرار رکھنا ہے۔ بہت زیادہ ٹول تلاش کرنے پر سزا دینے سے مفید رویے کو نقصان پہنچ سکتا ہے، جبکہ بہت کم سزا دینے سے بھولے ہوئے ہدف کی بازیابی ممکن ہو سکتی ہے۔ مقالے کا بیان کردہ علم کو برقرار رکھنے کا مقصد اس تجارت کو واضح کرتا ہے، لیکن ماخذ یہ نہیں دکھاتا ہے کہ نقطہ نظر مبہم درخواستوں، بالواسطہ سوالات یا اوور لیپنگ معلومات پر مشتمل ٹولز کو کتنی اچھی طرح سے ہینڈل کرتا ہے۔ اس لیے ایک مفید طریقہ کو لازمی طور پر ناپسندیدہ راستے کو روکنا چاہیے جب کہ ٹول کے جائز استعمال کی حمایت جاری رکھیں، ایسا توازن جس کا اندازہ صرف خلاصہ سے نہیں لگایا جا سکتا۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
آگے کیا دیکھنا ہے۔
مرکزی سوال یہ ہے کہ آیا رپورٹ شدہ طریقہ کاغذ کے نقلی ماحول اور معیارات سے آگے بڑھتا ہے۔ ٹارگٹ کی معلومات، ٹول کنفیگریشنز، ماڈل آرکیٹیکچرز، ناپے گئے تجارتی معاہدوں کے بارے میں مزید تفصیل کی ضرورت ہے اور آیا یہ طریقہ جائز ٹول کے استعمال میں خلل ڈالے بغیر قابل اعتماد طریقے سے کام کرتا ہے۔
مکمل مقالے میں یہ واضح کرنا چاہیے کہ کامیاب بھولنے میں کیا شمار ہوتا ہے۔ اہم تفصیلات میں یہ شامل ہے کہ آیا جانچ صرف درست ہدف کی تولید یا پیرا فریسز، بالواسطہ جوابات اور ملٹی سٹیپ ری کنسٹرکشن کی جانچ کرتی ہے۔ اسے یہ بھی دکھانا چاہیے کہ طریقہ کس طرح ممنوعہ ہدف کی تلاش کو متعلقہ برقرار رکھے گئے علم کی جائز بازیافت سے ممتاز کرتا ہے، کیونکہ یہ فرق اس بات کا تعین کرے گا کہ آیا یہ نقطہ نظر عملی ہے۔ تشخیص کے ڈیزائن میں اتنا ہی فرق پڑے گا جتنا کہ سرخی کا نتیجہ ہے: ایک تنگ ٹیسٹ یہ ظاہر کر سکتا ہے کہ کسی خاص جواب کو یہ ظاہر کیے بغیر روک دیا گیا ہے کہ کسی اور راستے سے بنیادی معلومات تک نہیں پہنچ سکتا۔ واضح تعریفیں بھولنے اور افادیت کے درمیان رپورٹ کردہ توازن کو آسان بنا دے گی۔
نقل اہم ہوگی کیونکہ رپورٹ شدہ تجربات میں RWKU اور MUSE اور نقلی ٹول سے بڑھے ہوئے ماحول کا استعمال کیا گیا ہے۔ قارئین کو مختلف ٹولز کی اقسام، بازیافت کے نظام، ڈیٹا بیس اور ماڈل فیملیز کے ساتھ ساتھ مصنفین کے تربیتی سیٹ اپ سے باہر کی جانے والی تشخیصات کی تلاش کرنی چاہیے۔ خلاصہ یہ نہیں بتاتا کہ آیا کوڈ، ماحول یا تربیت یافتہ ماڈل دستیاب ہیں، لہذا تولیدی صلاحیت فی الحال نامعلوم ہے۔ آزاد جانچ اس بات کا تعین کرنے میں بھی مدد کرے گی کہ آیا اس طریقہ کار کا انحصار اس خاص طریقے پر ہوتا ہے جس سے نقلی ٹولز معلومات کو ظاہر کرتے ہیں یا جب ارد گرد کے نظام کو مختلف طریقے سے ترتیب دیا جاتا ہے تو اس کی رکاوٹیں موثر رہتی ہیں۔ اس موازنہ کے بغیر، نقطہ نظر کی عمومیت ایک کھلا سوال ہے۔
مستقبل کے جائزوں کو طویل ایجنٹ کے راستے پر سیکورٹی اور افادیت دونوں کی پیمائش کرنی چاہیے۔ ایک ایسا نظام جو مختصر ٹیسٹوں میں براہ راست رساو کو روکتا ہے مختلف طریقے سے برتاؤ کر سکتا ہے جب وہ منصوبہ بنا سکتا ہے، دوبارہ کوشش کر سکتا ہے، کئی ٹولز کو کال کر سکتا ہے یا جزوی مشاہدات کو یکجا کر سکتا ہے۔ ماخذ یہ بھی کھلا چھوڑ دیتا ہے کہ آیا ایجنٹ ٹول ان لرننگ ٹول انڈیکس یا ڈیٹا بیس میں کاپی کی گئی معلومات کو خود ایڈریس کر سکتی ہے، اور آیا اسے تعینات ایجنٹوں پر ان کے ارد گرد کے نظام کو دوبارہ تربیت دیے بغیر لاگو کیا جا سکتا ہے۔ یہ سوالات ماڈل کی سطح کے طریقہ کار کو وسیع ماحول سے جوڑتے ہیں جس میں بحالی ہو سکتی ہے۔ وہ یہ بھی بتاتے ہیں کہ کیوں ایک کامیاب مظاہرے کو یہ جانچنے کی ضرورت ہوگی کہ ایجنٹ کیا ظاہر کرنے سے انکار کرتا ہے اور کون سی مفید معلومات حاصل کرنا جاری رکھتا ہے۔