ماذا حدث
تقدم ورقة arXiv أداة Agentic Tool Unlearning، وهو إطار عمل مصمم لوكلاء نموذج اللغة الذين يمكنهم استدعاء أدوات خارجية. يرى المؤلفون أن المحو التقليدي للتعلم قد يمنع الاسترجاع المباشر للمعلومات من النموذج دون منع الوكيل من استعادة نفس المعلومات من خلال البحث على الويب، أو الاسترجاع، أو البحث في قاعدة البيانات.
تصف الورقة وضع الفشل الذي يطلق عليه الاسترداد بوساطة الأداة. في نموذج اللغة التقليدية، عادة ما يتم تقييم عدم التعلم عن طريق اختبار ما إذا كان النموذج لا يزال قادرًا على استدعاء هدف معين مباشرة من معلماته. يرى المؤلفون أن هذا التقييم غير مكتمل بالنسبة للعامل الذي يمكن أن تعتمد إجابته على استدعاءات الأدوات والملاحظات الخارجية. قد يفشل مثل هذا الوكيل في تحديد الهدف من الذاكرة ولكنه يسترد نفس المعلومات من خلال مصدر خارجي. يعد التمييز مهمًا لأن الإجابة التي يمكن ملاحظتها يمكن أن تظل متاحة حتى عندما تتغير الاستجابة الداخلية للنموذج. في هذا الإعداد، قد يؤدي تقييم النموذج دون تقييم إجراءاته إلى تفويت المسار الذي يتم من خلاله استرداد الهدف.
تتكون الطريقة المقترحة، وهي "التعلم عن الأدوات الوكيلة"، من مرحلتين. أولاً، يطبق النظام محو المعرفة البارامترية بهدف منع الاستدعاء المباشر. ثانيًا، يستخدم التعلم المعزز على مستوى المسار في بيئات محاكاة للأدوات المعززة. وفقًا لملخص البحث، فإن هذه المرحلة تعاقب كلاً من سلوك أداة البحث عن الهدف والتسرب في الإجابة النهائية. الهدف هو تقليل الاسترداد من خلال تصرفات الوكيل، وليس فقط من خلال التغييرات في أوزان النماذج. وهذا يجعل تسلسل قرارات الوكيل جزءًا من مشكلة نسيان التعلم، بما في ذلك اختيار البحث عن المعلومات وطريقة دمج المواد المستردة في الاستجابة.
أبلغ المؤلفون عن تجارب حول معايير التعلم الخاصة بـ RWKU وMUSE عبر بنيات نماذج اللغة المختلفة. ويقولون إن هذه الطريقة تحقق توازنًا أفضل بين نسيان الهدف المحدد والاحتفاظ بالمنفعة العادية للمعرفة التي يجب أن تظل متاحة. لا يوفر المصدر المقدم نتائج رقمية، أو أسماء النماذج، أو تكاليف التدريب، أو مقارنات خط الأساس أو تفاصيل الأدوات المحاكاة، لذلك لا يمكن تقييم قوة ونطاق التحسين المبلغ عنه من الملخص وحده. إن هذه الإغفالات تجعل النتيجة مفهومة بشكل أفضل على أنها مقترح بحثي مع تجارب تم الإبلاغ عنها، وليس كدليل على التحقق من صحة النهج عبر الأنظمة المنشورة.
لماذا يهم
تسلط الورقة الضوء على مشكلة الأمان والخصوصية العملية للأنظمة التي تجمع بين نماذج اللغة والأدوات الخارجية. قد لا تكون إزالة المعرفة من معلمات النموذج كافية إذا كان الوكيل لا يزال بإمكانه تحديد موقع الهدف أو إعادة بنائه من خلال الأدوات المحيطة به.
هذه النتيجة مهمة لأن الوصول إلى الأداة يغير ما يعنيه أن ينسى نظام الذكاء الاصطناعي شيئًا ما. قد لا يعد النموذج يقوم بتشفير أو إعادة إنتاج جزء من المعلومات بشكل مباشر، ومع ذلك لا يزال بإمكان الوكيل الكامل إنتاجها عن طريق البحث في قاعدة بيانات متصلة أو استرجاعها أو الاستعلام عنها. بالنسبة للأنظمة التي تتعامل مع المعلومات الشخصية أو الملكية أو المقيدة بأي شكل آخر، قد تكون وحدة التقييم ذات الصلة هي سير عمل الوكيل الكامل بدلاً من النموذج المنفصل. تتبع هذه الرؤية الأوسع المعلومات عبر المسار بأكمله الذي يمكن أن ينتج إجابة، بدلاً من التعامل مع معلمات النموذج باعتبارها المصدر الوحيد الممكن.
وللتمييز أيضًا آثار على كيفية تفسير المؤسسات لمطالبات الحذف أو الإزالة. إذا كان الطلب يهدف إلى منع الوكيل من إنتاج هدف معين، فإن تعديل معلمات النموذج وحده قد يترك طريقًا بديلاً مفتوحًا. لا تثبت هذه الورقة أن أي نظام منشور حاليًا يفشل بهذه الطريقة، ولكنها تقدم إطارًا تقييميًا ملموسًا لاختبار ما إذا كانت أدوات العميل تقوض إجراء محو التعلم. يمكن أن يساعد هذا الإطار في فصل التغيير في ما يتذكره النموذج عن التغيير في ما لا يزال بإمكان النظام المجمع الحصول عليه. كما أنه يبقي نطاق مطالبة الإزالة مرتبطًا بالسلوك الذي يمكن للمستخدمين ملاحظته بالفعل.
هناك مقايضة هندسية صعبة في الهدف المقترح. غالبًا ما يكون استخدام الأداة ضروريًا للوكيل للإجابة على الأسئلة المتعلقة بالمعلومات التي من المفترض أن يحتفظ بها. إن معاقبة الكثير من البحث عن الأدوات قد يؤدي إلى الإضرار بالسلوك المفيد، في حين أن فرض عقوبات أقل مما ينبغي قد يجعل الهدف المنسي قابلاً للاسترداد. الهدف المعلن للورقة وهو الحفاظ على المعرفة المحتفظ بها يجعل هذه المقايضة واضحة، لكن المصدر لا يوضح مدى جودة تعامل النهج مع الطلبات الغامضة، أو الاستفسارات غير المباشرة، أو الأدوات التي تحتوي على معلومات متداخلة. وبالتالي، يجب أن تعمل الطريقة المفيدة على تقييد المسار غير المرغوب فيه مع الاستمرار في دعم استخدام الأداة الذي يظل مشروعًا، وهو توازن لا يمكن استنتاجه من الملخص وحده.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
ماذا تشاهد بعد ذلك
والسؤال المركزي هو ما إذا كانت الطريقة المذكورة تعمم خارج نطاق البيئات والمعايير المحاكاة للورقة البحثية. هناك حاجة إلى مزيد من التفاصيل حول المعلومات المستهدفة، وتكوينات الأداة، وبنيات النماذج، والمقايضات المقاسة، وما إذا كان النهج يعمل بشكل موثوق دون تعطيل الاستخدام المشروع للأداة.
يجب أن توضح الورقة الكاملة ما يمكن اعتباره نسيانًا ناجحًا. تتضمن التفاصيل المهمة ما إذا كان التقييم يتحقق فقط من إعادة إنتاج الهدف بدقة أو أيضًا إعادة الصياغة والإجابات غير المباشرة وإعادة البناء متعددة الخطوات. وينبغي أن يوضح أيضًا كيف تميز الطريقة بين البحث عن الأهداف المحظورة والاسترجاع المشروع للمعرفة المحتفظ بها ذات الصلة، حيث أن هذا التمييز سيحدد ما إذا كان النهج عمليًا أم لا. وسيكون تصميم التقييم ذا أهمية بقدر أهمية النتيجة الرئيسية: فقد يُظهر الاختبار الضيق أن استجابة معينة محظورة دون إظهار أنه لا يمكن الوصول إلى المعلومات الأساسية من خلال مسار آخر. من شأن التعريفات الواضحة أن تجعل التوازن المبلغ عنه بين النسيان والمنفعة أسهل في التفسير.
سيكون النسخ المتماثل مهمًا لأن التجارب التي تم الإبلاغ عنها تستخدم RWKU وMUSE وبيئات محاكاة للأدوات المعززة. يجب على القراء البحث عن اختبارات باستخدام أنواع مختلفة من الأدوات، وأنظمة الاسترجاع، وقواعد البيانات، والعائلات النموذجية، إلى جانب التقييمات التي يتم إجراؤها خارج إعدادات تدريب المؤلفين. لا يذكر الملخص ما إذا كانت التعليمات البرمجية أو البيئات أو النماذج المدربة متاحة، لذا فإن إمكانية التكرار غير معروفة حاليًا. سيساعد الاختبار المستقل أيضًا في تحديد ما إذا كانت الطريقة تعتمد على الطريقة المحددة التي تعرض بها الأدوات المحاكاة المعلومات أو ما إذا كانت قيودها تظل فعالة عندما يتم تكوين النظام المحيط بشكل مختلف. وبدون هذه المقارنة، تظل عمومية النهج مسألة مفتوحة.
وينبغي للتقييمات المستقبلية أن تقيس كلاً من الأمن والمنفعة على مسارات أطول للعامل. قد يتصرف النظام الذي يمنع التسرب المباشر في الاختبارات القصيرة بشكل مختلف عندما يتمكن من التخطيط أو إعادة المحاولة أو استدعاء عدة أدوات أو الجمع بين الملاحظات الجزئية. يترك المصدر أيضًا مفتوحًا ما إذا كان برنامج Agent Tool Unlearning يمكنه معالجة المعلومات المنسوخة في فهارس الأدوات أو قواعد البيانات نفسها، وما إذا كان يمكن تطبيقه على الوكلاء الذين تم نشرهم دون إعادة تدريب الأنظمة المحيطة بهم. تربط هذه الأسئلة الإجراء على مستوى النموذج بالبيئة الأوسع التي يمكن أن يحدث فيها التعافي. كما أنها تشير أيضًا إلى سبب حاجة العرض التوضيحي الناجح إلى فحص ما يرفض الوكيل الكشف عنه والمعلومات المفيدة التي يستمر في استرجاعها.