क्या हुआ?
एक arXiv पेपर एजेंटिक टूल अनलर्निंग का परिचय देता है, जो भाषा-मॉडल एजेंटों के लिए डिज़ाइन किया गया एक ढांचा है जो बाहरी टूल को कॉल कर सकता है। लेखकों का तर्क है कि पारंपरिक अनलर्निंग एजेंट को वेब खोज, पुनर्प्राप्ति या डेटाबेस लुकअप के माध्यम से उसी जानकारी को पुनर्प्राप्त करने से रोके बिना किसी मॉडल की जानकारी की प्रत्यक्ष याद को दबा सकता है।
पेपर एक विफलता मोड का वर्णन करता है जिसे वह टूल-मध्यस्थता पुनर्प्राप्ति कहता है। एक पारंपरिक भाषा मॉडल में, अनलर्निंग का मूल्यांकन आमतौर पर यह परीक्षण करके किया जाता है कि क्या मॉडल अभी भी अपने मापदंडों से निर्दिष्ट लक्ष्य को सीधे याद कर सकता है। लेखकों का तर्क है कि यह मूल्यांकन एक एजेंट के लिए अधूरा है जिसका उत्तर टूल कॉल और बाहरी टिप्पणियों पर निर्भर हो सकता है। ऐसा एजेंट मेमोरी से लक्ष्य बताने में विफल हो सकता है लेकिन बाहरी स्रोत के माध्यम से उसी जानकारी को पुनः प्राप्त कर सकता है। अंतर महत्वपूर्ण है क्योंकि अवलोकन योग्य उत्तर तब भी उपलब्ध रह सकता है जब मॉडल की आंतरिक प्रतिक्रिया बदल गई हो। उस सेटिंग में, मॉडल के कार्यों का मूल्यांकन किए बिना उसका मूल्यांकन करने से वह मार्ग छूट सकता है जिसके द्वारा लक्ष्य पुनर्प्राप्त किया जाता है।
प्रस्तावित विधि, एजेंटिक टूल अनलर्निंग, के दो चरण हैं। सबसे पहले, सिस्टम प्रत्यक्ष स्मरण को दबाने के उद्देश्य से पैरामीट्रिक ज्ञान अनसीखने को लागू करता है। दूसरा, यह सिम्युलेटेड टूल-संवर्धित वातावरण में प्रक्षेपवक्र-स्तरीय सुदृढीकरण सीखने का उपयोग करता है। पेपर के सार के अनुसार, यह चरण लक्ष्य-प्राप्ति उपकरण व्यवहार और अंतिम उत्तर में रिसाव दोनों को दंडित करता है। लक्ष्य एजेंट के कार्यों के माध्यम से वसूली को कम करना है, न कि केवल मॉडल भार में परिवर्तन के माध्यम से। यह एजेंट के निर्णयों के क्रम को अनसीखने की समस्या का हिस्सा बनाता है, जिसमें जानकारी प्राप्त करने का विकल्प और पुनर्प्राप्त सामग्री को प्रतिक्रिया में शामिल करने का तरीका शामिल है।
लेखक विभिन्न भाषा-मॉडल आर्किटेक्चर में आरडब्ल्यूकेयू और एमयूएसई अनलर्निंग बेंचमार्क पर प्रयोगों की रिपोर्ट करते हैं। वे कहते हैं कि यह विधि निर्दिष्ट लक्ष्य को भूलने और ज्ञान के लिए सामान्य उपयोगिता बनाए रखने के बीच बेहतर संतुलन प्राप्त करती है जो उपलब्ध रहना चाहिए। आपूर्ति किया गया स्रोत संख्यात्मक परिणाम, मॉडल नाम, प्रशिक्षण लागत, आधारभूत तुलना या सिम्युलेटेड टूल का विवरण प्रदान नहीं करता है, इसलिए रिपोर्ट किए गए सुधार की ताकत और दायरे का आकलन अकेले सार से नहीं किया जा सकता है। वे चूक रिपोर्ट किए गए प्रयोगों के साथ एक शोध प्रस्ताव के रूप में बेहतर ढंग से समझे जाने वाले परिणाम को छोड़ देते हैं, न कि इस सबूत के रूप में कि दृष्टिकोण को तैनात प्रणालियों में मान्य किया गया है।
यह क्यों मायने रखता है?
यह पेपर उन प्रणालियों के लिए एक व्यावहारिक सुरक्षा और गोपनीयता समस्या पर प्रकाश डालता है जो भाषा मॉडल को बाहरी उपकरणों के साथ जोड़ती है। यदि कोई एजेंट अभी भी अपने आस-पास के उपकरणों के माध्यम से लक्ष्य का पता लगा सकता है या उसका पुनर्निर्माण कर सकता है, तो मॉडल मापदंडों से ज्ञान निकालना पर्याप्त नहीं हो सकता है।
यह खोज मायने रखती है क्योंकि टूल एक्सेस से एआई सिस्टम के लिए कुछ भूलने का मतलब बदल जाता है। एक मॉडल अब सीधे जानकारी के एक टुकड़े को एनकोड या पुन: पेश नहीं कर सकता है, फिर भी पूरा एजेंट किसी कनेक्टेड डेटाबेस को खोजकर, पुनर्प्राप्त करके या क्वेरी करके इसे उत्पन्न कर सकता है। व्यक्तिगत, मालिकाना या अन्यथा प्रतिबंधित जानकारी को संभालने वाले सिस्टम के लिए, मूल्यांकन की प्रासंगिक इकाई अलग-अलग मॉडल के बजाय पूर्ण एजेंट वर्कफ़्लो हो सकती है। यह व्यापक दृष्टिकोण मॉडल मापदंडों को एकमात्र संभावित स्रोत के रूप में मानने के बजाय, पूरे पथ के माध्यम से जानकारी का अनुसरण करता है जो एक उत्तर उत्पन्न कर सकता है।
इस अंतर का यह भी प्रभाव है कि संगठन विलोपन या हटाने के दावों की व्याख्या कैसे करते हैं। यदि किसी अनुरोध का उद्देश्य किसी एजेंट को किसी विशेष लक्ष्य का उत्पादन करने से रोकना है, तो केवल मॉडल मापदंडों को संशोधित करने से वैकल्पिक मार्ग खुला रह सकता है। पेपर यह स्थापित नहीं करता है कि कोई भी तैनात सिस्टम वर्तमान में इस तरह से विफल रहता है, लेकिन यह परीक्षण के लिए एक ठोस मूल्यांकन ढांचा प्रदान करता है कि क्या किसी एजेंट के उपकरण एक अनलर्निंग प्रक्रिया को कमजोर करते हैं। वह फ्रेम उस बदलाव को अलग करने में मदद कर सकता है जो मॉडल याद करता है और जो इकट्ठे सिस्टम अभी भी प्राप्त कर सकता है उसमें बदलाव से। यह निष्कासन दावे के दायरे को उस व्यवहार से भी जोड़ता है जिसे उपयोगकर्ता वास्तव में देख सकते हैं।
प्रस्तावित उद्देश्य में एक कठिन इंजीनियरिंग समझौता है। किसी एजेंट द्वारा अपने पास रखी जाने वाली जानकारी के बारे में प्रश्नों का उत्तर देने के लिए टूल का उपयोग अक्सर आवश्यक होता है। बहुत अधिक टूल-खोज को दंडित करने से उपयोगी व्यवहार को नुकसान हो सकता है, जबकि बहुत कम दंडित करने से भूला हुआ लक्ष्य पुनर्प्राप्त करने योग्य हो सकता है। पेपर का घोषित ज्ञान को संरक्षित करने का घोषित उद्देश्य इस व्यापार-बंद को स्पष्ट करता है, लेकिन स्रोत यह नहीं दिखाता है कि दृष्टिकोण अस्पष्ट अनुरोधों, अप्रत्यक्ष प्रश्नों या ओवरलैपिंग जानकारी वाले टूल को कितनी अच्छी तरह संभालता है। इसलिए एक उपयोगी विधि को उपकरण के वैध उपयोग का समर्थन जारी रखते हुए अवांछित मार्ग को रोकना चाहिए, एक ऐसा संतुलन जिसका अनुमान अकेले अमूर्त से नहीं लगाया जा सकता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
केंद्रीय प्रश्न यह है कि क्या रिपोर्ट की गई पद्धति पेपर के अनुरूपित वातावरण और बेंचमार्क से परे सामान्यीकृत है। लक्ष्य जानकारी, टूल कॉन्फ़िगरेशन, मॉडल आर्किटेक्चर, मापा ट्रेड-ऑफ़ और क्या दृष्टिकोण वैध टूल उपयोग को बाधित किए बिना विश्वसनीय रूप से काम करता है, इस पर अधिक विवरण की आवश्यकता है।
पूरे पेपर में यह स्पष्ट होना चाहिए कि सफल भूलने को क्या माना जाता है। महत्वपूर्ण विवरणों में शामिल है कि क्या मूल्यांकन केवल सटीक लक्ष्य पुनरुत्पादन या पैराफ्रेश, अप्रत्यक्ष उत्तर और बहु-चरणीय पुनर्निर्माण की जाँच करता है। इसे यह भी दिखाना चाहिए कि कैसे विधि निषिद्ध लक्ष्य-प्राप्ति को संबंधित बनाए गए ज्ञान की वैध पुनर्प्राप्ति से अलग करती है, क्योंकि यह अंतर यह निर्धारित करेगा कि दृष्टिकोण व्यावहारिक है या नहीं। मूल्यांकन डिज़ाइन उतना ही मायने रखेगा जितना कि शीर्षक परिणाम: एक संकीर्ण परीक्षण दिखा सकता है कि एक विशेष प्रतिक्रिया अवरुद्ध है, यह दिखाए बिना कि अंतर्निहित जानकारी तक किसी अन्य पथ के माध्यम से नहीं पहुंचा जा सकता है। स्पष्ट परिभाषाएँ भूलने और उपयोगिता के बीच बताए गए संतुलन की व्याख्या करना आसान बना देंगी।
प्रतिकृति महत्वपूर्ण होगी क्योंकि रिपोर्ट किए गए प्रयोग RWKU और MUSE और सिम्युलेटेड टूल-संवर्धित वातावरण का उपयोग करते हैं। पाठकों को विभिन्न टूल प्रकारों, पुनर्प्राप्ति प्रणालियों, डेटाबेस और मॉडल परिवारों के साथ-साथ लेखकों के प्रशिक्षण सेटअप के बाहर किए गए मूल्यांकनों के साथ परीक्षणों की तलाश करनी चाहिए। सार यह नहीं बताता है कि कोड, वातावरण या प्रशिक्षित मॉडल उपलब्ध हैं या नहीं, इसलिए प्रतिलिपि प्रस्तुत करने योग्यता वर्तमान में अज्ञात है। स्वतंत्र परीक्षण यह निर्धारित करने में भी मदद करेगा कि क्या विधि उस विशेष तरीके पर निर्भर करती है जिस पर सिम्युलेटेड उपकरण जानकारी प्रदर्शित करते हैं या क्या इसकी बाधाएं तब प्रभावी रहती हैं जब आसपास का सिस्टम अलग तरीके से कॉन्फ़िगर किया जाता है। उस तुलना के बिना, दृष्टिकोण की व्यापकता एक खुला प्रश्न बनी हुई है।
भविष्य के आकलन को लंबे एजेंट प्रक्षेप पथों पर सुरक्षा और उपयोगिता दोनों को मापना चाहिए। एक प्रणाली जो छोटे परीक्षणों में प्रत्यक्ष रिसाव को रोकती है, वह अलग तरह से व्यवहार कर सकती है जब वह योजना बना सकती है, पुनः प्रयास कर सकती है, कई उपकरणों को कॉल कर सकती है या आंशिक अवलोकनों को जोड़ सकती है। स्रोत यह भी खुला छोड़ता है कि क्या एजेंटिक टूल अनलर्निंग टूल इंडेक्स या डेटाबेस में कॉपी की गई जानकारी को स्वयं संबोधित कर सकता है, और क्या इसे आसपास के सिस्टम को फिर से प्रशिक्षित किए बिना तैनात एजेंटों पर लागू किया जा सकता है। ये प्रश्न मॉडल-स्तरीय प्रक्रिया को उस व्यापक वातावरण से जोड़ते हैं जिसमें पुनर्प्राप्ति हो सकती है। वे यह भी संकेत देते हैं कि एक सफल प्रदर्शन के लिए यह जांचने की आवश्यकता क्यों होगी कि एजेंट क्या प्रकट करने से इनकार करता है और वह कौन सी उपयोगी जानकारी प्राप्त करना जारी रखता है।