समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

पेपर में चेतावनी दी गई है कि एलएलएम एजेंट टूल के माध्यम से हटाए गए ज्ञान को पुनर्प्राप्त कर सकते हैं

एक नया arXiv पेपर एलएलएम अनलर्निंग में एक अंतर की पहचान करता है: एक एजेंट अपने वजन से जानकारी को याद करना बंद कर सकता है लेकिन वेब खोज, पुनर्प्राप्ति या डेटाबेस टूल के माध्यम से इसे पुनर्प्राप्त कर सकता है। लेखक वैध उपकरण उपयोग को संरक्षित करते हुए पुनर्प्राप्ति के दोनों रूपों को कम करने के लिए दो-चरणीय विधि का प्रस्ताव करते हैं।

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21544
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

एक arXiv पेपर एजेंटिक टूल अनलर्निंग का परिचय देता है, जो भाषा-मॉडल एजेंटों के लिए डिज़ाइन किया गया एक ढांचा है जो बाहरी टूल को कॉल कर सकता है। लेखकों का तर्क है कि पारंपरिक अनलर्निंग एजेंट को वेब खोज, पुनर्प्राप्ति या डेटाबेस लुकअप के माध्यम से उसी जानकारी को पुनर्प्राप्त करने से रोके बिना किसी मॉडल की जानकारी की प्रत्यक्ष याद को दबा सकता है।

पेपर एक विफलता मोड का वर्णन करता है जिसे वह टूल-मध्यस्थता पुनर्प्राप्ति कहता है। एक पारंपरिक भाषा मॉडल में, अनलर्निंग का मूल्यांकन आमतौर पर यह परीक्षण करके किया जाता है कि क्या मॉडल अभी भी अपने मापदंडों से निर्दिष्ट लक्ष्य को सीधे याद कर सकता है। लेखकों का तर्क है कि यह मूल्यांकन एक एजेंट के लिए अधूरा है जिसका उत्तर टूल कॉल और बाहरी टिप्पणियों पर निर्भर हो सकता है। ऐसा एजेंट मेमोरी से लक्ष्य बताने में विफल हो सकता है लेकिन बाहरी स्रोत के माध्यम से उसी जानकारी को पुनः प्राप्त कर सकता है। अंतर महत्वपूर्ण है क्योंकि अवलोकन योग्य उत्तर तब भी उपलब्ध रह सकता है जब मॉडल की आंतरिक प्रतिक्रिया बदल गई हो। उस सेटिंग में, मॉडल के कार्यों का मूल्यांकन किए बिना उसका मूल्यांकन करने से वह मार्ग छूट सकता है जिसके द्वारा लक्ष्य पुनर्प्राप्त किया जाता है।

प्रस्तावित विधि, एजेंटिक टूल अनलर्निंग, के दो चरण हैं। सबसे पहले, सिस्टम प्रत्यक्ष स्मरण को दबाने के उद्देश्य से पैरामीट्रिक ज्ञान अनसीखने को लागू करता है। दूसरा, यह सिम्युलेटेड टूल-संवर्धित वातावरण में प्रक्षेपवक्र-स्तरीय सुदृढीकरण सीखने का उपयोग करता है। पेपर के सार के अनुसार, यह चरण लक्ष्य-प्राप्ति उपकरण व्यवहार और अंतिम उत्तर में रिसाव दोनों को दंडित करता है। लक्ष्य एजेंट के कार्यों के माध्यम से वसूली को कम करना है, न कि केवल मॉडल भार में परिवर्तन के माध्यम से। यह एजेंट के निर्णयों के क्रम को अनसीखने की समस्या का हिस्सा बनाता है, जिसमें जानकारी प्राप्त करने का विकल्प और पुनर्प्राप्त सामग्री को प्रतिक्रिया में शामिल करने का तरीका शामिल है।

लेखक विभिन्न भाषा-मॉडल आर्किटेक्चर में आरडब्ल्यूकेयू और एमयूएसई अनलर्निंग बेंचमार्क पर प्रयोगों की रिपोर्ट करते हैं। वे कहते हैं कि यह विधि निर्दिष्ट लक्ष्य को भूलने और ज्ञान के लिए सामान्य उपयोगिता बनाए रखने के बीच बेहतर संतुलन प्राप्त करती है जो उपलब्ध रहना चाहिए। आपूर्ति किया गया स्रोत संख्यात्मक परिणाम, मॉडल नाम, प्रशिक्षण लागत, आधारभूत तुलना या सिम्युलेटेड टूल का विवरण प्रदान नहीं करता है, इसलिए रिपोर्ट किए गए सुधार की ताकत और दायरे का आकलन अकेले सार से नहीं किया जा सकता है। वे चूक रिपोर्ट किए गए प्रयोगों के साथ एक शोध प्रस्ताव के रूप में बेहतर ढंग से समझे जाने वाले परिणाम को छोड़ देते हैं, न कि इस सबूत के रूप में कि दृष्टिकोण को तैनात प्रणालियों में मान्य किया गया है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

यह पेपर उन प्रणालियों के लिए एक व्यावहारिक सुरक्षा और गोपनीयता समस्या पर प्रकाश डालता है जो भाषा मॉडल को बाहरी उपकरणों के साथ जोड़ती है। यदि कोई एजेंट अभी भी अपने आस-पास के उपकरणों के माध्यम से लक्ष्य का पता लगा सकता है या उसका पुनर्निर्माण कर सकता है, तो मॉडल मापदंडों से ज्ञान निकालना पर्याप्त नहीं हो सकता है।

यह खोज मायने रखती है क्योंकि टूल एक्सेस से एआई सिस्टम के लिए कुछ भूलने का मतलब बदल जाता है। एक मॉडल अब सीधे जानकारी के एक टुकड़े को एनकोड या पुन: पेश नहीं कर सकता है, फिर भी पूरा एजेंट किसी कनेक्टेड डेटाबेस को खोजकर, पुनर्प्राप्त करके या क्वेरी करके इसे उत्पन्न कर सकता है। व्यक्तिगत, मालिकाना या अन्यथा प्रतिबंधित जानकारी को संभालने वाले सिस्टम के लिए, मूल्यांकन की प्रासंगिक इकाई अलग-अलग मॉडल के बजाय पूर्ण एजेंट वर्कफ़्लो हो सकती है। यह व्यापक दृष्टिकोण मॉडल मापदंडों को एकमात्र संभावित स्रोत के रूप में मानने के बजाय, पूरे पथ के माध्यम से जानकारी का अनुसरण करता है जो एक उत्तर उत्पन्न कर सकता है।

इस अंतर का यह भी प्रभाव है कि संगठन विलोपन या हटाने के दावों की व्याख्या कैसे करते हैं। यदि किसी अनुरोध का उद्देश्य किसी एजेंट को किसी विशेष लक्ष्य का उत्पादन करने से रोकना है, तो केवल मॉडल मापदंडों को संशोधित करने से वैकल्पिक मार्ग खुला रह सकता है। पेपर यह स्थापित नहीं करता है कि कोई भी तैनात सिस्टम वर्तमान में इस तरह से विफल रहता है, लेकिन यह परीक्षण के लिए एक ठोस मूल्यांकन ढांचा प्रदान करता है कि क्या किसी एजेंट के उपकरण एक अनलर्निंग प्रक्रिया को कमजोर करते हैं। वह फ्रेम उस बदलाव को अलग करने में मदद कर सकता है जो मॉडल याद करता है और जो इकट्ठे सिस्टम अभी भी प्राप्त कर सकता है उसमें बदलाव से। यह निष्कासन दावे के दायरे को उस व्यवहार से भी जोड़ता है जिसे उपयोगकर्ता वास्तव में देख सकते हैं।

प्रस्तावित उद्देश्य में एक कठिन इंजीनियरिंग समझौता है। किसी एजेंट द्वारा अपने पास रखी जाने वाली जानकारी के बारे में प्रश्नों का उत्तर देने के लिए टूल का उपयोग अक्सर आवश्यक होता है। बहुत अधिक टूल-खोज को दंडित करने से उपयोगी व्यवहार को नुकसान हो सकता है, जबकि बहुत कम दंडित करने से भूला हुआ लक्ष्य पुनर्प्राप्त करने योग्य हो सकता है। पेपर का घोषित ज्ञान को संरक्षित करने का घोषित उद्देश्य इस व्यापार-बंद को स्पष्ट करता है, लेकिन स्रोत यह नहीं दिखाता है कि दृष्टिकोण अस्पष्ट अनुरोधों, अप्रत्यक्ष प्रश्नों या ओवरलैपिंग जानकारी वाले टूल को कितनी अच्छी तरह संभालता है। इसलिए एक उपयोगी विधि को उपकरण के वैध उपयोग का समर्थन जारी रखते हुए अवांछित मार्ग को रोकना चाहिए, एक ऐसा संतुलन जिसका अनुमान अकेले अमूर्त से नहीं लगाया जा सकता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

केंद्रीय प्रश्न यह है कि क्या रिपोर्ट की गई पद्धति पेपर के अनुरूपित वातावरण और बेंचमार्क से परे सामान्यीकृत है। लक्ष्य जानकारी, टूल कॉन्फ़िगरेशन, मॉडल आर्किटेक्चर, मापा ट्रेड-ऑफ़ और क्या दृष्टिकोण वैध टूल उपयोग को बाधित किए बिना विश्वसनीय रूप से काम करता है, इस पर अधिक विवरण की आवश्यकता है।

पूरे पेपर में यह स्पष्ट होना चाहिए कि सफल भूलने को क्या माना जाता है। महत्वपूर्ण विवरणों में शामिल है कि क्या मूल्यांकन केवल सटीक लक्ष्य पुनरुत्पादन या पैराफ्रेश, अप्रत्यक्ष उत्तर और बहु-चरणीय पुनर्निर्माण की जाँच करता है। इसे यह भी दिखाना चाहिए कि कैसे विधि निषिद्ध लक्ष्य-प्राप्ति को संबंधित बनाए गए ज्ञान की वैध पुनर्प्राप्ति से अलग करती है, क्योंकि यह अंतर यह निर्धारित करेगा कि दृष्टिकोण व्यावहारिक है या नहीं। मूल्यांकन डिज़ाइन उतना ही मायने रखेगा जितना कि शीर्षक परिणाम: एक संकीर्ण परीक्षण दिखा सकता है कि एक विशेष प्रतिक्रिया अवरुद्ध है, यह दिखाए बिना कि अंतर्निहित जानकारी तक किसी अन्य पथ के माध्यम से नहीं पहुंचा जा सकता है। स्पष्ट परिभाषाएँ भूलने और उपयोगिता के बीच बताए गए संतुलन की व्याख्या करना आसान बना देंगी।

प्रतिकृति महत्वपूर्ण होगी क्योंकि रिपोर्ट किए गए प्रयोग RWKU और MUSE और सिम्युलेटेड टूल-संवर्धित वातावरण का उपयोग करते हैं। पाठकों को विभिन्न टूल प्रकारों, पुनर्प्राप्ति प्रणालियों, डेटाबेस और मॉडल परिवारों के साथ-साथ लेखकों के प्रशिक्षण सेटअप के बाहर किए गए मूल्यांकनों के साथ परीक्षणों की तलाश करनी चाहिए। सार यह नहीं बताता है कि कोड, वातावरण या प्रशिक्षित मॉडल उपलब्ध हैं या नहीं, इसलिए प्रतिलिपि प्रस्तुत करने योग्यता वर्तमान में अज्ञात है। स्वतंत्र परीक्षण यह निर्धारित करने में भी मदद करेगा कि क्या विधि उस विशेष तरीके पर निर्भर करती है जिस पर सिम्युलेटेड उपकरण जानकारी प्रदर्शित करते हैं या क्या इसकी बाधाएं तब प्रभावी रहती हैं जब आसपास का सिस्टम अलग तरीके से कॉन्फ़िगर किया जाता है। उस तुलना के बिना, दृष्टिकोण की व्यापकता एक खुला प्रश्न बनी हुई है।

भविष्य के आकलन को लंबे एजेंट प्रक्षेप पथों पर सुरक्षा और उपयोगिता दोनों को मापना चाहिए। एक प्रणाली जो छोटे परीक्षणों में प्रत्यक्ष रिसाव को रोकती है, वह अलग तरह से व्यवहार कर सकती है जब वह योजना बना सकती है, पुनः प्रयास कर सकती है, कई उपकरणों को कॉल कर सकती है या आंशिक अवलोकनों को जोड़ सकती है। स्रोत यह भी खुला छोड़ता है कि क्या एजेंटिक टूल अनलर्निंग टूल इंडेक्स या डेटाबेस में कॉपी की गई जानकारी को स्वयं संबोधित कर सकता है, और क्या इसे आसपास के सिस्टम को फिर से प्रशिक्षित किए बिना तैनात एजेंटों पर लागू किया जा सकता है। ये प्रश्न मॉडल-स्तरीय प्रक्रिया को उस व्यापक वातावरण से जोड़ते हैं जिसमें पुनर्प्राप्ति हो सकती है। वे यह भी संकेत देते हैं कि एक सफल प्रदर्शन के लिए यह जांचने की आवश्यकता क्यों होगी कि एजेंट क्या प्रकट करने से इनकार करता है और वह कौन सी उपयोगी जानकारी प्राप्त करना जारी रखता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटChatGPT और एलएलएमएआई मॉडल की व्याख्याएआई नैतिकताआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?