क्या हुआ?
शोधकर्ताओं ने भाषा मॉडल से लक्षित जानकारी को हटाने के लिए शीघ्र-आधारित और फाइन-ट्यूनिंग-आधारित तरीकों का मूल्यांकन किया। उन्होंने पाया कि मानक क्लीन-क्वेरी मेट्रिक्स पर अच्छा स्कोर करने वाले तरीके कथित रूप से भूली हुई जानकारी को पुनर्प्राप्त करने के प्रतिकूल प्रयासों के प्रति अत्यधिक संवेदनशील बने हुए हैं।
arXiv प्रीप्रिंट मशीन अनलर्निंग की जांच करता है, तकनीकों का एक परिवार जिसका उद्देश्य मॉडल की अन्य क्षमताओं को संरक्षित करते हुए चयनित प्रशिक्षण डेटा के प्रभाव को हटाना है। लेखक एक बुनियादी मूल्यांकन समस्या पर ध्यान केंद्रित करते हैं: एक मॉडल सीधे पूछे जाने पर जानकारी प्रकट करना बंद कर सकता है, फिर भी एक निर्धारित उपयोगकर्ता के लिए सावधानीपूर्वक डिज़ाइन किए गए संकेतों के माध्यम से उस जानकारी को पुनर्प्राप्त करने के लिए अपने सीखे हुए प्रतिनिधित्व को पर्याप्त रूप से बनाए रखता है। उनका मुख्य दावा यह है कि सामान्य परीक्षणों के दौरान स्पष्ट भूल को मजबूत दुर्गमता के प्रमाण के रूप में नहीं माना जाना चाहिए।
शोधकर्ता Meta के Llama-3.2-3B-इंस्ट्रक्ट मॉडल का उपयोग करके TOFU बेंचमार्क पर प्रॉम्प्ट-आधारित और फाइन-ट्यूनिंग-आधारित अनलर्निंग तरीकों का एकीकृत मूल्यांकन करते हैं। वे पहले उन तरीकों की पहचान करते हैं जो मानक मेट्रिक्स के तहत दृढ़ता से प्रदर्शन करते हैं, फिर उन तरीकों को प्रतिकूल मजबूती परीक्षण के अधीन करते हैं। पेपर में आठ आक्रमण सुइट्स का वर्णन किया गया है जिनका उद्देश्य यह जांच करना है कि स्पष्ट रूप से सफल अनसीखने के बावजूद लक्षित जानकारी प्राप्त की जा सकती है या नहीं। स्रोत अपने सार में यह निर्दिष्ट नहीं करता है कि प्रत्येक सुइट में कितने व्यक्तिगत उदाहरण या संकेत का उपयोग किया गया था।
पेपर हमले की सफलता दर, या एएसआर, एक एलएलएम-ए-जज उपाय का परिचय देता है जिसे प्रतिकूल प्रतिक्रियाओं के अंश के रूप में परिभाषित किया गया है जिसका रिसाव स्कोर 0.2 से अधिक है। रिपोर्ट किए गए प्रयोगों पर, कई फाइन-ट्यूनिंग-आधारित तरीकों ने स्वच्छ मूल्यांकन के तहत 0.91 से ऊपर गुणवत्ता भूलने की उपलब्धि हासिल की, लेकिन उनकी प्रतिकूल एएसआर 72.8% से 84.3% तक थी। असुरक्षित बेस मॉडल में 87.5% का एएसआर था, जो इन हमलों के तहत परीक्षण किए गए अनलर्निंग तरीकों को मूल मॉडल के अपेक्षाकृत करीब रखता है। तुलनात्मक रूप से, स्वच्छ बहुभाषी सुधारों ने 2.95% की मापा रिसाव दर उत्पन्न की। लेखकों ने दस मामलों का मैन्युअल ऑडिट भी किया। वे उनमें से सात मामलों में बाइनरी एएसआर निर्णयों और मानव तथ्यात्मक आकलन के बीच समझौते की रिपोर्ट करते हैं, इसे सबूत के रूप में प्रस्तुत करते हैं कि एएसआर व्यवहारिक पुनर्प्राप्ति का एक उपयोगी लेकिन अपूर्ण संकेत है।
स्रोत कार्य की पहचान एक सहकर्मी-समीक्षित प्रकाशन के बजाय 21 अगस्त, 2026 को प्रस्तुत arXiv प्रीप्रिंट के रूप में करता है। इसकी अमूर्त रिपोर्ट परिणाम देती है, लेकिन यह स्थापित नहीं करती है कि परीक्षण की गई तकनीकें मॉडल मापदंडों से जानकारी को स्थायी रूप से मिटा देती हैं या कि हर प्रकार की प्रतिकूल प्रेरणा एक ही परिणाम उत्पन्न करेगी।
यह क्यों मायने रखता है?
निष्कर्षों से पता चलता है कि अकेले क्लीन-क्वेरी स्कोर यह स्थापित करने के लिए पर्याप्त नहीं है कि एलएलएम विश्वसनीय रूप से डेटा भूल गया है। गोपनीयता, डेटा-हटाने और सुरक्षा दावों का आकलन करने वाले डेवलपर्स के लिए अधिक मजबूत परीक्षण मायने रख सकता है, हालांकि अध्ययन एक बेंचमार्क, एक मॉडल और लेखकों के मूल्यांकन डिजाइन तक सीमित है।
इसका जितना व्यावहारिक महत्व है उतना ही तकनीकी भी। यदि किसी मॉडल का मूल्यांकन केवल प्रत्यक्ष, गैर-प्रतिकूल प्रश्नों के साथ किया जाता है, तो डेवलपर्स यह निष्कर्ष निकाल सकते हैं कि एक लक्षित आइटम हटा दिया गया है, जब मॉडल ने केवल उस संकीर्ण सेटिंग में इसका खुलासा नहीं करना सीखा है। अध्ययन के नतीजे बताते हैं कि किसी उत्तर को दबाने और किसी मॉडल की जानकारी पुनर्प्राप्त करने की क्षमता को समाप्त करने के बीच का अंतर स्पष्ट परीक्षण के योग्य है। डेटा हटाने के बारे में दावा करने वाले संगठनों के लिए, यह अंतर इस बात को प्रभावित कर सकता है कि वे अनसीखने के परिणामों पर कितना भरोसा रखते हैं।
रिपोर्ट की गई संख्याएँ अध्ययन की स्थापना के भीतर अंतर को ठोस बनाती हैं। भूल जाओ 0.91 से ऊपर की गुणवत्ता आमतौर पर बेंचमार्क के स्वच्छ मूल्यांकन पर मजबूत प्रदर्शन का सुझाव देगी, जबकि 72.8% से 84.3% के प्रतिकूल एएसआर से संकेत मिलता है कि अधिकांश परीक्षण किए गए हमले के प्रयास अभी भी पेपर के रिसाव सीमा को पार कर गए हैं। 87.5% बेस-मॉडल एएसआर के साथ तुलना पर्याप्त अवशिष्ट पुनर्प्राप्ति का सुझाव देती है, लेकिन यह नहीं दिखाती है कि अनसीखने का कोई मूल्य नहीं है। यह दर्शाता है कि मानक मीट्रिक और प्रतिकूल मीट्रिक अलग-अलग गुणों को मापते हैं और एक ही पद्धति के बिल्कुल अलग आकलन उत्पन्न कर सकते हैं।
यह कार्य एआई सुरक्षा के लिए भी प्रासंगिक है क्योंकि यह मूल्यांकन को ही हमले की सतह के रूप में मानता है। नियमित संकेतों के तहत एक मॉडल का व्यवहार यह प्रकट नहीं कर सकता है कि उन उपयोगकर्ताओं द्वारा क्या निकाला जा सकता है जो इसकी कमजोरियों को समझते हैं या रणनीतिक रूप से अपने शब्दों को बदलते हैं। लेखकों का बहुभाषी सुधार परिणाम इस बात को पुष्ट करता है कि प्रत्येक वैकल्पिक संकेत समान रूप से प्रभावी नहीं है: उन स्वच्छ सुधारों से केवल 2.95% मापा गया रिसाव हुआ, जबकि व्यापक प्रतिकूल सुइट्स ने बहुत अधिक पुनर्प्राप्ति दर उत्पन्न की। यह विरोधाभास यह मानने के बजाय कि सरल व्याख्या एक पर्याप्त तनाव परीक्षण है, हमले की गुणवत्ता और कवरेज का परीक्षण करने का तर्क देता है।
जनहित के निष्कर्षों की महत्वपूर्ण सीमाएँ हैं। स्रोत एक बेंचमार्क और Llama-3.2-3B-इंस्ट्रक्ट पर प्रयोगों की रिपोर्ट करता है, इसलिए यह स्थापित नहीं करता है कि परिणाम बड़े मॉडल, अन्य आर्किटेक्चर, मालिकाना सिस्टम या वास्तविक दुनिया डेटासेट में कैसे स्थानांतरित होते हैं। एएसआर एक एलएलएम जज पर निर्भर करता है और दस ऑडिट किए गए मामलों में से केवल सात में मानव तथ्यात्मक आकलन से मेल खाता है, इसलिए मीट्रिक एक निश्चित जमीनी सच्चाई का माप नहीं है। पेपर किसी उत्पादन घटना, कानूनी विफलता, या किसी विशेष संगठन की विलोपन अनुरोध का सम्मान करने में असमर्थता को भी प्रदर्शित नहीं करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
मुख्य अनुवर्ती प्रश्न यह हैं कि क्या अंतर बड़े और विभिन्न मॉडलों में बना रहता है, क्या अन्य अनसीखने के तरीके बेहतर प्रदर्शन करते हैं, और प्रस्तावित हमले की सफलता दर कितनी विश्वसनीय रूप से तथ्यात्मक रिसाव को दर्शाती है। अतिरिक्त डेटासेट पर स्वतंत्र प्रतिकृति और परीक्षण महत्वपूर्ण होगा।
पहली प्राथमिकता मॉडलों और डेटासेटों में प्रतिकृति है। भविष्य के मूल्यांकन में यह परीक्षण किया जाना चाहिए कि क्या समान स्वच्छ-बनाम-प्रतिकूल अंतर बड़े भाषा मॉडल, विभिन्न डेटा पर प्रशिक्षित मॉडल और वैकल्पिक अनलर्निंग प्रक्रियाओं का उपयोग करने वाले सिस्टम में दिखाई देता है। क्योंकि वर्तमान परिणाम TOFU और एक Llama मॉडल से जुड़ा हुआ है, रिपोर्ट की गई ASR रेंज को LLM अनलर्निंग की सामान्य संपत्ति के रूप में मानने से पहले व्यापक परीक्षण की आवश्यकता है।
शोधकर्ताओं को अधिक आक्रमण प्रकारों और अधिक स्वतंत्र मूल्यांकनकर्ताओं की भी तुलना करनी चाहिए। पेपर के आठ आक्रमण सूट दिखाते हैं कि रणनीतिक रूप से डिज़ाइन किए गए संकेत मायने रख सकते हैं, लेकिन सार उनके पूर्ण निर्माण या सापेक्ष कठिनाई का वर्णन नहीं करता है। स्वतंत्र समूह परीक्षण कर सकते हैं कि क्या निष्कर्ष विशेष संकेत टेम्पलेट्स, 0.2 की रिसाव सीमा, या एलएलएम न्यायाधीश के उपयोग पर निर्भर करते हैं। एक बड़े नमूने की मानव समीक्षा यह निर्धारित करने में मदद करेगी कि एएसआर कब तथ्यात्मक पुनर्प्राप्ति की सही पहचान करता है और कब यह रिसाव को अधिक या कम करता है।
देखने लायक दूसरा क्षेत्र व्यवहारिक पुनर्प्राप्ति और आंतरिक क्षरण के बीच का संबंध है। अध्ययन यह मूल्यांकन करता है कि क्या मॉडल प्रतिक्रियाओं से जानकारी प्राप्त की जा सकती है; इसका सार मॉडल के अंदर विशिष्ट अभ्यावेदन को हटाने का निरीक्षण या साबित करने का दावा नहीं करता है। भविष्य के काम में कई परिणामों को अलग करने की आवश्यकता हो सकती है: उत्तर देने से इनकार करना, परीक्षण किए गए संकेतों के तहत उत्तर देने में विफल होना, पुनर्प्राप्ति की संभावना को कम करना, और वास्तव में लक्षित प्रशिक्षण प्रभाव को हटाना। उन परिणामों का गोपनीयता और सुरक्षा आश्वासनों पर अलग-अलग प्रभाव पड़ेगा।
अंत में, डेवलपर्स और मूल्यांकनकर्ता प्रतिकूल तनाव-परीक्षण को स्वच्छ अनसीखने वाले मेट्रिक्स के मानक पूरक के रूप में मानना शुरू कर सकते हैं। लेखक स्पष्ट रूप से उस दृष्टिकोण को प्रेरित करते हैं, लेकिन स्रोत यह नहीं बताता है कि किसी भी मंच, नियामक या मॉडल प्रदाता ने इसे अपनाया है। जो अज्ञात रहता है वह एक विश्वसनीय दावे के लिए आवश्यक न्यूनतम परीक्षण है, जब मजबूत अनलर्निंग लागू किया जाता है तो कितनी क्षमता संरक्षण खो जाता है, और क्या बचाव मॉडल में कहीं और नई कमजोरियां पैदा किए बिना प्रतिकूल वसूली को कम कर सकता है।