समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

प्रतिकूल परीक्षण एलएलएम अनसीखने में प्रमुख कमियों को उजागर करते हैं

एक प्रीप्रिंट रिपोर्ट करता है कि भाषा मॉडल सामान्य परीक्षणों के तहत लक्षित जानकारी को भूल जाते हैं जबकि रणनीतिक प्रतिकूल संकेतों के तहत इसे पुनर्प्राप्त करते रहते हैं।

6 min readRead the primary source
Primary-source image accompanying Adversarial tests expose major gaps in LLM unlearning
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21606
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
एलएलएम-जज के रूप में
मूल्यांकन के दौरान अन्य मॉडलों से आउटपुट स्कोर करने या तुलना करने के लिए भाषा मॉडल का उपयोग करना।
फ़ाइन ट्यूनिंग
किसी पूर्व-प्रशिक्षित मॉडल को किसी विशिष्ट कार्य के लिए अनुकूलित करने के लिए डोमेन-विशिष्ट डेटा पर निरंतर प्रशिक्षण।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ने भाषा मॉडल से लक्षित जानकारी को हटाने के लिए शीघ्र-आधारित और फाइन-ट्यूनिंग-आधारित तरीकों का मूल्यांकन किया। उन्होंने पाया कि मानक क्लीन-क्वेरी मेट्रिक्स पर अच्छा स्कोर करने वाले तरीके कथित रूप से भूली हुई जानकारी को पुनर्प्राप्त करने के प्रतिकूल प्रयासों के प्रति अत्यधिक संवेदनशील बने हुए हैं।

arXiv प्रीप्रिंट मशीन अनलर्निंग की जांच करता है, तकनीकों का एक परिवार जिसका उद्देश्य मॉडल की अन्य क्षमताओं को संरक्षित करते हुए चयनित प्रशिक्षण डेटा के प्रभाव को हटाना है। लेखक एक बुनियादी मूल्यांकन समस्या पर ध्यान केंद्रित करते हैं: एक मॉडल सीधे पूछे जाने पर जानकारी प्रकट करना बंद कर सकता है, फिर भी एक निर्धारित उपयोगकर्ता के लिए सावधानीपूर्वक डिज़ाइन किए गए संकेतों के माध्यम से उस जानकारी को पुनर्प्राप्त करने के लिए अपने सीखे हुए प्रतिनिधित्व को पर्याप्त रूप से बनाए रखता है। उनका मुख्य दावा यह है कि सामान्य परीक्षणों के दौरान स्पष्ट भूल को मजबूत दुर्गमता के प्रमाण के रूप में नहीं माना जाना चाहिए।

शोधकर्ता Meta के Llama-3.2-3B-इंस्ट्रक्ट मॉडल का उपयोग करके TOFU बेंचमार्क पर प्रॉम्प्ट-आधारित और फाइन-ट्यूनिंग-आधारित अनलर्निंग तरीकों का एकीकृत मूल्यांकन करते हैं। वे पहले उन तरीकों की पहचान करते हैं जो मानक मेट्रिक्स के तहत दृढ़ता से प्रदर्शन करते हैं, फिर उन तरीकों को प्रतिकूल मजबूती परीक्षण के अधीन करते हैं। पेपर में आठ आक्रमण सुइट्स का वर्णन किया गया है जिनका उद्देश्य यह जांच करना है कि स्पष्ट रूप से सफल अनसीखने के बावजूद लक्षित जानकारी प्राप्त की जा सकती है या नहीं। स्रोत अपने सार में यह निर्दिष्ट नहीं करता है कि प्रत्येक सुइट में कितने व्यक्तिगत उदाहरण या संकेत का उपयोग किया गया था।

पेपर हमले की सफलता दर, या एएसआर, एक एलएलएम-ए-जज उपाय का परिचय देता है जिसे प्रतिकूल प्रतिक्रियाओं के अंश के रूप में परिभाषित किया गया है जिसका रिसाव स्कोर 0.2 से अधिक है। रिपोर्ट किए गए प्रयोगों पर, कई फाइन-ट्यूनिंग-आधारित तरीकों ने स्वच्छ मूल्यांकन के तहत 0.91 से ऊपर गुणवत्ता भूलने की उपलब्धि हासिल की, लेकिन उनकी प्रतिकूल एएसआर 72.8% से 84.3% तक थी। असुरक्षित बेस मॉडल में 87.5% का एएसआर था, जो इन हमलों के तहत परीक्षण किए गए अनलर्निंग तरीकों को मूल मॉडल के अपेक्षाकृत करीब रखता है। तुलनात्मक रूप से, स्वच्छ बहुभाषी सुधारों ने 2.95% की मापा रिसाव दर उत्पन्न की। लेखकों ने दस मामलों का मैन्युअल ऑडिट भी किया। वे उनमें से सात मामलों में बाइनरी एएसआर निर्णयों और मानव तथ्यात्मक आकलन के बीच समझौते की रिपोर्ट करते हैं, इसे सबूत के रूप में प्रस्तुत करते हैं कि एएसआर व्यवहारिक पुनर्प्राप्ति का एक उपयोगी लेकिन अपूर्ण संकेत है।

स्रोत कार्य की पहचान एक सहकर्मी-समीक्षित प्रकाशन के बजाय 21 अगस्त, 2026 को प्रस्तुत arXiv प्रीप्रिंट के रूप में करता है। इसकी अमूर्त रिपोर्ट परिणाम देती है, लेकिन यह स्थापित नहीं करती है कि परीक्षण की गई तकनीकें मॉडल मापदंडों से जानकारी को स्थायी रूप से मिटा देती हैं या कि हर प्रकार की प्रतिकूल प्रेरणा एक ही परिणाम उत्पन्न करेगी।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

निष्कर्षों से पता चलता है कि अकेले क्लीन-क्वेरी स्कोर यह स्थापित करने के लिए पर्याप्त नहीं है कि एलएलएम विश्वसनीय रूप से डेटा भूल गया है। गोपनीयता, डेटा-हटाने और सुरक्षा दावों का आकलन करने वाले डेवलपर्स के लिए अधिक मजबूत परीक्षण मायने रख सकता है, हालांकि अध्ययन एक बेंचमार्क, एक मॉडल और लेखकों के मूल्यांकन डिजाइन तक सीमित है।

इसका जितना व्यावहारिक महत्व है उतना ही तकनीकी भी। यदि किसी मॉडल का मूल्यांकन केवल प्रत्यक्ष, गैर-प्रतिकूल प्रश्नों के साथ किया जाता है, तो डेवलपर्स यह निष्कर्ष निकाल सकते हैं कि एक लक्षित आइटम हटा दिया गया है, जब मॉडल ने केवल उस संकीर्ण सेटिंग में इसका खुलासा नहीं करना सीखा है। अध्ययन के नतीजे बताते हैं कि किसी उत्तर को दबाने और किसी मॉडल की जानकारी पुनर्प्राप्त करने की क्षमता को समाप्त करने के बीच का अंतर स्पष्ट परीक्षण के योग्य है। डेटा हटाने के बारे में दावा करने वाले संगठनों के लिए, यह अंतर इस बात को प्रभावित कर सकता है कि वे अनसीखने के परिणामों पर कितना भरोसा रखते हैं।

रिपोर्ट की गई संख्याएँ अध्ययन की स्थापना के भीतर अंतर को ठोस बनाती हैं। भूल जाओ 0.91 से ऊपर की गुणवत्ता आमतौर पर बेंचमार्क के स्वच्छ मूल्यांकन पर मजबूत प्रदर्शन का सुझाव देगी, जबकि 72.8% से 84.3% के प्रतिकूल एएसआर से संकेत मिलता है कि अधिकांश परीक्षण किए गए हमले के प्रयास अभी भी पेपर के रिसाव सीमा को पार कर गए हैं। 87.5% बेस-मॉडल एएसआर के साथ तुलना पर्याप्त अवशिष्ट पुनर्प्राप्ति का सुझाव देती है, लेकिन यह नहीं दिखाती है कि अनसीखने का कोई मूल्य नहीं है। यह दर्शाता है कि मानक मीट्रिक और प्रतिकूल मीट्रिक अलग-अलग गुणों को मापते हैं और एक ही पद्धति के बिल्कुल अलग आकलन उत्पन्न कर सकते हैं।

यह कार्य एआई सुरक्षा के लिए भी प्रासंगिक है क्योंकि यह मूल्यांकन को ही हमले की सतह के रूप में मानता है। नियमित संकेतों के तहत एक मॉडल का व्यवहार यह प्रकट नहीं कर सकता है कि उन उपयोगकर्ताओं द्वारा क्या निकाला जा सकता है जो इसकी कमजोरियों को समझते हैं या रणनीतिक रूप से अपने शब्दों को बदलते हैं। लेखकों का बहुभाषी सुधार परिणाम इस बात को पुष्ट करता है कि प्रत्येक वैकल्पिक संकेत समान रूप से प्रभावी नहीं है: उन स्वच्छ सुधारों से केवल 2.95% मापा गया रिसाव हुआ, जबकि व्यापक प्रतिकूल सुइट्स ने बहुत अधिक पुनर्प्राप्ति दर उत्पन्न की। यह विरोधाभास यह मानने के बजाय कि सरल व्याख्या एक पर्याप्त तनाव परीक्षण है, हमले की गुणवत्ता और कवरेज का परीक्षण करने का तर्क देता है।

जनहित के निष्कर्षों की महत्वपूर्ण सीमाएँ हैं। स्रोत एक बेंचमार्क और Llama-3.2-3B-इंस्ट्रक्ट पर प्रयोगों की रिपोर्ट करता है, इसलिए यह स्थापित नहीं करता है कि परिणाम बड़े मॉडल, अन्य आर्किटेक्चर, मालिकाना सिस्टम या वास्तविक दुनिया डेटासेट में कैसे स्थानांतरित होते हैं। एएसआर एक एलएलएम जज पर निर्भर करता है और दस ऑडिट किए गए मामलों में से केवल सात में मानव तथ्यात्मक आकलन से मेल खाता है, इसलिए मीट्रिक एक निश्चित जमीनी सच्चाई का माप नहीं है। पेपर किसी उत्पादन घटना, कानूनी विफलता, या किसी विशेष संगठन की विलोपन अनुरोध का सम्मान करने में असमर्थता को भी प्रदर्शित नहीं करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

मुख्य अनुवर्ती प्रश्न यह हैं कि क्या अंतर बड़े और विभिन्न मॉडलों में बना रहता है, क्या अन्य अनसीखने के तरीके बेहतर प्रदर्शन करते हैं, और प्रस्तावित हमले की सफलता दर कितनी विश्वसनीय रूप से तथ्यात्मक रिसाव को दर्शाती है। अतिरिक्त डेटासेट पर स्वतंत्र प्रतिकृति और परीक्षण महत्वपूर्ण होगा।

पहली प्राथमिकता मॉडलों और डेटासेटों में प्रतिकृति है। भविष्य के मूल्यांकन में यह परीक्षण किया जाना चाहिए कि क्या समान स्वच्छ-बनाम-प्रतिकूल अंतर बड़े भाषा मॉडल, विभिन्न डेटा पर प्रशिक्षित मॉडल और वैकल्पिक अनलर्निंग प्रक्रियाओं का उपयोग करने वाले सिस्टम में दिखाई देता है। क्योंकि वर्तमान परिणाम TOFU और एक Llama मॉडल से जुड़ा हुआ है, रिपोर्ट की गई ASR रेंज को LLM अनलर्निंग की सामान्य संपत्ति के रूप में मानने से पहले व्यापक परीक्षण की आवश्यकता है।

शोधकर्ताओं को अधिक आक्रमण प्रकारों और अधिक स्वतंत्र मूल्यांकनकर्ताओं की भी तुलना करनी चाहिए। पेपर के आठ आक्रमण सूट दिखाते हैं कि रणनीतिक रूप से डिज़ाइन किए गए संकेत मायने रख सकते हैं, लेकिन सार उनके पूर्ण निर्माण या सापेक्ष कठिनाई का वर्णन नहीं करता है। स्वतंत्र समूह परीक्षण कर सकते हैं कि क्या निष्कर्ष विशेष संकेत टेम्पलेट्स, 0.2 की रिसाव सीमा, या एलएलएम न्यायाधीश के उपयोग पर निर्भर करते हैं। एक बड़े नमूने की मानव समीक्षा यह निर्धारित करने में मदद करेगी कि एएसआर कब तथ्यात्मक पुनर्प्राप्ति की सही पहचान करता है और कब यह रिसाव को अधिक या कम करता है।

देखने लायक दूसरा क्षेत्र व्यवहारिक पुनर्प्राप्ति और आंतरिक क्षरण के बीच का संबंध है। अध्ययन यह मूल्यांकन करता है कि क्या मॉडल प्रतिक्रियाओं से जानकारी प्राप्त की जा सकती है; इसका सार मॉडल के अंदर विशिष्ट अभ्यावेदन को हटाने का निरीक्षण या साबित करने का दावा नहीं करता है। भविष्य के काम में कई परिणामों को अलग करने की आवश्यकता हो सकती है: उत्तर देने से इनकार करना, परीक्षण किए गए संकेतों के तहत उत्तर देने में विफल होना, पुनर्प्राप्ति की संभावना को कम करना, और वास्तव में लक्षित प्रशिक्षण प्रभाव को हटाना। उन परिणामों का गोपनीयता और सुरक्षा आश्वासनों पर अलग-अलग प्रभाव पड़ेगा।

अंत में, डेवलपर्स और मूल्यांकनकर्ता प्रतिकूल तनाव-परीक्षण को स्वच्छ अनसीखने वाले मेट्रिक्स के मानक पूरक के रूप में मानना ​​​​शुरू कर सकते हैं। लेखक स्पष्ट रूप से उस दृष्टिकोण को प्रेरित करते हैं, लेकिन स्रोत यह नहीं बताता है कि किसी भी मंच, नियामक या मॉडल प्रदाता ने इसे अपनाया है। जो अज्ञात रहता है वह एक विश्वसनीय दावे के लिए आवश्यक न्यूनतम परीक्षण है, जब मजबूत अनलर्निंग लागू किया जाता है तो कितनी क्षमता संरक्षण खो जाता है, और क्या बचाव मॉडल में कहीं और नई कमजोरियां पैदा किए बिना प्रतिकूल वसूली को कम कर सकता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई नैतिकताएआई प्रशिक्षणChatGPT और एलएलएमआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?