समाज गाइड

मॉडल निष्कर्षण और चोरी के हमले

मॉडल निष्कर्षण हमले एक प्रतिद्वंद्वी को उसके सार्वजनिक एपीआई से पूछताछ करके और उत्तरों पर एक नकलची को प्रशिक्षित करके एक मालिकाना एआई मॉडल का क्लोन बनाने देते हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

गहरा गोता

एक मॉडल निष्कर्षण (या मॉडल चोरी) हमला एक तैनात मॉडल को एक दैवज्ञ के रूप में मानता है। हमलावर इनपुट भेजता है, आउटपुट रिकॉर्ड करता है, और व्यवहार की नकल करने के लिए एक स्थानापन्न मॉडल को प्रशिक्षित करता है। चूँकि लक्ष्य मॉडल स्वयं एक सीखा हुआ फ़ंक्शन है जो इनपुट को आउटपुट में मैप करता है, पर्याप्त इनपुट-आउटपुट जोड़े की प्रतिलिपि बनाकर मूल वजन या प्रशिक्षण डेटा को देखे बिना एक करीबी सन्निकटन का पुनर्निर्माण किया जा सकता है। शोधकर्ताओं ने छवि वर्गीकरणकर्ताओं की निर्णय सीमाओं को चुरा लिया है और यहां तक ​​कि छोटी परतों के सटीक वजन भी प्राप्त कर लिए हैं। 2024 में, एक टीम ने दिखाया कि OpenAI और Google उत्पादन मॉडल एम्बेडिंग परतें कुछ सौ डॉलर से कम में निकाली जा सकती हैं। चोरी की गई प्रतियां भुगतान सेवाओं को कम कर देती हैं, सुरक्षा फिल्टर को बायपास कर देती हैं, और प्रतिकूल उदाहरण तैयार करने जैसे व्हाइट-बॉक्स हमलों को सक्षम बनाती हैं।

तकनीकी अंतर्दृष्टि

एपीआई प्रतिक्रिया जितनी समृद्ध होगी, चोरी उतनी ही सस्ती होगी। पूर्ण संभाव्यता वाले वेक्टर या लॉग लौटाने से एकल टॉप-1 लेबल की तुलना में प्रति क्वेरी कहीं अधिक जानकारी लीक होती है, इसलिए हमलावर कम प्रश्नों के साथ सीमाओं का पुनर्निर्माण करते हैं। सक्रिय-शिक्षण रणनीतियाँ निर्णय सीमाओं के निकट सबसे अधिक जानकारीपूर्ण प्रश्नों का चयन करती हैं। एक ऐतिहासिक परिणाम से पता चला कि केवल आउटपुट आयाम गणना पर क्वेरी करने से रैखिक बीजगणित के माध्यम से अंतिम रैखिक प्रक्षेपण परत को पुनर्प्राप्त किया जा सकता है, क्योंकि वह परत प्रभावी रूप से प्रतिक्रियाओं की अवधि का एक मैट्रिक्स है।

सामरिक प्रभाव

जोखिम और सुरक्षा

विनाशकारी और रोजमर्रा के एआई नुकसान दोनों इस बात पर निर्भर करते हैं कि जोखिमों को कौन समझता है और कौन कार्रवाई कर सकता है।

स्पष्ट निर्णय

सार्वजनिक और व्यावसायिक साक्षरता यह निर्धारित करती है कि मजबूत सुरक्षा नीति राजनीतिक रूप से संभव है या नहीं।

प्रचार के माध्यम से काटना

स्पष्ट स्पष्टीकरण प्रचार, लैब पीआर और अस्पष्ट नैतिकता थिएटर द्वारा कब्जा कम कर देते हैं।

मॉडल निष्कर्षण और चोरी के हमलों का भविष्य

बचाव अवरुद्ध करने से पता लगाने और गिरावट की ओर स्थानांतरित हो रहे हैं: दर सीमित करना, गोल या शीर्ष-1-केवल आउटपुट लौटाना, कैलिब्रेटेड शोर जोड़ना, वॉटरमार्किंग मॉडल व्यवहार ताकि चुराई गई प्रतियों को फिंगरप्रिंट किया जा सके, और निष्कर्षण हस्ताक्षर के लिए क्वेरी पैटर्न की निगरानी करना। विनियमन और लाइसेंसिंग शर्तों की अपेक्षा करें जो निष्कर्षण को चोरी के रूप में मानते हैं, साथ ही कठिन-से-निकालने वाले आर्किटेक्चर में सक्रिय अनुसंधान भी करते हैं। जैसे-जैसे मॉडल बड़े होते जाते हैं, पूर्ण निष्कर्षण महंगा रहता है, लेकिन मूल्यवान घटकों का आंशिक निष्कर्षण और आसवन-शैली क्लोनिंग लगातार व्यावसायिक और सुरक्षा खतरा बना रहेगा।

वास्तविक विश्व कार्यान्वयन

एक स्टार्टअप एक प्रतियोगी की भुगतान की गई छवि-पहचान एपीआई पर हजारों बार सवाल उठाता है और एक मुफ्त क्लोन को प्रशिक्षित करता है जो इसकी सटीकता को दोहराता है।

सुरक्षा शोधकर्ता केवल कुछ सौ डॉलर की लागत से सावधानीपूर्वक तैयार की गई एपीआई क्वेरी का उपयोग करके उत्पादन भाषा मॉडल की अंतिम एम्बेडिंग-प्रक्षेपण परत निकालते हैं।

एक हमलावर स्थानीय रूप से एक स्पैम या धोखाधड़ी क्लासिफायरियर को क्लोन करता है ताकि वे इसकी ऑफ़लाइन जांच कर सकें और ऐसे इनपुट तैयार कर सकें जो विश्वसनीय रूप से पता लगाने से बच सकें।

एक क्लाउड विक्रेता क्वेरी-रेट मॉनिटरिंग जोड़ता है जो एक खाते को चिह्नित करता है जिसका एक्सेस पैटर्न सक्रिय-शिक्षण निष्कर्षण से मेल खाता है और उसकी प्रतिक्रियाओं को दबा देता है।

जोखिम और रेलिंग

अस्तित्वगत जोखिम को विज्ञान-कल्पना के रूप में मानते हुए क्षमता को मिश्रित किया जाता है।

उच्च स्वायत्तता के तहत संरेखण के साथ भ्रमित करने वाली सतह उत्पाद सुरक्षा।

गैर-अंग्रेज़ी और गैर-विशेषज्ञ दर्शकों को केवल निम्न-गुणवत्ता वाले स्रोतों के साथ छोड़ना।

कार्यान्वयन रोडमैप

1

उत्पाद के नुकसान, दुरुपयोग और नियंत्रण की हानि/गलत संरेखण जोखिमों को अलग करें।

2

पूछें कि कौन से सबूत समयसीमा और गंभीरता पर आपके दृष्टिकोण को बदल देंगे।

3

विपणन दावों की तुलना में प्राथमिक स्रोतों और ठोस मूल्यांकन को प्राथमिकता दें।

4

एक कार्य पथ की पहचान करें: कैरियर, नीति, वित्त पोषण, या कौशल - केवल जागरूकता नहीं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

सदस्यता अनुमान आक्रमण

अक्सर पूछे जाने वाले प्रश्नों

What is Model Extraction and Stealing Attacks?

मॉडल निष्कर्षण हमले एक प्रतिद्वंद्वी को उसके सार्वजनिक एपीआई से पूछताछ करके और उत्तरों पर एक नकलची को प्रशिक्षित करके एक मालिकाना एआई मॉडल का क्लोन बनाने देते हैं। यह मायने रखता है क्योंकि कंपनियां लाखों प्रशिक्षण मॉडल खर्च करती हैं जिन्हें कुछ हजार एपीआई कॉल की कीमत के लिए अनुमानित किया जा सकता है।

मॉडल निष्कर्षण हमले के पीछे मूल विचार क्या है?

एक्सट्रैक्शन तैनात मॉडल को एक दैवज्ञ के रूप में मानता है: हमलावर इनपुट-आउटपुट जोड़े एकत्र करता है और मूल वजन तक पहुंचने के बिना, व्यवहार की नकल करने के लिए एक कॉपीकैट मॉडल को प्रशिक्षित करता है।

पूर्ण संभाव्यता वाले वैक्टर लौटाने से केवल शीर्ष-1 लेबल लौटाने की तुलना में निष्कर्षण आसान क्यों हो जाता है?

प्रत्येक पूर्ण संभाव्यता वेक्टर एक एकल लेबल की तुलना में मॉडल की आंतरिक निर्णय सतह के बारे में कहीं अधिक बताता है, जिससे हमलावर को कम प्रश्नों के साथ सीमा का पुनर्निर्माण करने में मदद मिलती है।

कौन सी रक्षात्मक तकनीक प्रति प्रश्न लीक हुई जानकारी को सीधे कम करती है?

आउटपुट को मोटा करना, उदाहरण के लिए केवल शीर्ष लेबल या गोलाकार संभावनाओं को वापस करना, प्रत्येक प्रतिक्रिया द्वारा हमलावर को दिए जाने वाले सिग्नल को कम कर देता है, जिससे निष्कर्षण की लागत बढ़ जाती है।

2024 के परिणाम से पता चला कि हमलावर वास्तव में उत्पादन भाषा मॉडल के किस हिस्से को सस्ते में पुनर्प्राप्त कर सकते हैं?

शोधकर्ताओं ने प्रदर्शित किया कि अंतिम रैखिक प्रक्षेपण परत को कुछ सौ डॉलर में पुनर्प्राप्त किया जा सकता है, क्योंकि इसकी प्रतिक्रियाएं एक पुनर्प्राप्ति योग्य मैट्रिक्स तक फैली हुई हैं।

चुराया गया स्थानापन्न मॉडल केवल खोए हुए राजस्व से परे खतरनाक क्यों है?

एक बार जब हमलावरों के पास स्थानीय प्रतिलिपि हो जाती है, तो वे प्रतिकूल इनपुट या चोरी के हमलों को डिजाइन करने के लिए स्वतंत्र रूप से इसकी जांच कर सकते हैं जो मूल तैनात प्रणाली को भी मूर्ख बनाते हैं।