समाज गाइड

सदस्यता अनुमान आक्रमण

एक सदस्यता अनुमान हमला केवल मॉडल की जांच करके यह निर्धारित करने का प्रयास करता है कि किसी मॉडल को प्रशिक्षित करने के लिए किसी विशिष्ट व्यक्ति के डेटा का उपयोग किया गया था या नहीं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because confirming someone was in a medical or financial training set can itself be a serious privacy breach.

गहरा गोता

सदस्यता अनुमान एक सरल अंतर्ज्ञान का फायदा उठाता है: मॉडल प्रशिक्षण के दौरान याद किए गए डेटा पर अलग-अलग व्यवहार करते हैं, बनाम डेटा जो उन्होंने कभी नहीं देखा है। शॉकरी और सहकर्मियों द्वारा 2017 के मौलिक हमले में लक्ष्य की नकल करने वाले 'छाया मॉडल' को प्रशिक्षित किया गया, फिर सदस्यों बनाम गैर-सदस्यों के आत्मविश्वास पैटर्न को पहचानने के लिए एक क्लासिफायर को प्रशिक्षित किया गया। बाद के कई हमले सरल होते हैं: एक सदस्य उदाहरण अक्सर तुलनीय गैर-सदस्य की तुलना में कम नुकसान या अधिक आत्मविश्वास पैदा करता है। ओवरफ़िटिंग इस अंतर को बढ़ाती है, इसलिए भारी मात्रा में याद किए गए या दुर्लभ रिकॉर्ड सबसे अधिक उजागर होते हैं। खतरा प्रासंगिक है. यदि किसी मॉडल को केवल किसी विशेष निदान वाले रोगियों पर प्रशिक्षित किया गया था, तो सदस्यता साबित करने से निदान का पता चलता है। ये हमले मानक अनुभवजन्य परीक्षण हैं कि क्या कोई मॉडल प्रशिक्षण डेटा लीक करता है।

तकनीकी अंतर्दृष्टि

सबसे मजबूत आधुनिक हमले, जैसे संभावना अनुपात हमला (LiRA), उस रिकॉर्ड के साथ और उसके बिना प्रशिक्षित कई मॉडलों के नुकसान वितरण के खिलाफ एक रिकॉर्ड पर लक्ष्य मॉडल के नुकसान की तुलना करके प्रति-उदाहरण कठिनाई को कैलिब्रेट करते हैं। यह अंशांकन उन उदाहरणों से शोर को हटा देता है जो आसान या कठिन हैं, सदस्य-बनाम-गैर-सदस्य सिग्नल को तेज करते हैं और कम झूठी-सकारात्मक दरों पर वास्तविक-सकारात्मक दरों को नाटकीय रूप से बढ़ाते हैं।

सामरिक प्रभाव

जोखिम और सुरक्षा

विनाशकारी और रोजमर्रा के एआई नुकसान दोनों इस बात पर निर्भर करते हैं कि जोखिमों को कौन समझता है और कौन कार्रवाई कर सकता है।

स्पष्ट निर्णय

सार्वजनिक और व्यावसायिक साक्षरता यह निर्धारित करती है कि मजबूत सुरक्षा नीति राजनीतिक रूप से संभव है या नहीं।

प्रचार के माध्यम से काटना

स्पष्ट स्पष्टीकरण प्रचार, लैब पीआर और अस्पष्ट नैतिकता थिएटर द्वारा कब्जा कम कर देते हैं।

सदस्यता अनुमान हमलों का भविष्य

जैसे-जैसे मॉडल अधिक से अधिक व्यक्तिगत डेटा पर प्रशिक्षण लेते हैं, सदस्यता का अनुमान अकादमिक जिज्ञासा नहीं, बल्कि एक आवश्यक ऑडिट बनता जा रहा है। जीडीपीआर और इसी तरह के कानूनों की व्याख्या करने वाले नियामक तेजी से याद किए गए प्रशिक्षण डेटा को व्यक्तिगत डेटा के रूप में मानते हैं, इसलिए अनुपालन परीक्षणों के रूप में हमले दोगुने हो जाते हैं। मुख्य बचाव, विभेदक गोपनीयता, सिद्ध सीमाएं प्रदान करता है लेकिन सटीकता की लागत होती है, सख्त गोपनीयता लेखांकन, दुर्लभ रिकॉर्ड की चयनात्मक सुरक्षा और अनुरोध पर व्यक्तियों को हटाने के लिए मशीन अनलर्निंग की ओर अनुसंधान को आगे बढ़ाता है।

वास्तविक विश्व कार्यान्वयन

यह जांचने के लिए अस्पताल के डायग्नोस्टिक मॉडल का ऑडिट करना कि क्या व्यक्तिगत रोगी रिकॉर्ड को प्रशिक्षण डेटा के रूप में पहचाना जा सकता है

एक मॉडल द्वारा याद किए गए विशिष्ट उपयोगकर्ता रिकॉर्ड दिखाकर जीडीपीआर-प्रासंगिक रिसाव का प्रदर्शन

निजी ईमेल या दस्तावेज़ इसके प्रशिक्षण कोष में थे या नहीं, इसका परीक्षण करने के लिए एक भाषा मॉडल को रेड-टीम करना

यह मूल्यांकन करना कि क्या अंतर-गोपनीयता प्रशिक्षण ने वास्तव में सदस्य-बनाम-गैर-सदस्य अंतर को बंद कर दिया है

जोखिम और रेलिंग

अस्तित्वगत जोखिम को विज्ञान-कल्पना के रूप में मानते हुए क्षमता को मिश्रित किया जाता है।

उच्च स्वायत्तता के तहत संरेखण के साथ भ्रमित करने वाली सतह उत्पाद सुरक्षा।

गैर-अंग्रेज़ी और गैर-विशेषज्ञ दर्शकों को केवल निम्न-गुणवत्ता वाले स्रोतों के साथ छोड़ना।

कार्यान्वयन रोडमैप

1

उत्पाद के नुकसान, दुरुपयोग और नियंत्रण की हानि/गलत संरेखण जोखिमों को अलग करें।

2

पूछें कि कौन से सबूत समयसीमा और गंभीरता पर आपके दृष्टिकोण को बदल देंगे।

3

विपणन दावों की तुलना में प्राथमिक स्रोतों और ठोस मूल्यांकन को प्राथमिकता दें।

4

एक कार्य पथ की पहचान करें: कैरियर, नीति, वित्त पोषण, या कौशल - केवल जागरूकता नहीं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Membership Inference Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Membership Inference Attacks?

एक सदस्यता अनुमान हमला केवल मॉडल की जांच करके यह निर्धारित करने का प्रयास करता है कि किसी मॉडल को प्रशिक्षित करने के लिए किसी विशिष्ट व्यक्ति के डेटा का उपयोग किया गया था या नहीं। यह मायने रखता है क्योंकि यह पुष्टि करना कि कोई व्यक्ति चिकित्सा या वित्तीय प्रशिक्षण सेट में था, अपने आप में एक गंभीर गोपनीयता उल्लंघन हो सकता है।

सदस्यता अनुमान आक्रमण क्या निर्धारित करने का प्रयास कर रहा है?

हमला सदस्यता का अनुमान लगाता है: क्या किसी दिए गए डेटा बिंदु का उपयोग मॉडल को प्रशिक्षित करने के लिए किया गया था, जो स्वयं संवेदनशील जानकारी लीक कर सकता है।

कौन सी मॉडल संपत्ति इन हमलों के प्रति भेद्यता को सबसे अधिक बढ़ाती है?

ओवरफिटिंग से प्रशिक्षण सदस्यों और अदृश्य डेटा के बीच व्यवहारिक अंतर बढ़ जाता है, जिससे सदस्यता का पता लगाना आसान हो जाता है।

मूल 2017 शॉकरी एट अल ने कौन सी तकनीक बनाई। हमले पर भरोसा?

उन्होंने आक्रमण वर्गीकरणकर्ता के लिए लेबल किए गए सदस्य/गैर-सदस्य व्यवहार उत्पन्न करने के लिए लक्ष्य की नकल करने वाले छाया मॉडल को प्रशिक्षित किया।

रिकॉर्ड की सामग्री का खुलासा किए बिना भी सदस्यता का अनुमान हानिकारक क्यों हो सकता है?

यदि किसी डेटासेट को एक संवेदनशील विशेषता द्वारा परिभाषित किया गया है, तो केवल किसी की उपस्थिति की पुष्टि करने से उस विशेषता का पता चलता है।

संभावना अनुपात आक्रमण (LiRA) को हानि सीमा से अधिक मजबूत क्या बनाता है?

LiRA प्रत्येक रिकॉर्ड के साथ और उसके बिना प्रशिक्षित मॉडलों के वितरण से लक्ष्य हानि की तुलना करता है, प्रति-उदाहरण कठिनाई शोर को हटाता है।