क्या हुआ?
Google DeepMind ने एक पायलट की घोषणा की, जिसे वह मालिकाना, फ्रंटियर-क्लास एआई मॉडल का पहला डबल-ब्लाइंड मूल्यांकन बताता है। परीक्षण Gemini फ़्लैश लाइट मॉडल और बाहरी मूल्यांकनकर्ताओं द्वारा प्रदान किए गए गोपनीय बेंचमार्क का उपयोग करता है।
Google DeepMind ने 27 अगस्त को कहा कि वह एक डबल-ब्लाइंड मूल्यांकन का संचालन कर रहा है जिसमें क्रिप्टोग्राफ़िक वातावरण के अंदर बाहरी परीक्षण किया जाता है। कंपनी ने इस परियोजना को मालिकाना, फ्रंटियर-क्लास एआई मॉडल का पहला ऐसा मूल्यांकन बताया। परीक्षण किया जा रहा मॉडल Gemini फ़्लैश लाइट मॉडल है, और बेंचमार्क गोपनीय हैं।
पायलट Google DeepMind, सिंगापुर AI सेफ्टी इंस्टीट्यूट, ओपनमाइन्ड, AVERI और MLCCommons को एक साथ लाता है। सूत्र का कहना है कि प्रतिभागी गोपनीयता-संरक्षण वातावरण में गोपनीय बेंचमार्क के खिलाफ मॉडल का परीक्षण करेंगे। यह बेंचमार्क प्रश्नों की पहचान नहीं करता है, मॉडल के विशिष्ट संस्करण का खुलासा नहीं करता है या पायलट से परिणाम प्रदान नहीं करता है।
सिस्टम कॉन्फिडेंशियल स्पेस का उपयोग करता है, जो Google क्लाउड के कॉन्फिडेंशियल कंप्यूटिंग पोर्टफोलियो का हिस्सा है। Google का कहना है कि पर्यावरण क्रिप्टोग्राफ़िक रूप से सत्यापित कर सकता है कि बाहरी मूल्यांकन डेटा और मालिकाना मॉडल उनके संबंधित स्वामियों के लिए निजी रहते हैं। वर्णित व्यवस्था के तहत, मूल्यांकनकर्ता Gemini मॉडल वजन नहीं देख सकते हैं, जबकि Google मूल्यांकनकर्ताओं के परीक्षण संकेत नहीं देख सकते हैं।
बताई गई समस्या बेंचमार्क संदूषण है: एक मॉडल बेहतर प्रदर्शन कर सकता है यदि उसे परीक्षण से पहले मूल्यांकन प्रश्नों या संकेतों का सामना करना पड़ा हो। Google का कहना है कि मौजूदा शून्य-लॉगिंग प्रक्रियाओं और संविदात्मक सुरक्षा उपायों ने बाहरी संकेतों को गोपनीय रखने में मदद की है, लेकिन तर्क है कि तकनीकी और क्रिप्टोग्राफ़िक सुरक्षा आश्वासन की एक और परत जोड़ती है।
घोषणा पाठकों को कार्यप्रणाली और निष्कर्षों के लिए एक तकनीकी रिपोर्ट की ओर इंगित करती है। स्रोत पाठ में रिपोर्ट के परिणाम, एक स्वतंत्र ऑडिट, इसका आकलन करने के लिए पर्याप्त विवरण में क्रिप्टोग्राफ़िक सत्यापन प्रोटोकॉल का विवरण या सबूत शामिल नहीं है कि पायलट ने पहले ही मॉडल प्रदर्शन या तैनाती निर्णय बदल दिए हैं।
स्रोत विवरण: deepmind.google ↗
यह क्यों मायने रखता है?
इस दृष्टिकोण का उद्देश्य स्वतंत्र संगठनों को मॉडल के वजन प्राप्त किए बिना या मॉडल प्रदाता को अपने परीक्षण संकेतों को उजागर किए बिना सक्षम एआई सिस्टम का परीक्षण करने की अनुमति देते हुए बेंचमार्क संदूषण को कम करना है।
एआई बेंचमार्क स्कोर का उपयोग अक्सर सिस्टम की तुलना करने और क्षमता और सुरक्षा के बारे में निर्णय लेने के लिए किया जाता है। यदि किसी मॉडल या उसके डेवलपर के पास पहले से परीक्षण सामग्री तक पहुंच है, तो एक उच्च स्कोर आंशिक रूप से उस क्षमता के बजाय मूल्यांकन के साथ परिचितता को प्रतिबिंबित कर सकता है जिसे परीक्षण मापने का इरादा रखता है। Google ने उस विश्वसनीयता की समस्या को हल करने के तरीके के रूप में डबल-ब्लाइंड परीक्षण तैयार किया है।
प्रस्तावित व्यवस्था बाहरी मूल्यांकन में व्यावहारिक संघर्ष को लक्षित करती है। ऐतिहासिक रूप से, Google के अनुसार, मूल्यांकनकर्ताओं ने या तो मॉडल प्रदाता के साथ संकेत साझा किए या प्रदाता से मॉडल वजन साझा करने के लिए कहा। पहला विकल्प गोपनीय प्रश्नों को उजागर कर सकता है; दूसरा मूल्यवान बौद्धिक संपदा को उजागर कर सकता है। पायलट को किसी भी विनिमय की आवश्यकता से बचने के लिए डिज़ाइन किया गया है।
गोपनीयता-संरक्षण मूल्यांकन साइबर सुरक्षा या सरकारी एजेंसियों से जुड़े परीक्षणों के लिए विशेष रूप से उपयोगी हो सकता है, जहां संकेत, परिदृश्य और डेटा संवेदनशील हो सकते हैं। सूत्र का कहना है कि यह दृष्टिकोण डेटा संप्रभुता और सुरक्षा को संरक्षित करते हुए स्वतंत्र परीक्षण का समर्थन कर सकता है। यह एक घोषित संभावित लाभ है, इस पायलट का प्रदर्शित परिणाम नहीं।
व्यापक महत्व इस बात पर निर्भर करता है कि क्या क्रिप्टोग्राफ़िक साक्ष्य यह स्थापित कर सकते हैं कि मूल्यांकन वातावरण के अंदर क्या हुआ और क्या बाहरी पक्ष सार्थक तरीके से उस साक्ष्य का निरीक्षण या सत्यापन कर सकते हैं। संकेतों और वज़न को छिपाकर रखने से कुछ जोखिम कम हो सकते हैं, लेकिन यह अपने आप में यह नहीं दर्शाता है कि बेंचमार्क अच्छी तरह से डिज़ाइन किया गया है, कि मॉडल का व्यापक परीक्षण किया गया था या कि परिणाम वास्तविक दुनिया में उपयोग के लिए सामान्य हैं।
इसलिए घोषणा एक नए मॉडल क्षमता के बजाय मूल्यांकन बुनियादी ढांचे में विकास है। इसका तत्काल सार्वजनिक मूल्य उच्च जोखिम वाले एआई दावों की जांच को आसान बनाने की संभावना में है। इसकी सीमाएँ पर्याप्त हैं: स्रोत कोई प्रदर्शन परिणाम नहीं देता है, पारंपरिक मूल्यांकन के साथ कोई तुलना नहीं करता है और अभी तक कोई सबूत नहीं है कि विधि व्यापक रूप से लागू करने योग्य है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
मुख्य अनसुलझे प्रश्न हैं कि क्या पायलट बड़े पैमाने पर विश्वसनीय रूप से काम करता है, सत्यापन कितना स्वतंत्र है, तकनीकी रिपोर्ट क्या दिखाएगी, और क्या अन्य मॉडल डेवलपर्स तुलनीय सुरक्षा उपायों को अपनाते हैं।
तकनीकी रिपोर्ट में मूल्यांकन प्रोटोकॉल को स्पष्ट किया जाना चाहिए, जिसमें प्रत्येक भागीदार कौन सी जानकारी देख सकता है, क्रिप्टोग्राफ़िक वातावरण कैसे कॉन्फ़िगर किया गया है और समीक्षकों के लिए क्या साक्ष्य तैयार किया गया है। उन विवरणों के बिना, यह आंकना मुश्किल है कि पायलट मौजूदा गोपनीयता समझौतों और लॉगिंग नियंत्रणों से परे कितना भरोसा जोड़ता है।
एक महत्वपूर्ण सवाल यह है कि क्या पायलट केवल एक संकीर्ण मॉडल और बेंचमार्क संयोजन का परीक्षण करता है या क्या विधि विभिन्न मॉडल आर्किटेक्चर, मूल्यांकन प्रदाताओं और संवेदनशील डेटासेट का समर्थन कर सकती है। व्यावहारिक अपनाना लागत, प्रदर्शन, मौजूदा परीक्षण उपकरणों के साथ अनुकूलता और स्वतंत्र वातावरण में मूल्यांकन दोहराने की क्षमता पर निर्भर करेगा।
पर्यवेक्षकों को बेंचमार्क के बारे में भी जानकारी ढूंढनी चाहिए। डबल-ब्लाइंड प्रक्रियाएं परीक्षण प्रश्नों को सुरक्षित रखने में मदद कर सकती हैं, लेकिन वे कमजोर कार्य डिज़ाइन, अपूर्ण कवरेज, अस्पष्ट स्कोरिंग या तैनाती में बेंचमार्क प्रदर्शन और व्यवहार के बीच बेमेल जैसी समस्याओं का समाधान नहीं कर सकती हैं। सूत्र ने यह नहीं बताया कि उन मुद्दों से कैसे निपटा जाएगा।
भाग लेने वाले संगठनों की भूमिकाएँ और निरीक्षण व्यवस्थाएँ मायने रखेंगी। घोषणा में कई साझेदारों के नाम बताए गए हैं, लेकिन यह नहीं बताया गया है कि मूल्यांकन को कौन नियंत्रित करता है, परिणामों को कौन चुनौती दे सकता है, क्या कोई पार्टी ऑडिट प्रकाशित करेगी या सिस्टम के संचालन पर विवादों का समाधान कैसे किया जाएगा।
अंत में, उद्योग की प्रतिक्रिया यह बताएगी कि क्या यह एक Google-विशिष्ट प्रयोग बना रहेगा या एक साझा अभ्यास बन जाएगा। सूत्र का कहना है कि पायलट का उद्देश्य व्यापक उद्योग को सुरक्षित और अधिक विश्वसनीय एआई सिस्टम विकसित करने में मदद करना है, लेकिन यह अन्य मॉडल डेवलपर्स, नियामकों या स्वतंत्र परीक्षण निकायों से प्रतिबद्धताओं की घोषणा नहीं करता है। स्रोत उस व्यापक गोद लेने के प्रश्न को खुला छोड़ देता है, इसलिए किसी भी व्यापक उद्योग प्रभाव का निर्धारण किया जाना बाकी है।