समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

Google DeepMind पायलट मालिकाना AI मॉडल के लिए डबल-ब्लाइंड मूल्यांकन करते हैं

Google DeepMind का कहना है कि वह क्रिप्टोग्राफिक रूप से संरक्षित वातावरण में Gemini फ्लैश लाइट मॉडल का परीक्षण कर रहा है, जो मूल्यांकन संकेतों और मॉडल वजन दोनों को निजी रखने के लिए डिज़ाइन किया गया है।

5 min readRead the primary source
Primary-source image accompanying Google DeepMind pilots double-blind evaluations for proprietary AI models
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
deepmind.google
स्रोत लिंक
deepmind.googlehttps://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एआई सुरक्षा
एआई सिस्टम में हानिकारक व्यवहार, विफलताओं और दुरुपयोग के जोखिमों को कम करने पर केंद्रित क्षेत्र।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

Google DeepMind ने एक पायलट की घोषणा की, जिसे वह मालिकाना, फ्रंटियर-क्लास एआई मॉडल का पहला डबल-ब्लाइंड मूल्यांकन बताता है। परीक्षण Gemini फ़्लैश लाइट मॉडल और बाहरी मूल्यांकनकर्ताओं द्वारा प्रदान किए गए गोपनीय बेंचमार्क का उपयोग करता है।

Google DeepMind ने 27 अगस्त को कहा कि वह एक डबल-ब्लाइंड मूल्यांकन का संचालन कर रहा है जिसमें क्रिप्टोग्राफ़िक वातावरण के अंदर बाहरी परीक्षण किया जाता है। कंपनी ने इस परियोजना को मालिकाना, फ्रंटियर-क्लास एआई मॉडल का पहला ऐसा मूल्यांकन बताया। परीक्षण किया जा रहा मॉडल Gemini फ़्लैश लाइट मॉडल है, और बेंचमार्क गोपनीय हैं।

पायलट Google DeepMind, सिंगापुर AI सेफ्टी इंस्टीट्यूट, ओपनमाइन्ड, AVERI और MLCCommons को एक साथ लाता है। सूत्र का कहना है कि प्रतिभागी गोपनीयता-संरक्षण वातावरण में गोपनीय बेंचमार्क के खिलाफ मॉडल का परीक्षण करेंगे। यह बेंचमार्क प्रश्नों की पहचान नहीं करता है, मॉडल के विशिष्ट संस्करण का खुलासा नहीं करता है या पायलट से परिणाम प्रदान नहीं करता है।

सिस्टम कॉन्फिडेंशियल स्पेस का उपयोग करता है, जो Google क्लाउड के कॉन्फिडेंशियल कंप्यूटिंग पोर्टफोलियो का हिस्सा है। Google का कहना है कि पर्यावरण क्रिप्टोग्राफ़िक रूप से सत्यापित कर सकता है कि बाहरी मूल्यांकन डेटा और मालिकाना मॉडल उनके संबंधित स्वामियों के लिए निजी रहते हैं। वर्णित व्यवस्था के तहत, मूल्यांकनकर्ता Gemini मॉडल वजन नहीं देख सकते हैं, जबकि Google मूल्यांकनकर्ताओं के परीक्षण संकेत नहीं देख सकते हैं।

बताई गई समस्या बेंचमार्क संदूषण है: एक मॉडल बेहतर प्रदर्शन कर सकता है यदि उसे परीक्षण से पहले मूल्यांकन प्रश्नों या संकेतों का सामना करना पड़ा हो। Google का कहना है कि मौजूदा शून्य-लॉगिंग प्रक्रियाओं और संविदात्मक सुरक्षा उपायों ने बाहरी संकेतों को गोपनीय रखने में मदद की है, लेकिन तर्क है कि तकनीकी और क्रिप्टोग्राफ़िक सुरक्षा आश्वासन की एक और परत जोड़ती है।

घोषणा पाठकों को कार्यप्रणाली और निष्कर्षों के लिए एक तकनीकी रिपोर्ट की ओर इंगित करती है। स्रोत पाठ में रिपोर्ट के परिणाम, एक स्वतंत्र ऑडिट, इसका आकलन करने के लिए पर्याप्त विवरण में क्रिप्टोग्राफ़िक सत्यापन प्रोटोकॉल का विवरण या सबूत शामिल नहीं है कि पायलट ने पहले ही मॉडल प्रदर्शन या तैनाती निर्णय बदल दिए हैं।

स्रोत विवरण: deepmind.google ↗

यह क्यों मायने रखता है?

इस दृष्टिकोण का उद्देश्य स्वतंत्र संगठनों को मॉडल के वजन प्राप्त किए बिना या मॉडल प्रदाता को अपने परीक्षण संकेतों को उजागर किए बिना सक्षम एआई सिस्टम का परीक्षण करने की अनुमति देते हुए बेंचमार्क संदूषण को कम करना है।

एआई बेंचमार्क स्कोर का उपयोग अक्सर सिस्टम की तुलना करने और क्षमता और सुरक्षा के बारे में निर्णय लेने के लिए किया जाता है। यदि किसी मॉडल या उसके डेवलपर के पास पहले से परीक्षण सामग्री तक पहुंच है, तो एक उच्च स्कोर आंशिक रूप से उस क्षमता के बजाय मूल्यांकन के साथ परिचितता को प्रतिबिंबित कर सकता है जिसे परीक्षण मापने का इरादा रखता है। Google ने उस विश्वसनीयता की समस्या को हल करने के तरीके के रूप में डबल-ब्लाइंड परीक्षण तैयार किया है।

प्रस्तावित व्यवस्था बाहरी मूल्यांकन में व्यावहारिक संघर्ष को लक्षित करती है। ऐतिहासिक रूप से, Google के अनुसार, मूल्यांकनकर्ताओं ने या तो मॉडल प्रदाता के साथ संकेत साझा किए या प्रदाता से मॉडल वजन साझा करने के लिए कहा। पहला विकल्प गोपनीय प्रश्नों को उजागर कर सकता है; दूसरा मूल्यवान बौद्धिक संपदा को उजागर कर सकता है। पायलट को किसी भी विनिमय की आवश्यकता से बचने के लिए डिज़ाइन किया गया है।

गोपनीयता-संरक्षण मूल्यांकन साइबर सुरक्षा या सरकारी एजेंसियों से जुड़े परीक्षणों के लिए विशेष रूप से उपयोगी हो सकता है, जहां संकेत, परिदृश्य और डेटा संवेदनशील हो सकते हैं। सूत्र का कहना है कि यह दृष्टिकोण डेटा संप्रभुता और सुरक्षा को संरक्षित करते हुए स्वतंत्र परीक्षण का समर्थन कर सकता है। यह एक घोषित संभावित लाभ है, इस पायलट का प्रदर्शित परिणाम नहीं।

व्यापक महत्व इस बात पर निर्भर करता है कि क्या क्रिप्टोग्राफ़िक साक्ष्य यह स्थापित कर सकते हैं कि मूल्यांकन वातावरण के अंदर क्या हुआ और क्या बाहरी पक्ष सार्थक तरीके से उस साक्ष्य का निरीक्षण या सत्यापन कर सकते हैं। संकेतों और वज़न को छिपाकर रखने से कुछ जोखिम कम हो सकते हैं, लेकिन यह अपने आप में यह नहीं दर्शाता है कि बेंचमार्क अच्छी तरह से डिज़ाइन किया गया है, कि मॉडल का व्यापक परीक्षण किया गया था या कि परिणाम वास्तविक दुनिया में उपयोग के लिए सामान्य हैं।

इसलिए घोषणा एक नए मॉडल क्षमता के बजाय मूल्यांकन बुनियादी ढांचे में विकास है। इसका तत्काल सार्वजनिक मूल्य उच्च जोखिम वाले एआई दावों की जांच को आसान बनाने की संभावना में है। इसकी सीमाएँ पर्याप्त हैं: स्रोत कोई प्रदर्शन परिणाम नहीं देता है, पारंपरिक मूल्यांकन के साथ कोई तुलना नहीं करता है और अभी तक कोई सबूत नहीं है कि विधि व्यापक रूप से लागू करने योग्य है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

मुख्य अनसुलझे प्रश्न हैं कि क्या पायलट बड़े पैमाने पर विश्वसनीय रूप से काम करता है, सत्यापन कितना स्वतंत्र है, तकनीकी रिपोर्ट क्या दिखाएगी, और क्या अन्य मॉडल डेवलपर्स तुलनीय सुरक्षा उपायों को अपनाते हैं।

तकनीकी रिपोर्ट में मूल्यांकन प्रोटोकॉल को स्पष्ट किया जाना चाहिए, जिसमें प्रत्येक भागीदार कौन सी जानकारी देख सकता है, क्रिप्टोग्राफ़िक वातावरण कैसे कॉन्फ़िगर किया गया है और समीक्षकों के लिए क्या साक्ष्य तैयार किया गया है। उन विवरणों के बिना, यह आंकना मुश्किल है कि पायलट मौजूदा गोपनीयता समझौतों और लॉगिंग नियंत्रणों से परे कितना भरोसा जोड़ता है।

एक महत्वपूर्ण सवाल यह है कि क्या पायलट केवल एक संकीर्ण मॉडल और बेंचमार्क संयोजन का परीक्षण करता है या क्या विधि विभिन्न मॉडल आर्किटेक्चर, मूल्यांकन प्रदाताओं और संवेदनशील डेटासेट का समर्थन कर सकती है। व्यावहारिक अपनाना लागत, प्रदर्शन, मौजूदा परीक्षण उपकरणों के साथ अनुकूलता और स्वतंत्र वातावरण में मूल्यांकन दोहराने की क्षमता पर निर्भर करेगा।

पर्यवेक्षकों को बेंचमार्क के बारे में भी जानकारी ढूंढनी चाहिए। डबल-ब्लाइंड प्रक्रियाएं परीक्षण प्रश्नों को सुरक्षित रखने में मदद कर सकती हैं, लेकिन वे कमजोर कार्य डिज़ाइन, अपूर्ण कवरेज, अस्पष्ट स्कोरिंग या तैनाती में बेंचमार्क प्रदर्शन और व्यवहार के बीच बेमेल जैसी समस्याओं का समाधान नहीं कर सकती हैं। सूत्र ने यह नहीं बताया कि उन मुद्दों से कैसे निपटा जाएगा।

भाग लेने वाले संगठनों की भूमिकाएँ और निरीक्षण व्यवस्थाएँ मायने रखेंगी। घोषणा में कई साझेदारों के नाम बताए गए हैं, लेकिन यह नहीं बताया गया है कि मूल्यांकन को कौन नियंत्रित करता है, परिणामों को कौन चुनौती दे सकता है, क्या कोई पार्टी ऑडिट प्रकाशित करेगी या सिस्टम के संचालन पर विवादों का समाधान कैसे किया जाएगा।

अंत में, उद्योग की प्रतिक्रिया यह बताएगी कि क्या यह एक Google-विशिष्ट प्रयोग बना रहेगा या एक साझा अभ्यास बन जाएगा। सूत्र का कहना है कि पायलट का उद्देश्य व्यापक उद्योग को सुरक्षित और अधिक विश्वसनीय एआई सिस्टम विकसित करने में मदद करना है, लेकिन यह अन्य मॉडल डेवलपर्स, नियामकों या स्वतंत्र परीक्षण निकायों से प्रतिबद्धताओं की घोषणा नहीं करता है। स्रोत उस व्यापक गोद लेने के प्रश्न को खुला छोड़ देता है, इसलिए किसी भी व्यापक उद्योग प्रभाव का निर्धारण किया जाना बाकी है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई नैतिकताएआई प्रशिक्षणएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?