समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

अध्ययन से पता चलता है कि एआई सुरक्षा बेंचमार्क बहुत कम परीक्षणों का उपयोग कर सकते हैं

यूके एआई सुरक्षा संस्थान से संबद्ध प्रीप्रिंट ने 97-99% कम संकेतों के साथ कई सुरक्षा-बेंचमार्क परिणामों को पुन: प्रस्तुत किया, जबकि चेतावनी दी कि छोटे परीक्षण वास्तविक दुनिया की सुरक्षा साबित नहीं करते हैं।

5 min readRead the primary source
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
Rivera and colleagues' research paper on arXiv
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.05086
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एआई सुरक्षा
एआई सिस्टम में हानिकारक व्यवहार, विफलताओं और दुरुपयोग के जोखिमों को कम करने पर केंद्रित क्षेत्र।
एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस)
एक सॉफ्टवेयर सिस्टम के लिए दूसरे सिस्टम को अनुरोध भेजने और उससे प्रतिक्रिया प्राप्त करने का एक संरचित तरीका।
सिस्टम प्रॉम्प्ट
एक उच्च प्राथमिकता वाला निर्देश जो किसी मॉडल के लिए व्यवहार, नीति और प्रतिक्रिया शैली निर्धारित करता है।
स्वयं की जांच करोएआई क्या है? प्रश्नोत्तरी

क्या हुआ?

5 अगस्त को पोस्ट किया गया एक शोध पत्र एआई सुरक्षा बेंचमार्क क्या कैप्चर करता है, इसे मापने के लिए शैक्षिक परीक्षण से एक विधि लागू करता है, उपयोगी संकेतों के छोटे सेट का चयन करता है, और मॉडल व्यवहार में परिवर्तनों का ऑडिट करता है।

दो स्वतंत्र शोधकर्ताओं और यूके एआई सुरक्षा संस्थान से संबद्ध दो शोधकर्ताओं ने आठ बेंचमार्क पर 192 चैट मॉडल का मूल्यांकन किया, जिसमें हानिकारक-अनुरोध अस्वीकार, सौम्य अनुरोधों को अति-अस्वीकार करना, प्रासंगिक नुकसान और सच्चाई शामिल है। पूरे सुइट में प्रीप्रोसेसिंग से पहले 5,255 संकेत थे; बिना अंक वाली प्रतिक्रियाओं और परीक्षण किए गए मॉडलों के बीच अंतर नहीं करने वाली वस्तुओं को हटाने के बाद विश्लेषण ने 5,067 को बरकरार रखा।

टीम ने मॉडलों को परीक्षार्थी के रूप में और बेंचमार्क संकेतों को परीक्षण आइटम के रूप में माना, आइटम प्रतिक्रिया सिद्धांत का उपयोग करके यह अनुमान लगाया कि कौन से संकेत कठिन थे और कौन से मॉडल सबसे अच्छे से अलग किए गए थे। इसके मुख्य कारक विश्लेषण में, एक तीन-कारक समाधान - जिसे इनकार की कठोरता, सच्चाई और प्रासंगिक नुकसान के रूप में संक्षेपित किया गया है - ने एकल कारक के लिए 47% की तुलना में मॉडल क्षमताओं में 77% भिन्नता की व्याख्या की।

20 आयोजित मूल्यांकनों में, तीन निश्चित 25-प्रॉम्प्ट परीक्षणों ने 2% से कम सूट का उपयोग करके उन तीन कारकों को पुनर्प्राप्त किया। हार्मबेंच, सॉरी-बेंच और ओआर-बेंच-हार्ड के लिए, लगभग 10 अनुकूली रूप से चुने गए संकेतों ने 0.92 से 0.94 के सहसंबंधों के साथ पूर्ण-बेंचमार्क रैंकिंग को पुन: प्रस्तुत किया और संकेतों की संख्या में 97-99% की कटौती की; जैसे-जैसे परीक्षण बजट बढ़ता गया, लाभ कम होता गया।

संपीड़न केवल यादृच्छिक नमूनाकरण नहीं है। आइटम प्रतिक्रिया सिद्धांत अनुमान लगाता है कि प्रत्येक संकेत कितना कठिन है और यह विभिन्न प्रतिक्रिया पैटर्न वाले मॉडल को कितनी अच्छी तरह अलग करता है, फिर उन वस्तुओं का चयन करता है जो बड़े परीक्षण की संरचना को संरक्षित करते हैं। लेखकों ने अनुकूली चयन के साथ निश्चित लघु रूपों की तुलना की और संकेतों को चुनने के लिए उपयोग किए गए डेटा को मापने के बजाय मूल्यांकन किया। यह डिज़ाइन इस संकीर्ण दावे का समर्थन करता है कि कुछ मौजूदा बेंचमार्क रैंकिंग को कुशलतापूर्वक पुन: प्रस्तुत किया जा सकता है; यह नहीं दिखाता है कि 10- या 25-आइटम परीक्षण पूरी तरह से नए विफलता मोड की खोज कर सकता है।

स्रोत विवरण: Rivera and colleagues' research paper on arXiv ↗

यह क्यों मायने रखता है?

अध्ययन से पता चलता है कि बेहतर-चयनित संकेत लगातार एआई सुरक्षा जांच को सस्ता बना सकते हैं, बिना यह दिखावा किए कि प्रत्येक बेंचमार्क एक सार्वभौमिक सुरक्षा स्कोर को मापता है।

सस्ते परीक्षण डेवलपर्स, छोटी प्रयोगशालाओं और स्वतंत्र मूल्यांकनकर्ताओं को प्रशिक्षण, फाइन-ट्यूनिंग, परिमाणीकरण और सिस्टम-प्रॉम्प्ट परिवर्तनों के दौरान अधिक मॉडल संस्करणों की जांच करने की सुविधा दे सकते हैं। परिणाम मौजूदा बेंचमार्क मापों को कुशलतापूर्वक पुन: प्रस्तुत करने के बारे में है, न कि उन बेंचमार्क का विस्तार करने के बारे में जो पता लगा सकते हैं।

कारक विश्लेषण एक स्कोरिंग ट्रेडऑफ़ को भी उजागर करता है। इनकार को पुरस्कृत करने वाले बेंचमार्क एक-दूसरे के साथ ओवरलैप हो सकते हैं, जबकि अनावश्यक इनकार से बचने के लिए बेंचमार्क विपरीत व्यवहार को पुरस्कृत करते हैं। वज़न बताए बिना उनका औसत निकालने से यह छिपाया जा सकता है कि क्या कोई मॉडल सुरक्षित हो गया है, केवल अधिक प्रतिबंधात्मक है, या सौम्य अनुरोधों पर कम उपयोगी है।

पेपर ने जानबूझकर प्रेरित सैंडबैगिंग व्यवहार पर ब्लैक-बॉक्स ऑडिट विधियों का भी परीक्षण किया। एक प्रतिक्रिया-पैटर्न जांच में चयनात्मक खराब प्रदर्शन पकड़ा गया लेकिन अधिकांश समान खराब प्रदर्शन नहीं हुआ; एक ऐतिहासिक क्षमता जांच जोड़ने से सिम्युलेटेड मामलों में संयुक्त पहचान 94-97% तक बढ़ गई। यह एकल स्कोर पर निर्भरता के बजाय स्तरित ऑडिट का समर्थन करता है।

डेवलपर्स के लिए, परिचालन मूल्य आवृत्ति है। हर बार पूर्ण बेंचमार्क के बजट का उपभोग किए बिना सिस्टम-प्रॉम्प्ट परिवर्तन, परिमाणीकरण पास, फाइन-ट्यून, टूल अपडेट, या सुरक्षा-नीति संशोधन के बाद एक छोटा मूल्यांकन फिर से चलाया जा सकता है। लेकिन परिणाम तभी उपयोगी होता है जब टीमें मूल सुइट को आवधिक ऑडिट के रूप में रखती हैं, आयोजित किए गए संकेतों को घुमाती हैं, और संपीड़ित परीक्षण के लिए सीधे अनुकूलन करने के बजाय आश्चर्यजनक परिवर्तनों की जांच करती हैं। अन्यथा सस्ता चेक ओवरफिटिंग का एक और लक्ष्य बन सकता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
What is AI? Quiz

Which description best fits "narrow AI", the kind of AI in use today?

आगे क्या देखना है

स्वतंत्र प्रतिकृति, भविष्य के मॉडल परिवारों पर सत्यापन और सबूतों पर नज़र रखें कि संक्षिप्त परीक्षण उन बेंचमार्क के बाहर व्यवहार की भविष्यवाणी करते हैं जिन्हें पुन: पेश करने के लिए उन्हें डिज़ाइन किया गया था।

यह एक नया प्रीप्रिंट है, पूर्ण सहकर्मी-समीक्षा निर्णय नहीं। अव्यक्त-संरचना विश्लेषण में 134 मॉडलों का उपयोग किया गया, जो लेखकों का कहना है कि पारंपरिक साइकोमेट्रिक मानकों से छोटा है, और एक वैकल्पिक निष्कर्षण विधि ने तीन के बजाय दो कारकों को बरकरार रखा। कारक नाम अनुभवजन्य सारांश हैं, सुरक्षा की मान्य परिभाषाएँ नहीं।

प्रत्येक मॉडल ने ओपनराउटर के माध्यम से प्रति उपलब्ध संकेत पर एक प्रतिक्रिया उत्पन्न की, और प्रत्येक बेंचमार्क ने अपने निर्धारित स्वचालित न्यायाधीश का उपयोग किया। परिणामी लघु परीक्षणों में मूल संकेतों, स्कोरिंग नियमों, भाषा कवरेज और न्यायाधीशों में खामियां आ सकती हैं; लेखक स्पष्ट रूप से कहते हैं कि संपीड़न यह नहीं दिखाता है कि एक बेंचमार्क तैनाती सुरक्षा की भविष्यवाणी करता है या भविष्य के मॉडल के लिए जानकारीपूर्ण रहता है।

सैंडबैगिंग परीक्षणों में मूल्यांकन से बचने के लिए परिष्कृत मॉडलों के बजाय मॉडल जीवों को प्रेरित किया गया, जिनका पता लगाना आसान हो सकता है। एपीआई जांच व्यवहारिक निरंतरता स्थापित करती है, न कि छिपे हुए मॉडल भार की पहचान, और अध्ययन ने ऑडिट विधियों को हराने के लिए विशेष रूप से प्रशिक्षित किसी प्रतिद्वंद्वी का परीक्षण नहीं किया।

पेपर की सबसे महत्वपूर्ण सीमा माप दक्षता और सुरक्षा आश्वासन के बीच है। एक संक्षिप्त रूप मूल बेंचमार्क में मौजूद अव्यक्त कारकों का अनुमान लगा सकता है, लेकिन यह उस बेंचमार्क की भाषा, जज, प्रॉम्प्ट फ़्रेमिंग और ब्लाइंड स्पॉट को विरासत में लेता है। भविष्य के मूल्यांकन में बहुभाषी संकेतों, उपकरण-सक्षम एजेंटों, लंबी बातचीत, प्रतिकूल रूप से सुव्यवस्थित मॉडल और स्वतंत्र मानवीय निर्णयों का परीक्षण किया जाना चाहिए। उन्हें तब भी रिपोर्ट करना चाहिए जब एक संपीड़ित स्कोर अस्थिर हो जाता है, क्योंकि रखे गए डेटा पर एक साफ सहसंबंध अगले मॉडल परिवार पर विफलता को छुपा सकता है।

एक व्यावहारिक अपनाने का नियम उन सीमाओं से चलता है: संपीड़ित परीक्षणों को प्रहरी के रूप में उपयोग करें, फैसले के रूप में नहीं। टीमें प्रतिगमन को पकड़ने के लिए उन्हें बार-बार चला सकती हैं, फिर जब संक्षिप्त रूप अप्रत्याशित रूप से चलता है तो पूर्ण बेंचमार्क और मानव समीक्षा में बदलाव को बढ़ा सकती हैं। अध्ययन के स्वयं के साक्ष्य उस स्तरित वर्कफ़्लो का समर्थन करते हैं क्योंकि कारक संरचना विशेष संकेतों, न्यायाधीशों और मॉडल आउटपुट से ली गई थी। चयनित आइटम, चयन कोड, रुके हुए परिणाम और संस्करण इतिहास को प्रकाशित करने से स्वतंत्र मूल्यांकनकर्ताओं को यह जांचने में मदद मिलेगी कि डेवलपर्स द्वारा देखे जाने के बाद और नए मॉडल परिवारों द्वारा प्रतिक्रियाओं के वितरण को बदलने के बाद छोटे परीक्षण जानकारीपूर्ण बने रहते हैं या नहीं।

जब कोई मॉडल अपडेट किया जाता है तो वही पारदर्शिता मायने रखती है। एक पीढ़ी पर कैलिब्रेटेड एक छोटा परीक्षण बहुत आसान, बहुत संकीर्ण, या गलती से एक नए सिस्टम प्रॉम्प्ट के साथ संरेखित हो सकता है। टीमों को पूर्व संस्करणों को संरक्षित करना चाहिए, जब कोई आइटम या जज बदलता है तो खुलासा करना चाहिए, और एक सटीक सुरक्षा स्कोर के रूप में संपीड़ित रैंकिंग प्रस्तुत करने के बजाय आत्मविश्वास अंतराल की रिपोर्ट करनी चाहिए। वे प्रथाएँ मूल बेंचमार्क को गहन समीक्षा के लिए उपलब्ध रखते हुए पेपर के दक्षता परिणाम को एक श्रव्य निगरानी कार्यक्रम में बदल देती हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई क्या है?ChatGPT और एलएलएमएआई नैतिकताआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?