क्या हुआ?
5 अगस्त को पोस्ट किया गया एक शोध पत्र एआई सुरक्षा बेंचमार्क क्या कैप्चर करता है, इसे मापने के लिए शैक्षिक परीक्षण से एक विधि लागू करता है, उपयोगी संकेतों के छोटे सेट का चयन करता है, और मॉडल व्यवहार में परिवर्तनों का ऑडिट करता है।
दो स्वतंत्र शोधकर्ताओं और यूके एआई सुरक्षा संस्थान से संबद्ध दो शोधकर्ताओं ने आठ बेंचमार्क पर 192 चैट मॉडल का मूल्यांकन किया, जिसमें हानिकारक-अनुरोध अस्वीकार, सौम्य अनुरोधों को अति-अस्वीकार करना, प्रासंगिक नुकसान और सच्चाई शामिल है। पूरे सुइट में प्रीप्रोसेसिंग से पहले 5,255 संकेत थे; बिना अंक वाली प्रतिक्रियाओं और परीक्षण किए गए मॉडलों के बीच अंतर नहीं करने वाली वस्तुओं को हटाने के बाद विश्लेषण ने 5,067 को बरकरार रखा।
टीम ने मॉडलों को परीक्षार्थी के रूप में और बेंचमार्क संकेतों को परीक्षण आइटम के रूप में माना, आइटम प्रतिक्रिया सिद्धांत का उपयोग करके यह अनुमान लगाया कि कौन से संकेत कठिन थे और कौन से मॉडल सबसे अच्छे से अलग किए गए थे। इसके मुख्य कारक विश्लेषण में, एक तीन-कारक समाधान - जिसे इनकार की कठोरता, सच्चाई और प्रासंगिक नुकसान के रूप में संक्षेपित किया गया है - ने एकल कारक के लिए 47% की तुलना में मॉडल क्षमताओं में 77% भिन्नता की व्याख्या की।
20 आयोजित मूल्यांकनों में, तीन निश्चित 25-प्रॉम्प्ट परीक्षणों ने 2% से कम सूट का उपयोग करके उन तीन कारकों को पुनर्प्राप्त किया। हार्मबेंच, सॉरी-बेंच और ओआर-बेंच-हार्ड के लिए, लगभग 10 अनुकूली रूप से चुने गए संकेतों ने 0.92 से 0.94 के सहसंबंधों के साथ पूर्ण-बेंचमार्क रैंकिंग को पुन: प्रस्तुत किया और संकेतों की संख्या में 97-99% की कटौती की; जैसे-जैसे परीक्षण बजट बढ़ता गया, लाभ कम होता गया।
संपीड़न केवल यादृच्छिक नमूनाकरण नहीं है। आइटम प्रतिक्रिया सिद्धांत अनुमान लगाता है कि प्रत्येक संकेत कितना कठिन है और यह विभिन्न प्रतिक्रिया पैटर्न वाले मॉडल को कितनी अच्छी तरह अलग करता है, फिर उन वस्तुओं का चयन करता है जो बड़े परीक्षण की संरचना को संरक्षित करते हैं। लेखकों ने अनुकूली चयन के साथ निश्चित लघु रूपों की तुलना की और संकेतों को चुनने के लिए उपयोग किए गए डेटा को मापने के बजाय मूल्यांकन किया। यह डिज़ाइन इस संकीर्ण दावे का समर्थन करता है कि कुछ मौजूदा बेंचमार्क रैंकिंग को कुशलतापूर्वक पुन: प्रस्तुत किया जा सकता है; यह नहीं दिखाता है कि 10- या 25-आइटम परीक्षण पूरी तरह से नए विफलता मोड की खोज कर सकता है।
स्रोत विवरण: Rivera and colleagues' research paper on arXiv ↗
यह क्यों मायने रखता है?
अध्ययन से पता चलता है कि बेहतर-चयनित संकेत लगातार एआई सुरक्षा जांच को सस्ता बना सकते हैं, बिना यह दिखावा किए कि प्रत्येक बेंचमार्क एक सार्वभौमिक सुरक्षा स्कोर को मापता है।
सस्ते परीक्षण डेवलपर्स, छोटी प्रयोगशालाओं और स्वतंत्र मूल्यांकनकर्ताओं को प्रशिक्षण, फाइन-ट्यूनिंग, परिमाणीकरण और सिस्टम-प्रॉम्प्ट परिवर्तनों के दौरान अधिक मॉडल संस्करणों की जांच करने की सुविधा दे सकते हैं। परिणाम मौजूदा बेंचमार्क मापों को कुशलतापूर्वक पुन: प्रस्तुत करने के बारे में है, न कि उन बेंचमार्क का विस्तार करने के बारे में जो पता लगा सकते हैं।
कारक विश्लेषण एक स्कोरिंग ट्रेडऑफ़ को भी उजागर करता है। इनकार को पुरस्कृत करने वाले बेंचमार्क एक-दूसरे के साथ ओवरलैप हो सकते हैं, जबकि अनावश्यक इनकार से बचने के लिए बेंचमार्क विपरीत व्यवहार को पुरस्कृत करते हैं। वज़न बताए बिना उनका औसत निकालने से यह छिपाया जा सकता है कि क्या कोई मॉडल सुरक्षित हो गया है, केवल अधिक प्रतिबंधात्मक है, या सौम्य अनुरोधों पर कम उपयोगी है।
पेपर ने जानबूझकर प्रेरित सैंडबैगिंग व्यवहार पर ब्लैक-बॉक्स ऑडिट विधियों का भी परीक्षण किया। एक प्रतिक्रिया-पैटर्न जांच में चयनात्मक खराब प्रदर्शन पकड़ा गया लेकिन अधिकांश समान खराब प्रदर्शन नहीं हुआ; एक ऐतिहासिक क्षमता जांच जोड़ने से सिम्युलेटेड मामलों में संयुक्त पहचान 94-97% तक बढ़ गई। यह एकल स्कोर पर निर्भरता के बजाय स्तरित ऑडिट का समर्थन करता है।
डेवलपर्स के लिए, परिचालन मूल्य आवृत्ति है। हर बार पूर्ण बेंचमार्क के बजट का उपभोग किए बिना सिस्टम-प्रॉम्प्ट परिवर्तन, परिमाणीकरण पास, फाइन-ट्यून, टूल अपडेट, या सुरक्षा-नीति संशोधन के बाद एक छोटा मूल्यांकन फिर से चलाया जा सकता है। लेकिन परिणाम तभी उपयोगी होता है जब टीमें मूल सुइट को आवधिक ऑडिट के रूप में रखती हैं, आयोजित किए गए संकेतों को घुमाती हैं, और संपीड़ित परीक्षण के लिए सीधे अनुकूलन करने के बजाय आश्चर्यजनक परिवर्तनों की जांच करती हैं। अन्यथा सस्ता चेक ओवरफिटिंग का एक और लक्ष्य बन सकता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
आगे क्या देखना है
स्वतंत्र प्रतिकृति, भविष्य के मॉडल परिवारों पर सत्यापन और सबूतों पर नज़र रखें कि संक्षिप्त परीक्षण उन बेंचमार्क के बाहर व्यवहार की भविष्यवाणी करते हैं जिन्हें पुन: पेश करने के लिए उन्हें डिज़ाइन किया गया था।
यह एक नया प्रीप्रिंट है, पूर्ण सहकर्मी-समीक्षा निर्णय नहीं। अव्यक्त-संरचना विश्लेषण में 134 मॉडलों का उपयोग किया गया, जो लेखकों का कहना है कि पारंपरिक साइकोमेट्रिक मानकों से छोटा है, और एक वैकल्पिक निष्कर्षण विधि ने तीन के बजाय दो कारकों को बरकरार रखा। कारक नाम अनुभवजन्य सारांश हैं, सुरक्षा की मान्य परिभाषाएँ नहीं।
प्रत्येक मॉडल ने ओपनराउटर के माध्यम से प्रति उपलब्ध संकेत पर एक प्रतिक्रिया उत्पन्न की, और प्रत्येक बेंचमार्क ने अपने निर्धारित स्वचालित न्यायाधीश का उपयोग किया। परिणामी लघु परीक्षणों में मूल संकेतों, स्कोरिंग नियमों, भाषा कवरेज और न्यायाधीशों में खामियां आ सकती हैं; लेखक स्पष्ट रूप से कहते हैं कि संपीड़न यह नहीं दिखाता है कि एक बेंचमार्क तैनाती सुरक्षा की भविष्यवाणी करता है या भविष्य के मॉडल के लिए जानकारीपूर्ण रहता है।
सैंडबैगिंग परीक्षणों में मूल्यांकन से बचने के लिए परिष्कृत मॉडलों के बजाय मॉडल जीवों को प्रेरित किया गया, जिनका पता लगाना आसान हो सकता है। एपीआई जांच व्यवहारिक निरंतरता स्थापित करती है, न कि छिपे हुए मॉडल भार की पहचान, और अध्ययन ने ऑडिट विधियों को हराने के लिए विशेष रूप से प्रशिक्षित किसी प्रतिद्वंद्वी का परीक्षण नहीं किया।
पेपर की सबसे महत्वपूर्ण सीमा माप दक्षता और सुरक्षा आश्वासन के बीच है। एक संक्षिप्त रूप मूल बेंचमार्क में मौजूद अव्यक्त कारकों का अनुमान लगा सकता है, लेकिन यह उस बेंचमार्क की भाषा, जज, प्रॉम्प्ट फ़्रेमिंग और ब्लाइंड स्पॉट को विरासत में लेता है। भविष्य के मूल्यांकन में बहुभाषी संकेतों, उपकरण-सक्षम एजेंटों, लंबी बातचीत, प्रतिकूल रूप से सुव्यवस्थित मॉडल और स्वतंत्र मानवीय निर्णयों का परीक्षण किया जाना चाहिए। उन्हें तब भी रिपोर्ट करना चाहिए जब एक संपीड़ित स्कोर अस्थिर हो जाता है, क्योंकि रखे गए डेटा पर एक साफ सहसंबंध अगले मॉडल परिवार पर विफलता को छुपा सकता है।
एक व्यावहारिक अपनाने का नियम उन सीमाओं से चलता है: संपीड़ित परीक्षणों को प्रहरी के रूप में उपयोग करें, फैसले के रूप में नहीं। टीमें प्रतिगमन को पकड़ने के लिए उन्हें बार-बार चला सकती हैं, फिर जब संक्षिप्त रूप अप्रत्याशित रूप से चलता है तो पूर्ण बेंचमार्क और मानव समीक्षा में बदलाव को बढ़ा सकती हैं। अध्ययन के स्वयं के साक्ष्य उस स्तरित वर्कफ़्लो का समर्थन करते हैं क्योंकि कारक संरचना विशेष संकेतों, न्यायाधीशों और मॉडल आउटपुट से ली गई थी। चयनित आइटम, चयन कोड, रुके हुए परिणाम और संस्करण इतिहास को प्रकाशित करने से स्वतंत्र मूल्यांकनकर्ताओं को यह जांचने में मदद मिलेगी कि डेवलपर्स द्वारा देखे जाने के बाद और नए मॉडल परिवारों द्वारा प्रतिक्रियाओं के वितरण को बदलने के बाद छोटे परीक्षण जानकारीपूर्ण बने रहते हैं या नहीं।
जब कोई मॉडल अपडेट किया जाता है तो वही पारदर्शिता मायने रखती है। एक पीढ़ी पर कैलिब्रेटेड एक छोटा परीक्षण बहुत आसान, बहुत संकीर्ण, या गलती से एक नए सिस्टम प्रॉम्प्ट के साथ संरेखित हो सकता है। टीमों को पूर्व संस्करणों को संरक्षित करना चाहिए, जब कोई आइटम या जज बदलता है तो खुलासा करना चाहिए, और एक सटीक सुरक्षा स्कोर के रूप में संपीड़ित रैंकिंग प्रस्तुत करने के बजाय आत्मविश्वास अंतराल की रिपोर्ट करनी चाहिए। वे प्रथाएँ मूल बेंचमार्क को गहन समीक्षा के लिए उपलब्ध रखते हुए पेपर के दक्षता परिणाम को एक श्रव्य निगरानी कार्यक्रम में बदल देती हैं।