क्या हुआ?
EleutherAI ने जुलाई 2026 की प्रतियोगिता, एलेथिया क्वेस्ट का एक पूर्वव्यापी संस्करण प्रकाशित किया, जिसमें 19 टीमों ने एआई मॉडल में भ्रामक व्यवहार का पता लगाने के लिए तरीके विकसित किए। संगठन ने धोखे के कई रूपों को कवर करने वाली अपनी सर्वश्रेष्ठ प्रदर्शन करने वाली डिटेक्टर विधियां और 6,168-पंक्ति मूल्यांकन बैटरी भी जारी की।
EleutherAI का कहना है कि Aletheia's Quest का आयोजन Cadenza Labs और National Deep Inference फ़ैब्रिक द्वारा श्मिट साइंसेज की फंडिंग से किया गया था। टीमों ने Qwen 3.5, जेम्मा 3 और नेमोट्रॉन 3 सुपर मॉडल में 27 बिलियन से 120 बिलियन मापदंडों तक के अलग-अलग ब्लैक-बॉक्स और व्हाइट-बॉक्स ट्रैक में प्रतिस्पर्धा की, जिसमें LoRA फाइन-ट्यून्स भी शामिल थे, जिन्होंने भ्रामक प्रतिक्रियाओं की शैली और वाचालता को बदल दिया। ब्लैक-बॉक्स ट्रैक ने बातचीत और एक अलग Qwen 3.5 9B विश्वसनीय जज तक पहुंच की अनुमति दी; व्हाइट-बॉक्स ट्रैक ने संदिग्ध मॉडल की सक्रियता या लॉगिट संभावनाओं तक पहुंच जोड़ दी।
EleutherAI टीम के अंतिम डिटेक्टर ने कई चरणों में एक विश्वसनीय न्यायाधीश का उपयोग किया। इसने पहले संदिग्ध मॉडल के उत्तर को देखे बिना अंतर्निहित प्रश्न का उत्तर दिया, फिर उस उत्तर को तथ्यात्मक दावों में बदल दिया, और अंत में मूल्यांकन किया कि क्या कोई दावा आत्मविश्वास से गलत या भ्रामक था। आदेश के प्रभाव को कम करने के लिए टीम ने दो निर्णायक पासों में उत्तर क्रम की अदला-बदली भी की। इसके व्हाइट-बॉक्स संस्करण में आसानी से जांचे जा सकने वाले तथ्यात्मक दावों के बिना टूल-उपयोग मामलों के लिए एक स्व-मूल्यांकन संकेत और एक सशर्त सक्रियण जांच जोड़ी गई है।
सत्यापन लीडरबोर्ड पर, टीम छह मॉडल-डेटासेट संयोजनों में अपनी ब्लैक-बॉक्स विधि के लिए 0.926 और व्हाइट-बॉक्स विधि के लिए 0.945 का औसत AUROC रिपोर्ट करती है। पूर्वव्यापी कहता है कि एक अन्य टीम, SAIN ग्रोनिंगन ने बाद में अंतिम दिन इसे पार कर लिया, ब्लैक-बॉक्स परीक्षण में लगभग 0.95 AUROC और व्हाइट-बॉक्स परीक्षण में 0.97 तक पहुंच गया। वे आवश्यक रूप से अंतिम स्टैंडिंग नहीं थे: स्रोत का कहना है कि अंतिम प्लेसमेंट अप्रकाशित परीक्षण डेटा का उपयोग करके निर्धारित किया जाना था।
EleutherAI अपने सबसे मजबूत तरीकों और गौंटलेट नामक रिपॉजिटरी को जारी कर रहा है। बैटरी में 28 वितरण और 6,168 पंक्तियाँ हैं जो तथ्यात्मक झूठ, ज्ञान खंडन, रहस्य रखना, रेत से भराई, एजेंटिक छिपाव, छिपे हुए लक्षण, मतिभ्रम और भ्रामक दावों को व्यक्त करने के तरीके में बदलाव को कवर करती हैं। संगठन का कहना है कि दो शोधकर्ताओं ने लगभग एक महीने में 27 मूल्यांकन वितरणों में लगभग 290 डिटेक्टर मॉड्यूल का उत्पादन और मूल्यांकन किया, जिसमें कोडिंग एजेंट अधिकांश कार्यान्वयन और प्रयोग निष्पादन को संभालते हैं।
स्रोत विवरण: blog.eleuther.ai ↗
यह क्यों मायने रखता है?
परिणाम बताते हैं कि एक कमजोर विश्वसनीय भाषा मॉडल संदिग्ध मॉडल की आंतरिक गतिविधियों तक पहुंच के बिना, अकेले बातचीत से कई भ्रामक प्रतिक्रियाओं की पहचान कर सकता है। लेकिन पूर्वव्यापी यह भी दिखाता है कि उस स्पष्ट सफलता को सामान्यीकृत क्यों नहीं किया जा सकता है: बेंचमार्क परिणाम धोखे के प्रकार पर बहुत अधिक निर्भर करते हैं, और आंतरिक जांच कभी-कभी अपरिचित डेटासेट पर मौके से भी बदतर प्रदर्शन करती है।
सबसे मजबूत व्यावहारिक निष्कर्ष यह है कि ब्लैक-बॉक्स मॉनिटरिंग ने शोधकर्ताओं की अपेक्षा से कहीं बेहतर प्रदर्शन किया। एक विश्वसनीय न्यायाधीश ने कभी-कभी संदिग्ध मॉडल के आंतरिक विवरणों को पढ़े बिना धोखे की पहचान की, और सूत्र का कहना है कि इस दृष्टिकोण ने प्रतियोगिता के कई परिदृश्यों में काम किया। यह मायने रखता है क्योंकि अधिकांश तैनात वाणिज्यिक प्रणालियों के लिए आंतरिक पहुंच अनुपलब्ध है, जिससे बातचीत-स्तर की निगरानी को सैद्धांतिक रूप से लागू करना आसान हो जाता है।
परिणाम यह नहीं दिखाता है कि एक विश्वसनीय न्यायाधीश विश्वसनीय रूप से यह निर्धारित कर सकता है कि एआई प्रणाली सामान्य रूप से झूठ बोल रही है या नहीं। EleutherAI के अपने विश्लेषण में पाया गया कि न्यायाधीश मॉडलों के बीच साझा ज्ञान का फायदा उठा सकते हैं। एक निर्मित परीक्षण में, प्रत्येक संदिग्ध मॉडल ने समान प्रतिक्रिया दी - "मुझे क्षमा करें, मुझे इसका उत्तर नहीं पता" - फिर भी न्यायाधीशों ने भविष्यवाणी की कि क्या संदिग्ध मॉडल वास्तव में उत्तर जानता था। स्रोत 0.66 और 0.76 के बीच AUROCs की रिपोर्ट करता है, और लगभग 0.82 जब न्यायाधीश की प्रश्न का उत्तर देने की अपनी क्षमता का सीधे उपयोग किया गया था।
यह व्यवहार कुछ ज्ञान खंडन का पता लगाने के लिए उपयोगी हो सकता है, लेकिन यह एक डिटेक्टर को एक संदिग्ध मॉडल के निजी विश्वास को समझने में भी सक्षम बना सकता है जब वह मुख्य रूप से सहसंबद्ध प्रशिक्षण डेटा या प्रतिक्रिया पैटर्न का उपयोग कर रहा हो। EleutherAI का कहना है कि संदिग्ध और न्यायाधीश मॉडल कुछ मामलों में ज्ञान साझा करने में विफल रहे, और यह स्थापित नहीं करता है कि विधि काफी भिन्न प्रशिक्षण डेटा या प्रशिक्षण के बाद की प्रक्रियाओं वाले मॉडल में स्थानांतरित होती है।
पूर्वव्यापी प्रतियोगिता में झूठ की परिभाषा को भी चुनौती देता है। एलेथियाज़ क्वेस्ट ने एक प्रतिक्रिया को भ्रामक करार दिया जब एक मॉडल ने एक बयान तैयार किया, जिसके बारे में माना जाता था कि यह झूठा था, यहां तक कि बिना सबूत के भी कि इसका उद्देश्य किसी को गुमराह करना था। EleutherAI का तर्क है कि "झूठ" के सामान्य उपयोग में आम तौर पर एक पताकर्ता और उस व्यक्ति को झूठे बयान पर विश्वास कराने का इरादा शामिल होता है। यह अंतर प्रभावित करता है कि डेटासेट को कैसे लेबल किया जाता है और डिटेक्टर को क्या खोजने के लिए कहा जा रहा है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
मुख्य अनसुलझे प्रश्न हैं कि क्या झूठ पकड़ने वाले लंबे समय से चल रहे एआई-एजेंट कार्यों में चूक, विकृत रिपोर्टिंग और छिपे हुए लक्ष्यों की पहचान कर सकते हैं, और क्या स्वतंत्र मूल्यांकनकर्ता ऐसे परीक्षण बना सकते हैं जो सरल तथ्य-जांच को पुरस्कृत नहीं करते हैं या मॉडलों के बीच साझा ज्ञान का फायदा नहीं उठाते हैं। एलेथिया की अंतिम निजी-परीक्षण रैंकिंग अभी तक स्रोत में उपलब्ध नहीं थी।
सबसे महत्वपूर्ण अगला कदम धोखे का परीक्षण करना है जिसे झूठे तथ्यात्मक वाक्य तक सीमित नहीं किया जा सकता है। सूत्र का कहना है कि लंबी दूरी के एजेंट चूक, चयनात्मक रिपोर्टिंग, विकृत सारांश या छिपे हुए उद्देश्यों के माध्यम से गुमराह कर सकते हैं। इन मामलों को लेबल करना कठिन है क्योंकि ऐसा कोई भी वाक्य नहीं हो सकता है जिसे किसी स्थापित उत्तर के विरुद्ध जांचा जा सके।
शोधकर्ताओं को यह भी जांचना चाहिए कि क्या डिटेक्टर मॉडल परिवारों, फाइन-ट्यून्स, कार्यों और वार्तालाप शैलियों में विश्वसनीय बने रहते हैं। EleutherAI की रिपोर्ट है कि उसके द्वारा परीक्षण की गई प्रत्येक रैखिक जांच ने कुछ परिदृश्यों में अच्छा काम किया लेकिन दूसरों में मौका से नीचे गिर गया, कभी-कभी व्यवस्थित रूप से इसके स्कोर और धोखे के बीच अपेक्षित संबंध को उलट दिया गया। एक डिटेक्टर जो एक बेंचमार्क पर अच्छा प्रदर्शन करता है, उस वितरण के बाहर उपयोग किए जाने पर गलत आत्मविश्वास पैदा कर सकता है।
गौंटलेट मदद कर सकता है, लेकिन इसका मूल्य स्वतंत्र प्रतिकृति पर निर्भर करेगा और इस पर निर्भर करेगा कि भविष्य के डेटासेट में वास्तव में छिपे हुए विश्वास, रणनीतिक व्यवहार और यथार्थवादी एजेंट प्रक्षेपवक्र शामिल हैं या नहीं। स्रोत अप्रकाशित निजी परीक्षण सेट, वास्तविक दुनिया परिनियोजन डेटा, उपयोगकर्ताओं के लिए झूठी-सकारात्मक दरों या सबूत से परिणाम प्रदान नहीं करता है कि ये डिटेक्टर तथ्यात्मक त्रुटि, मतिभ्रम या असामान्य शब्दों के बजाय जानबूझकर धोखे की पहचान करते हैं।
इस क्षेत्र को विश्वसनीय न्यायाधीशों के आसपास स्पष्ट प्रशासन की भी आवश्यकता होगी। एक मजबूत न्यायाधीश अधिक सूक्ष्म संकेतों का पता लगा सकता है, लेकिन साझा मॉडल प्रशिक्षण एक एल्गोरिथम मोनोकल्चर का उत्पादन कर सकता है जिसमें मॉडल भरोसेमंद ऑडिट प्रदान किए बिना एक दूसरे के ज्ञान या आदतों का अनुमान लगाते हैं। EleutherAI अधिक विस्तृत जांच और डिटेक्टर रूटिंग का प्रस्ताव करता है, लेकिन स्रोत इन्हें मान्य समाधानों के बजाय भविष्य के शोध निर्देशों के रूप में प्रस्तुत करता है।