समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

EleutherAI एक AI धोखे-पहचान प्रतियोगिता से पाठ और डेटासेट जारी करता है

एलेथिया क्वेस्ट पर एलुथेरएआई की पूर्वव्यापी रिपोर्ट से पता चलता है कि ब्लैक-बॉक्स जजों ने कई एआई-जनित झूठों के साथ-साथ उन तरीकों का भी पता लगाया है, जिन्होंने मॉडल आंतरिक का निरीक्षण किया, जबकि चेतावनी दी कि प्रतियोगिता के बेंचमार्क और झूठ बोलने की परिभाषा दोनों ही महत्वपूर्ण कमियां छोड़ते हैं।

5 min readRead the primary source
Primary-source image accompanying EleutherAI releases lessons and datasets from an AI deception-detection contest
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
blog.eleuther.ai
स्रोत लिंक
blog.eleuther.aihttps://blog.eleuther.ai/aletheia-retrospective/
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

लोरा (निम्न-रैंक अनुकूलन)
एक पैरामीटर-कुशल फ़ाइन-ट्यूनिंग विधि जो निम्न-रैंक एडाप्टर मैट्रिसेस जोड़ती है।
मतिभ्रम
जब कोई मॉडल धाराप्रवाह लेकिन गलत या असमर्थित जानकारी उत्पन्न करता है।
प्रशिक्षण के बाद
प्रशिक्षण चरण पूर्व-प्रशिक्षण के बाद लागू किए जाते हैं, जैसे अनुदेश ट्यूनिंग, वरीयता अनुकूलन और सुरक्षा ट्यूनिंग।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

EleutherAI ने जुलाई 2026 की प्रतियोगिता, एलेथिया क्वेस्ट का एक पूर्वव्यापी संस्करण प्रकाशित किया, जिसमें 19 टीमों ने एआई मॉडल में भ्रामक व्यवहार का पता लगाने के लिए तरीके विकसित किए। संगठन ने धोखे के कई रूपों को कवर करने वाली अपनी सर्वश्रेष्ठ प्रदर्शन करने वाली डिटेक्टर विधियां और 6,168-पंक्ति मूल्यांकन बैटरी भी जारी की।

EleutherAI का कहना है कि Aletheia's Quest का आयोजन Cadenza Labs और National Deep Inference फ़ैब्रिक द्वारा श्मिट साइंसेज की फंडिंग से किया गया था। टीमों ने Qwen 3.5, जेम्मा 3 और नेमोट्रॉन 3 सुपर मॉडल में 27 बिलियन से 120 बिलियन मापदंडों तक के अलग-अलग ब्लैक-बॉक्स और व्हाइट-बॉक्स ट्रैक में प्रतिस्पर्धा की, जिसमें LoRA फाइन-ट्यून्स भी शामिल थे, जिन्होंने भ्रामक प्रतिक्रियाओं की शैली और वाचालता को बदल दिया। ब्लैक-बॉक्स ट्रैक ने बातचीत और एक अलग Qwen 3.5 9B विश्वसनीय जज तक पहुंच की अनुमति दी; व्हाइट-बॉक्स ट्रैक ने संदिग्ध मॉडल की सक्रियता या लॉगिट संभावनाओं तक पहुंच जोड़ दी।

EleutherAI टीम के अंतिम डिटेक्टर ने कई चरणों में एक विश्वसनीय न्यायाधीश का उपयोग किया। इसने पहले संदिग्ध मॉडल के उत्तर को देखे बिना अंतर्निहित प्रश्न का उत्तर दिया, फिर उस उत्तर को तथ्यात्मक दावों में बदल दिया, और अंत में मूल्यांकन किया कि क्या कोई दावा आत्मविश्वास से गलत या भ्रामक था। आदेश के प्रभाव को कम करने के लिए टीम ने दो निर्णायक पासों में उत्तर क्रम की अदला-बदली भी की। इसके व्हाइट-बॉक्स संस्करण में आसानी से जांचे जा सकने वाले तथ्यात्मक दावों के बिना टूल-उपयोग मामलों के लिए एक स्व-मूल्यांकन संकेत और एक सशर्त सक्रियण जांच जोड़ी गई है।

सत्यापन लीडरबोर्ड पर, टीम छह मॉडल-डेटासेट संयोजनों में अपनी ब्लैक-बॉक्स विधि के लिए 0.926 और व्हाइट-बॉक्स विधि के लिए 0.945 का औसत AUROC रिपोर्ट करती है। पूर्वव्यापी कहता है कि एक अन्य टीम, SAIN ग्रोनिंगन ने बाद में अंतिम दिन इसे पार कर लिया, ब्लैक-बॉक्स परीक्षण में लगभग 0.95 AUROC और व्हाइट-बॉक्स परीक्षण में 0.97 तक पहुंच गया। वे आवश्यक रूप से अंतिम स्टैंडिंग नहीं थे: स्रोत का कहना है कि अंतिम प्लेसमेंट अप्रकाशित परीक्षण डेटा का उपयोग करके निर्धारित किया जाना था।

EleutherAI अपने सबसे मजबूत तरीकों और गौंटलेट नामक रिपॉजिटरी को जारी कर रहा है। बैटरी में 28 वितरण और 6,168 पंक्तियाँ हैं जो तथ्यात्मक झूठ, ज्ञान खंडन, रहस्य रखना, रेत से भराई, एजेंटिक छिपाव, छिपे हुए लक्षण, मतिभ्रम और भ्रामक दावों को व्यक्त करने के तरीके में बदलाव को कवर करती हैं। संगठन का कहना है कि दो शोधकर्ताओं ने लगभग एक महीने में 27 मूल्यांकन वितरणों में लगभग 290 डिटेक्टर मॉड्यूल का उत्पादन और मूल्यांकन किया, जिसमें कोडिंग एजेंट अधिकांश कार्यान्वयन और प्रयोग निष्पादन को संभालते हैं।

स्रोत विवरण: blog.eleuther.ai ↗

यह क्यों मायने रखता है?

परिणाम बताते हैं कि एक कमजोर विश्वसनीय भाषा मॉडल संदिग्ध मॉडल की आंतरिक गतिविधियों तक पहुंच के बिना, अकेले बातचीत से कई भ्रामक प्रतिक्रियाओं की पहचान कर सकता है। लेकिन पूर्वव्यापी यह भी दिखाता है कि उस स्पष्ट सफलता को सामान्यीकृत क्यों नहीं किया जा सकता है: बेंचमार्क परिणाम धोखे के प्रकार पर बहुत अधिक निर्भर करते हैं, और आंतरिक जांच कभी-कभी अपरिचित डेटासेट पर मौके से भी बदतर प्रदर्शन करती है।

सबसे मजबूत व्यावहारिक निष्कर्ष यह है कि ब्लैक-बॉक्स मॉनिटरिंग ने शोधकर्ताओं की अपेक्षा से कहीं बेहतर प्रदर्शन किया। एक विश्वसनीय न्यायाधीश ने कभी-कभी संदिग्ध मॉडल के आंतरिक विवरणों को पढ़े बिना धोखे की पहचान की, और सूत्र का कहना है कि इस दृष्टिकोण ने प्रतियोगिता के कई परिदृश्यों में काम किया। यह मायने रखता है क्योंकि अधिकांश तैनात वाणिज्यिक प्रणालियों के लिए आंतरिक पहुंच अनुपलब्ध है, जिससे बातचीत-स्तर की निगरानी को सैद्धांतिक रूप से लागू करना आसान हो जाता है।

परिणाम यह नहीं दिखाता है कि एक विश्वसनीय न्यायाधीश विश्वसनीय रूप से यह निर्धारित कर सकता है कि एआई प्रणाली सामान्य रूप से झूठ बोल रही है या नहीं। EleutherAI के अपने विश्लेषण में पाया गया कि न्यायाधीश मॉडलों के बीच साझा ज्ञान का फायदा उठा सकते हैं। एक निर्मित परीक्षण में, प्रत्येक संदिग्ध मॉडल ने समान प्रतिक्रिया दी - "मुझे क्षमा करें, मुझे इसका उत्तर नहीं पता" - फिर भी न्यायाधीशों ने भविष्यवाणी की कि क्या संदिग्ध मॉडल वास्तव में उत्तर जानता था। स्रोत 0.66 और 0.76 के बीच AUROCs की रिपोर्ट करता है, और लगभग 0.82 जब न्यायाधीश की प्रश्न का उत्तर देने की अपनी क्षमता का सीधे उपयोग किया गया था।

यह व्यवहार कुछ ज्ञान खंडन का पता लगाने के लिए उपयोगी हो सकता है, लेकिन यह एक डिटेक्टर को एक संदिग्ध मॉडल के निजी विश्वास को समझने में भी सक्षम बना सकता है जब वह मुख्य रूप से सहसंबद्ध प्रशिक्षण डेटा या प्रतिक्रिया पैटर्न का उपयोग कर रहा हो। EleutherAI का कहना है कि संदिग्ध और न्यायाधीश मॉडल कुछ मामलों में ज्ञान साझा करने में विफल रहे, और यह स्थापित नहीं करता है कि विधि काफी भिन्न प्रशिक्षण डेटा या प्रशिक्षण के बाद की प्रक्रियाओं वाले मॉडल में स्थानांतरित होती है।

पूर्वव्यापी प्रतियोगिता में झूठ की परिभाषा को भी चुनौती देता है। एलेथियाज़ क्वेस्ट ने एक प्रतिक्रिया को भ्रामक करार दिया जब एक मॉडल ने एक बयान तैयार किया, जिसके बारे में माना जाता था कि यह झूठा था, यहां तक ​​​​कि बिना सबूत के भी कि इसका उद्देश्य किसी को गुमराह करना था। EleutherAI का तर्क है कि "झूठ" के सामान्य उपयोग में आम तौर पर एक पताकर्ता और उस व्यक्ति को झूठे बयान पर विश्वास कराने का इरादा शामिल होता है। यह अंतर प्रभावित करता है कि डेटासेट को कैसे लेबल किया जाता है और डिटेक्टर को क्या खोजने के लिए कहा जा रहा है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

मुख्य अनसुलझे प्रश्न हैं कि क्या झूठ पकड़ने वाले लंबे समय से चल रहे एआई-एजेंट कार्यों में चूक, विकृत रिपोर्टिंग और छिपे हुए लक्ष्यों की पहचान कर सकते हैं, और क्या स्वतंत्र मूल्यांकनकर्ता ऐसे परीक्षण बना सकते हैं जो सरल तथ्य-जांच को पुरस्कृत नहीं करते हैं या मॉडलों के बीच साझा ज्ञान का फायदा नहीं उठाते हैं। एलेथिया की अंतिम निजी-परीक्षण रैंकिंग अभी तक स्रोत में उपलब्ध नहीं थी।

सबसे महत्वपूर्ण अगला कदम धोखे का परीक्षण करना है जिसे झूठे तथ्यात्मक वाक्य तक सीमित नहीं किया जा सकता है। सूत्र का कहना है कि लंबी दूरी के एजेंट चूक, चयनात्मक रिपोर्टिंग, विकृत सारांश या छिपे हुए उद्देश्यों के माध्यम से गुमराह कर सकते हैं। इन मामलों को लेबल करना कठिन है क्योंकि ऐसा कोई भी वाक्य नहीं हो सकता है जिसे किसी स्थापित उत्तर के विरुद्ध जांचा जा सके।

शोधकर्ताओं को यह भी जांचना चाहिए कि क्या डिटेक्टर मॉडल परिवारों, फाइन-ट्यून्स, कार्यों और वार्तालाप शैलियों में विश्वसनीय बने रहते हैं। EleutherAI की रिपोर्ट है कि उसके द्वारा परीक्षण की गई प्रत्येक रैखिक जांच ने कुछ परिदृश्यों में अच्छा काम किया लेकिन दूसरों में मौका से नीचे गिर गया, कभी-कभी व्यवस्थित रूप से इसके स्कोर और धोखे के बीच अपेक्षित संबंध को उलट दिया गया। एक डिटेक्टर जो एक बेंचमार्क पर अच्छा प्रदर्शन करता है, उस वितरण के बाहर उपयोग किए जाने पर गलत आत्मविश्वास पैदा कर सकता है।

गौंटलेट मदद कर सकता है, लेकिन इसका मूल्य स्वतंत्र प्रतिकृति पर निर्भर करेगा और इस पर निर्भर करेगा कि भविष्य के डेटासेट में वास्तव में छिपे हुए विश्वास, रणनीतिक व्यवहार और यथार्थवादी एजेंट प्रक्षेपवक्र शामिल हैं या नहीं। स्रोत अप्रकाशित निजी परीक्षण सेट, वास्तविक दुनिया परिनियोजन डेटा, उपयोगकर्ताओं के लिए झूठी-सकारात्मक दरों या सबूत से परिणाम प्रदान नहीं करता है कि ये डिटेक्टर तथ्यात्मक त्रुटि, मतिभ्रम या असामान्य शब्दों के बजाय जानबूझकर धोखे की पहचान करते हैं।

इस क्षेत्र को विश्वसनीय न्यायाधीशों के आसपास स्पष्ट प्रशासन की भी आवश्यकता होगी। एक मजबूत न्यायाधीश अधिक सूक्ष्म संकेतों का पता लगा सकता है, लेकिन साझा मॉडल प्रशिक्षण एक एल्गोरिथम मोनोकल्चर का उत्पादन कर सकता है जिसमें मॉडल भरोसेमंद ऑडिट प्रदान किए बिना एक दूसरे के ज्ञान या आदतों का अनुमान लगाते हैं। EleutherAI अधिक विस्तृत जांच और डिटेक्टर रूटिंग का प्रस्ताव करता है, लेकिन स्रोत इन्हें मान्य समाधानों के बजाय भविष्य के शोध निर्देशों के रूप में प्रस्तुत करता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई नैतिकताएआई प्रशिक्षणआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?