समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

पेपर रिपोर्ट फ्रंटियर एलएलएम जजों ने पुशबैक के तहत 25-71% फैसले पलट दिए

एक नया arXiv प्रीप्रिंट स्ट्रेस-टेस्ट स्वचालित ग्रेडर के रूप में उपयोग किए जाने वाले नौ सीमांत मॉडलों का परीक्षण करता है और रिपोर्ट करता है कि वे सभी चुनौती के तहत अपने फैसले बदलते हैं - और बदले हुए फैसले आमतौर पर सही उत्तर से दूर जाते हैं, इसकी ओर नहीं।

7 min readRead the primary source
Source-provided image accompanying Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Under Pushback
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.12645
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
वर्गीकरण
एक कार्य जहां एक मॉडल एक या अधिक पूर्वनिर्धारित श्रेणियों के लिए इनपुट निर्दिष्ट करता है।
ज़मीनी सच्चाई
मॉडल आउटपुट को प्रशिक्षित या मूल्यांकन करने के लिए विश्वसनीय संदर्भ लेबल का उपयोग किया जाता है।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

12 अगस्त, 2026 को arXiv पर पोस्ट किया गया एक प्रीप्रिंट "विगल फ्रेमवर्क" पेश करता है, जो बड़े भाषा मॉडल न्यायाधीशों की स्थिरता के लिए एक तनाव परीक्षण है। इसे 14 निर्णायक कार्यों में नौ फ्रंटियर मॉडलों पर लागू करते हुए, लेखक स्थिर पुशबैक के तहत 25-71% और एक प्रतिकूल मॉडल प्रेरक के खिलाफ 62-91% की फैसले फ्लिप दर की रिपोर्ट करते हैं, और कहते हैं कि दबाव जो फैसले को बदलता है वह जमीनी सच्चाई के सापेक्ष लगभग हमेशा शुद्ध-भ्रष्ट करने वाला होता है।

12 अगस्त, 2026 को arXiv पर पोस्ट किए गए प्रीप्रिंट में तर्क दिया गया है कि बड़े भाषा मॉडल "न्यायाधीशों" को मान्य करने का सामान्य तरीका - सुनहरे, मानव-लेबल डेटा के खिलाफ सटीकता को मापना - एक विफलता मोड को याद करता है जो व्यवहार में मायने रखता है: क्या कोई न्यायाधीश अपना फैसला तब रखता है जब उसी आइटम को दोबारा पूछा जाता है, दोबारा तैयार किया जाता है, या उसके खिलाफ तर्क दिया जाता है। "जैग्ड जजेज: एपिस्टेमिक स्टेबिलिटी अंडर साइलेंस, प्रेशर एंड पर्सिस्टेंस" शीर्षक वाले इस पेपर का श्रेय जस्टिन झाओ, हिमघना भट्टाचार्जी, हन्ना कोरेवार, भक्तिप्रिया राधारापु और खालिद अल-अरिनी को दिया जाता है। arXiv लिस्टिंग पेज पर कोई संस्थागत संबद्धता दिखाई नहीं देती है। लेखकों ने प्रस्तावित किया है कि वे विगल फ्रेमवर्क को क्या कहते हैं, एक एकल तनाव परीक्षण जिसका उद्देश्य उस स्थिरता को मापने योग्य और डेटासेट में तुलनीय बनाना है।

रूपरेखा न्यायाधीश की मजबूती को तीन भागों में विभाजित करती है। मैकेनिकल कंसिस्टेंसी री-प्रॉम्प्टिंग और रीफ़्रेमिंग के तहत स्थिरता को कवर करती है - चाहे जज दोबारा पूछे गए उसी प्रश्न का वही उत्तर देता हो या अलग तरीके से लिखा गया हो। सिंगल-टर्न कनविक्शन एक चुनौती के तहत स्थिरता को कवर करता है, जैसे उपयोगकर्ता या सिस्टम फैसले पर एक बार पीछे हटना। मल्टी-टर्न पर्सिस्टेंस निरंतर या अनुकूली दबाव के तहत स्थिरता को कवर करता है, जिसमें एक प्रतिकूल मॉडल भी शामिल है जो बहस करता रहता है और अपनी रणनीति को समायोजित करता है। तीन आयाम शीर्षक की "चुप्पी, दबाव और दृढ़ता" के अनुरूप हैं: एक न्यायाधीश क्या करता है जब कुछ भी नहीं बदलता है, जब इसे एक बार चुनौती दी जाती है, और जब यह खराब हो जाता है।

लेखक सुरक्षा, विषाक्तता, एआई-लेखन का पता लगाने और राजनीतिक प्रतिक्रियाओं के मूल्यांकन से संबंधित 14 निर्णायक कार्यों में नौ सीमांत मॉडलों के लिए रूपरेखा लागू करने की रिपोर्ट देते हैं। सार के अनुसार, परीक्षण किए गए प्रत्येक मॉडल में पर्याप्त अस्थिरता देखी गई। स्थिर पुशबैक के तहत, मॉडलों ने 25 प्रतिशत से 71 प्रतिशत समय के बीच अपने फैसले पलट दिए। जब एक प्रतिकूल भाषा मॉडल को प्रेरक के रूप में इस्तेमाल किया गया, तो फ़्लिप दर 62 प्रतिशत से 91 प्रतिशत के बीच बढ़ गई। यहां समीक्षा की गई सामग्री में नौ मॉडलों का नाम नहीं है या 14 डेटासेट की पहचान नहीं है।

दो और दावे कच्ची फ़्लिप दरों से परे हैं। सबसे पहले, लेखकों का कहना है कि दबाव जो किसी न्यायाधीश के फैसले को सफलतापूर्वक बदल देता है वह "जमीनी सच्चाई के संबंध में लगभग हमेशा शुद्ध-भ्रष्ट करने वाला होता है" - अर्थात, बदले हुए उत्तर सही लेबल की ओर जाने के बजाय उससे दूर चले जाते हैं, इसलिए एक न्यायाधीश जो तर्क के तहत पुनर्विचार करता है, वह इस प्रकार स्वयं को सही नहीं कर रहा है। दूसरा, वे बेसलाइन जूरी बहुमत की ताकत की पहचान करते हैं - वोट कितना असंतुलित होता है जब कई न्यायाधीश किसी आइटम को स्वतंत्र रूप से रेट करते हैं, किसी भी दबाव लागू होने से पहले - यह अनुमान लगाने के लिए सबसे प्रभावी सिंगल-शॉट सिग्नल के रूप में कि कौन से आइटम लड़खड़ाएंगे। वे निर्णय के संदर्भ में यांत्रिक, अनुरूपता और प्रेरक परीक्षणों की पहली समान क्रॉस-डेटासेट तुलना के रूप में कार्य का वर्णन करते हैं।

महत्वपूर्ण विवरण असत्यापित रहते हैं. जो उपलब्ध है वह संस्करण 1 के लिए arXiv सार पृष्ठ है, जिसे 12 अगस्त 2026 को प्रस्तुत किया गया था; कार्य एक प्रीप्रिंट है, और इसका कोई संकेत नहीं है कि इसकी सहकर्मी-समीक्षा की गई है। "फ्लिप" की सटीक परिभाषा, दबाव लागू करने के लिए उपयोग किए जाने वाले संकेत, प्रेरक मॉडल की क्षमता और नेट-भ्रष्टाचार प्रभाव का आकार यहां समीक्षा की गई सामग्री द्वारा स्थापित नहीं किया गया है, न ही इसकी पुष्टि की गई है कि कोड या डेटा पेपर के साथ है या नहीं। अपनी तरह का पहला होने का दावा लेखकों का अपना है।

स्रोत विवरण: arxiv.org

यह क्यों मायने रखता है?

एलएलएम जजों का उपयोग मॉडल रिलीज, ग्रेड प्रोडक्शन आउटपुट और ट्रेन रिवार्ड मॉडल को प्रशिक्षित करने के लिए किया जाता है - भूमिकाएं जो यह मानती हैं कि फैसला यह दर्शाता है कि किसी ने कितना कठिन तर्क दिया है, इसके बजाय आइटम का मूल्यांकन किया जा रहा है। यदि ये परिणाम दोहराए जाते हैं, तो एक निश्चित लेबल सेट पर सटीकता पर्याप्त सबूत नहीं है कि एक न्यायाधीश विश्वसनीय है, और सिस्टम जो उपयोगकर्ताओं या पाइपलाइनों को फैसले का विरोध करने देते हैं, वे सबसे अधिक उजागर हो सकते हैं।

एलएलएम जज अब केवल शोध की सुविधा नहीं रह गए हैं। उनका उपयोग मॉडल रिलीज़ को स्कोर करने, उत्पादन प्रणालियों के अंदर आउटपुट को ऑनलाइन ग्रेड करने और प्रशिक्षण को आकार देने वाले इनाम मॉडल के रूप में किया जाता है। वे भूमिकाएँ एक धारणा को साझा करती हैं: कि निर्णय उस विषय की एक स्थिर संपत्ति है जिस पर निर्णय लिया जा रहा है, न कि इस बात पर कि प्रश्न को कैसे प्रस्तुत किया गया था या किसी ने कितनी मेहनत से उसे पीछे धकेला था। यदि रिपोर्ट की गई फ़्लिप दरें कायम रहती हैं, तो यह धारणा आमतौर पर न्यायाधीशों की तैनाती के साथ उद्धृत सटीकता के आंकड़ों की तुलना में कमजोर होती है, और न्यायाधीशों के शीर्ष पर बनाए गए मूल्यांकन संख्याएं अस्थिरता को जन्म देती हैं।

नेट-भ्रष्ट करने वाली खोज दोनों दावों से अधिक तीक्ष्ण है। ऐसे न्यायाधीश को पढ़ना आकर्षक लगता है जो तर्क के तहत अपना मन बदल लेता है क्योंकि वह विचारशील है या साक्ष्य के लिए खुला है। अखबार का दावा इसके विपरीत है: इन कार्यों पर, दबाव में आंदोलन मुख्य रूप से जमीनी सच्चाई के साथ समझौते को ख़राब करता है। इनाम-मॉडलिंग लूप में यह मायने रखता है, क्योंकि प्रशिक्षित की जा रही नीति सीख सकती है कि ग्रेडर पर दबाव डालना काम करता है - सही होने के बजाय बहस करने के लिए प्रोत्साहन। सार यह प्रदर्शित नहीं करता है कि यह लाइव प्रशिक्षण दौर में होता है; यह घटक स्थापित करता है, परिणाम नहीं।

उपयोगकर्ता के सामने आने वाली किसी भी चीज़ का प्रत्यक्ष प्रदर्शन भी होता है। सुरक्षा और विषाक्तता वर्गीकरण और एआई-लेखन का पता लगाना ऐसे क्षेत्र हैं जहां निर्णय प्राप्त करने वाले व्यक्ति या सिस्टम के पास इसका विरोध करने का मकसद और अवसर दोनों होते हैं, और जहां स्वचालित पाइपलाइन नियमित रूप से एक मॉडल से दोबारा पूछते हैं या उसमें एक खंडन वापस फ़ीड करते हैं। वर्णित प्रकार की अस्थिरता का मतलब यह होगा कि एक ही सामग्री सबमिट करने वाले दो लोगों को अलग-अलग परिणाम मिल सकते हैं, यह इस बात पर निर्भर करता है कि वे कितनी दृढ़ता से आगे बढ़ते हैं - एक निष्पक्षता की समस्या जितनी सटीकता की, और एक जो सत्यापन प्रक्रिया के लिए अदृश्य है जो केवल एकल-पास सटीकता को मापती है।

दो सीमाएँ स्पष्ट रूप से बताने योग्य हैं। कई प्रोडक्शन जज निश्चित संकेतों के साथ सिंगल-टर्न कॉल के रूप में चलते हैं और कोई प्रतिकूल वार्ताकार नहीं होता है, इसलिए मल्टी-टर्न आंकड़े विशिष्ट ऑपरेशन के बजाय तनाव की स्थिति का वर्णन करते हैं। और न्यायाधीशों का बेंचमार्क किसी भी तैनात प्रणाली का माप नहीं है, जो विवादित वस्तुओं पर जूरी, परहेज़ सीमा या मानव समीक्षा जोड़ सकता है। यदि दोहराया जाए तो पेपर जो स्थापित करेगा, वह संकीर्ण है लेकिन फिर भी परिणामी है: एक निश्चित लेबल वाले सेट पर सटीकता पर्याप्त सबूत नहीं है कि एक न्यायाधीश विश्वसनीय है। यह सत्यापन अभ्यास के बारे में एक दावा है, जिस पर कार्रवाई करना किसी विशेष उत्पाद के बारे में दावे की तुलना में सस्ता है।

Interactive Mechanism

Interactive Mechanism: How It Actually Works

Explore the underlying technology behind this development interactively.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactive Concept Check+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

आगे क्या देखना है

क्या पूरा पेपर मॉडलों का नाम देता है और डेटासेट, संकेत और कोड जारी करता है; क्या स्वतंत्र समूह फ़्लिप दरों को पुन: उत्पन्न करते हैं; क्या प्री-प्रेशर जूरी-मार्जिन सिग्नल को सस्ते ट्राइएज तंत्र के रूप में सामान्यीकृत किया जाता है; और क्या स्थिरता मेट्रिक्स ईवल हार्नेस, मॉडल कार्ड और तृतीय-पक्ष बेंचमार्क रिपोर्ट में सटीकता के साथ दिखाई देने लगते हैं।

देखने वाली पहली चीज़ पूरा पेपर और उसके साथ आने वाली कोई भी रिलीज़ है। क्या नौ मॉडलों का नाम दिया गया है, क्या 14 डेटासेट और दबाव संकेत प्रकाशित किए गए हैं, और क्या कोड उपलब्ध है, यह निर्धारित करेगा कि अन्य लोग कितनी जल्दी संख्याओं की जांच कर सकते हैं। इस प्रकार की क्रॉस-मॉडल तुलनाएं त्वरित डिजाइन और फैसले में बदलाव की गणना के प्रति संवेदनशील होती हैं, इसलिए स्वतंत्र पुनरुत्पादन - जिसमें इस मूल्यांकन के चलने के बाद जारी किए गए मॉडल भी शामिल हैं - वह परीक्षण है जो मायने रखता है।

दूसरा, क्या जूरी-मार्जिन सिग्नल कायम है। यदि एक स्वतंत्र पूर्व-दबाव वोट का प्रसार विश्वसनीय रूप से ध्वजांकित करता है कि कौन सी वस्तुएँ पलटेंगी, तो यह एक सस्ता और व्यावहारिक शमन है: कम-मार्जिन वाली वस्तुओं को अधिक न्यायाधीशों, परहेज़ या मानवीय समीक्षा के लिए मार्ग दें, और आत्मविश्वासपूर्ण वस्तुओं को अकेला छोड़ दें। क्या यह अध्ययन किए गए डेटासेट से परे सामान्यीकरण करता है, और अतिरिक्त लागत के बदले में यह कितनी सटीकता प्राप्त करता है, यहां समीक्षा की गई सामग्री में अनसुलझा है।

तीसरा, क्या मूल्यांकन अभ्यास बदलता है। ठोस संकेत मॉडल कार्ड, ओपन इवल हार्नेस और थर्ड-पार्टी बेंचमार्क रिपोर्ट में सटीकता के बाद रिपोर्ट की गई स्थिरता मेट्रिक्स होंगे - पुन: संकेत स्थिरता, एकल चुनौती के तहत व्यवहार, निरंतर पुशबैक का प्रतिरोध। खरीद प्रक्रियाएं और मानक काम करते हैं जो न्यायाधीश-स्कोर किए गए बेंचमार्क का हवाला देते हैं, धीमी गति से अनुवर्ती होंगे, और वर्तमान में किसी भी प्रकार की किसी भी चीज़ की आवश्यकता के लिए जाना जाता है।

अंततः, क्या शमन कार्य करता है। शीघ्र सख्त होना, न्यायाधीशों को फैसले के पीछे के सबूतों को फिर से प्रस्तुत करने की आवश्यकता, सभी मॉडलों को इकट्ठा करना, और नए सबूतों के अभाव में स्थिति बनाए रखने के स्पष्ट निर्देश सभी प्रशंसनीय सुधार हैं, और इस पेपर द्वारा किसी को भी मान्य नहीं किया गया है। यह भी अज्ञात है कि क्या नए फ्रंटियर मॉडल पुराने मॉडलों की तुलना में अधिक स्थिर हैं, और क्या स्थिरता प्रतिक्रियाशीलता के विरुद्ध व्यापार करती है जो एक न्यायाधीश को उन मामलों में उपयोगी बनाती है जहां यह वास्तव में गलत है और उसे अपना मन बदलना चाहिए।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणएआई नैतिकताChatGPT और एलएलएमआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखें
क्या यह उपयोगी पाया गया?