समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

प्रीप्रिंट एलएलएम एजेंटों को यह पहचानने के लिए एक बायेसियन तरीका प्रस्तावित करता है कि उन्हें कब मजबूत सहायता की आवश्यकता है

एक नया प्रीप्रिंट एजेंटों का अध्ययन करता है जो तर्क के दौरान नियंत्रण को एक मजबूत भाषा मॉडल में स्थानांतरित कर सकता है, सैद्धांतिक गारंटी और सीमित क्वेन2.5-कोडर सत्यापन के साथ बायेसियन स्टॉपिंग नियम का संयोजन कर सकता है।

5 min readRead the primary source
Source-page capture accompanying Preprint proposes a Bayesian way for LLM agents to recognize when they need stronger help
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.24087
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
अंशांकन
किसी मॉडल का आत्मविश्वास स्कोर वास्तविक शुद्धता संभावनाओं से कितना मेल खाता है।
अनुमान
रनटाइम चरण जहां एक प्रशिक्षित मॉडल भविष्यवाणियां या आउटपुट उत्पन्न करता है।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

25 अगस्त को arXiv को प्रस्तुत एक प्रीप्रिंट, पदानुक्रमित एलएलएम एजेंटों के लिए "स्व-वृद्धि" का प्रस्ताव करता है: एक एजेंट किसी कार्य को हल करने की संभावना का अनुमान लगाता है जबकि वह अभी भी तर्क कर रहा है और जब अपेक्षित लाभ लागत को उचित ठहराता है तो एक मजबूत मॉडल को नियंत्रण सौंप देता है। पेपर इसकी तुलना जेनरेशन से पहले रूटिंग और प्रतिक्रिया पूरी होने के बाद सत्यापन से करता है।

पेपर पदानुक्रमित एलएलएम एजेंटों में एक विशिष्ट समस्या की जांच करता है: न केवल यह तय करना कि किस मॉडल को कार्य संभालना चाहिए, बल्कि यह भी तय करना चाहिए कि एक कमजोर मॉडल को कब रुकना चाहिए और मदद के लिए एक मजबूत मॉडल से पूछना चाहिए। इसकी प्रस्तावित व्यवस्था पीढ़ी के दौरान संचालित होती है। एक एजेंट अपनी सफलता की अंतिम संभावना का एक ऑनलाइन अनुमान बनाता है और जब वह अनुमान लागत-संवेदनशील सीमा से नीचे आता है तो उत्तर पूरा करने से पहले उसे आगे बढ़ा सकता है। यह स्रोत द्वारा वर्णित केंद्रीय तकनीकी योगदान है।

लेखक इस निर्णय को बायेसियन इष्टतम-रोकने वाली समस्या के रूप में तैयार करते हैं। क्षमता का अनुमान एक सीखा हुआ पश्च भाग है जिसके पर्याप्त आँकड़े अकेले कच्चे आउटपुट एन्ट्रापी के बजाय लेबल किए गए प्रक्षेपवक्र से आते हैं। पेपर बंद रूप में एक अदूरदर्शी वृद्धि सीमा प्राप्त करता है और इष्टतम नीति को चिह्नित करने के लिए गतिशील प्रोग्रामिंग का उपयोग करता है। यह इस बात का प्रमाण देता है कि यह नीति कच्चे सिग्नल पर आकार की धारणा थोपे बिना एक समय-भिन्न सीमा वाली नीति है।

स्रोत कई सैद्धांतिक परिणामों की रिपोर्ट करता है। इसमें कहा गया है कि ओरेकल विश्वास सिग्नल की चेर्नॉफ-सूचना दर पर तेजी से अलग हो जाता है, कि पछतावा पश्च अंशांकन द्वारा नियंत्रित होता है, और एन लेबल वाले अंशांकन प्रक्षेपवक्र के साथ प्रशिक्षित प्लग-इन नीति में 1/sqrt (n) की दर से कम होने का पछतावा होता है। कथित तौर पर एक नियंत्रित सिमुलेशन अध्ययन उस दर सहित सिद्धांत की भविष्यवाणियों की पुष्टि करता है। पेपर में 257 एमबीपीपी कोडिंग कार्यों पर Qwen2.5-Coder 1.5B-to-7B कैस्केड का उपयोग करके एक वास्तविक-मॉडल सत्यापन भी शामिल है। उस सत्यापन ने तीन पूर्व-पंजीकृत भविष्यवाणियों में से दो की पुष्टि की: एस्केलेशन फ्रंटियर ने समान लागत पर पोस्ट-हॉक रूटिंग से बेहतर प्रदर्शन किया, और पीढ़ी के दौरान संचयी क्षमता का विश्वास अधिक भेदभावपूर्ण हो गया। स्रोत तीसरी भविष्यवाणी की पहचान नहीं करता है या संक्षेप में यह नहीं बताता है कि इसकी पुष्टि क्यों नहीं की गई।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

यदि दृष्टिकोण सामान्य हो जाता है, तो यह एजेंट सिस्टम को क्षमता, विलंबता और मॉडल-उपयोग लागत को संतुलित करने का अधिक समयबद्ध तरीका प्रदान कर सकता है। साक्ष्य अभी भी प्रारंभिक है: पेपर के वास्तविक-मॉडल परीक्षण में 257 एमबीपीपी कार्यों पर क्वेन2.5-कोडर 1.5बी-टू-7बी कैस्केड का उपयोग किया गया और तीन पूर्व-पंजीकृत भविष्यवाणियों में से दो की पुष्टि की गई।

व्यावहारिक मुद्दा एआई एजेंट के अंदर संसाधन आवंटन है। एक प्रणाली जो हमेशा एक मजबूत मॉडल का उपयोग करती है वह क्षमता में सुधार कर सकती है लेकिन अधिक अनुमान संसाधनों का उपभोग करती है। एक प्रणाली जो कमजोर मॉडल को पूरा होने तक प्रतिबद्ध करती है वह समय बर्बाद कर सकती है या टालने योग्य विफलता उत्पन्न कर सकती है। स्व-वृद्धि निर्णय को तर्क प्रक्रिया के अंदर रखने का प्रयास करती है, जिससे सिस्टम को रुकने का मौका मिलता है जब उसके स्वयं के साक्ष्य बताते हैं कि जारी रखने से लाभ मिलने की संभावना नहीं है।

अंशांकन पर पेपर का जोर महत्वपूर्ण है क्योंकि वृद्धि क्षमता अनुमान की गुणवत्ता पर निर्भर करती है। एक आत्मविश्वास संकेत जो खराब रूप से कैलिब्रेट किया गया है, एक एजेंट को बहुत बार बढ़ने, लागत में वृद्धि, या बहुत कम ही, कमजोर उत्तरों को पारित करने की अनुमति दे सकता है। रिपोर्ट की गई अफसोस की गारंटी भाषा मॉडल की सार्वभौमिक रूप से विश्वसनीय संपत्ति के रूप में वृद्धि को प्रस्तुत करने के बजाय प्रदर्शन को उस अंशांकन से जोड़ती है।

वास्तविक-मॉडल सत्यापन में समान-लागत तुलना संभावित रूप से उपयोगी है क्योंकि यह असीमित अतिरिक्त मॉडल कॉल के साथ सिस्टम की तुलना करने के बजाय एक ठोस तैनाती ट्रेडऑफ़ को लक्षित करती है। हालाँकि, रिपोर्ट किया गया मूल्यांकन संकीर्ण है। इसमें एक मॉडल परिवार, स्रोत में वर्णित एक छोटे से मध्यम कैस्केड कॉन्फ़िगरेशन और 257 एमबीपीपी कार्य शामिल हैं। सार पूर्ण सफलता दर, सटीक लागत लेखांकन, लाभ का आकार या गैर-कोडिंग कार्यों से साक्ष्य प्रदान नहीं करता है। इसलिए यह विधि में रुचि का समर्थन करता है, न कि यह निष्कर्ष कि पदानुक्रमित एजेंट आमतौर पर जानते हैं कि मदद कब लेनी है।

परिणाम गतिशील गणना की ओर एजेंट डिज़ाइन में व्यापक बदलाव के लिए भी उपयुक्त है: सिस्टम को यह तय करने की आवश्यकता हो सकती है कि प्रत्येक कार्य पर कितना तर्क, सत्यापन या मॉडल क्षमता खर्च की जाए। यह पेपर उस निर्णय के एक संस्करण के लिए एक औपचारिक रूपरेखा का योगदान देता है। इसका सार्वजनिक मूल्य इस बात पर निर्भर करेगा कि क्या ढांचे को भरोसेमंद निगरानी के साथ लागू किया जा सकता है और क्या अतिरिक्त अंशांकन डेटा, निर्णय ओवरहेड और हैंडऑफ़ जटिलता बेहतर परिणामों से उचित है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

मुख्य प्रश्न यह है कि क्या सीखी गई क्षमता का अनुमान पेपर की नियंत्रित सेटिंग से परे मॉडल, कार्यों और वातावरण में कैलिब्रेट किया जाता है। स्वतंत्र प्रतिकृति को बड़े और अधिक विविध कार्यभार, अपुष्ट भविष्यवाणी, वृद्धि त्रुटियों और पीढ़ी के दौरान नियंत्रण स्थानांतरित करने की व्यावहारिक लागत का परीक्षण करना चाहिए।

प्रतिकृति को यह स्थापित करना चाहिए कि पोस्ट-हॉक रूटिंग पर रिपोर्ट किया गया लाभ एमबीपीपी के बाहर और क्वेन2.5-कोडर 1.5बी-टू-7बी कैस्केड से परे बना हुआ है या नहीं। उपयोगी परीक्षण कार्य की कठिनाई, मॉडल जोड़े, डोमेन और वृद्धि की सापेक्ष कीमत या विलंबता में भिन्न होंगे। स्रोत स्वयं उन परीक्षणों की रिपोर्ट नहीं करता है, इसलिए उनकी अनुपस्थिति विफलता के सबूत के बजाय एक सार्थक अज्ञात है।

अपुष्ट पूर्वपंजीकृत भविष्यवाणी विशेष ध्यान देने योग्य है। सार कहता है कि तीन में से दो भविष्यवाणियों की पुष्टि की गई थी लेकिन शेष भविष्यवाणी का नाम या परिणाम का वर्णन नहीं किया गया है। पाठकों को पूरा पेपर, जारी कोड और डेटा, या अनुवर्ती कार्य देखना चाहिए जो स्पष्ट करता है कि क्या परीक्षण किया गया था, भविष्यवाणी क्यों विफल रही, और क्या विफलता सिद्धांत, संकेत या कार्यान्वयन में किसी सीमा की ओर इशारा करती है।

भविष्य के मूल्यांकन में केवल औसत कार्य सफलता ही नहीं, बल्कि गलत अंशांकन के हानिकारक रूपों को भी मापा जाना चाहिए। एक एजेंट आसान कार्यों को अनावश्यक रूप से आगे बढ़ा सकता है, कठिन कार्यों को आगे बढ़ाने में विफल हो सकता है, या मजबूत मॉडल की मदद के लिए बहुत देर से नियंत्रण स्थानांतरित कर सकता है। स्रोत एक अफसोस ढाँचा स्थापित करता है, लेकिन संक्षेप में, इन परिचालन त्रुटि प्रकारों की मात्रा निर्धारित नहीं करता है या यह नहीं दिखाता है कि वितरण बदलाव के तहत विधि कैसे व्यवहार करती है।

पेपर काम से जुड़े कोड और डेटा को सूचीबद्ध करता है, जिससे स्वतंत्र जांच संभव हो सकती है, लेकिन स्रोत लिंक प्रदान नहीं करता है या रिलीज़ सामग्री का वर्णन नहीं करता है। सत्यापन में अंशांकन प्रक्रिया, लेबल किए गए प्रक्षेप पथ, लागत मॉडल, पूर्व पंजीकरण, सिमुलेशन सेटअप और 257-कार्य सत्यापन के आसपास सांख्यिकीय अनिश्चितता की जांच करनी चाहिए। तब तक, सबसे मजबूत समर्थित निष्कर्ष यह है कि प्रीप्रिंट आशाजनक लेकिन सीमित अनुभवजन्य साक्ष्य के साथ मध्य पीढ़ी की वृद्धि के लिए एक औपचारिक, परीक्षण योग्य दृष्टिकोण प्रदान करता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?