समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

पेपर एआई एजेंट मेमोरी को पुराना होने से बचाने के लिए संस्करणबद्ध अनुबंधों का प्रस्ताव करता है

एक नया arXiv पेपर रिपोर्ट करता है कि संस्करण स्टैम्प और पंक्ति-स्तरीय निष्कासन एआई एजेंटों को पुराने सुधारों को चुपचाप लागू किए बिना सर्वर-साइड परिवर्तनों के बाद पुनर्प्राप्ति सलाह का पुन: उपयोग करने में मदद कर सकता है।

6 min readRead the primary source
Source-page capture accompanying Paper proposes versioned contracts to keep AI agent memory from going stale
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2609.00243
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
एआई एजेंट
एक सॉफ़्टवेयर सिस्टम जो किसी लक्ष्य को प्राप्त करने के लिए अक्सर टूल और मेमोरी का उपयोग करके निरीक्षण कर सकता है, तर्क कर सकता है और कार्रवाई कर सकता है।
एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस)
एक सॉफ्टवेयर सिस्टम के लिए दूसरे सिस्टम को अनुरोध भेजने और उससे प्रतिक्रिया प्राप्त करने का एक संरचित तरीका।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

शोधकर्ता माइकल वू और आर्किमिडीज़ कैनेडो ने "अमान्य अनुबंध" का प्रस्ताव दिया है, जो एआई एजेंटों के लिए एक प्रोटोकॉल परत है जो पूरे एपिसोड में एपीआई त्रुटियों से पुनर्प्राप्ति सुझावों को कैश करता है। अनुबंध प्रत्येक सुझाव के लिए संस्करण स्टांप और कैशेबिलिटी संकेत संलग्न करते हैं ताकि ग्राहक मान्य प्रविष्टियों को संरक्षित करते हुए सर्वर-साइड डेटा बहाव के बाद पुरानी प्रविष्टियों को हटा सकें।

यह पेपर एआई एजेंटों को संबोधित करता है जो एपीआई त्रुटियों का सामना करने के बाद पुनर्प्राप्ति सुझावों को बनाए रखते हैं। इसकी मुख्य चिंता यह है कि एक एपिसोड में काम करने वाला सुझाव सर्वर-साइड डेटा परिवर्तन के बाद गलत हो सकता है। प्रत्येक एपिसोड पर दोबारा सुधार लाने से उस विफलता मोड से बचा जा सकता है, लेकिन लेखकों का कहना है कि यह कैशिंग से हुई बचत वापस देता है। उनका प्रस्तावित समाधान, जिसे अमान्यकरण अनुबंध कहा जाता है, कैश को एक अपरिभाषित ब्लॉक के रूप में मानने के बजाय प्रत्येक पुनर्प्राप्ति सुझाव में प्रोटोकॉल मेटाडेटा जोड़ता है।

अनुबंध सुझावों के लिए संस्करण स्टाम्प और कैशेबिलिटी संकेत संलग्न करता है। इसके बाद क्लाइंट बदले हुए डेटा से जुड़ी प्रविष्टियों को बाहर कर सकता है, जबकि उन प्रविष्टियों को बरकरार रख सकता है जो अभी भी वैध हैं। लेखक परिणामी बचत को वैधता में अलग करते हैं - कैश्ड सुझावों का वह अंश जो बहाव की घटना के बाद सही रहता है - और अनुपालन - वह अंश जिसे एक योजनाकार अपने पहले प्रयास में सही ढंग से लागू करता है। पेपर में कहा गया है कि वैधता प्रोटोकॉल द्वारा निर्धारित की जाती है और विक्रेता-स्वतंत्र है, जबकि अनुपालन योजनाकार मॉडल पर निर्भर करता है।

मूल्यांकन में सात मॉडल, तीन सर्विंग पथ, दो डोमेन और लगभग 9,400 एपिसोड शामिल थे। सार रिपोर्ट है कि पंक्ति-स्तरीय अमान्यकरण ने सभी मॉडलों में 0 और 66.7 प्रतिशत अंक के बीच अनुपालन में वृद्धि की है; तीन मॉडलों में 55.6 और 66.7 अंक के बीच बढ़त देखी गई। सात मॉडलों में से चार ने बेसलाइन टोकन लागत का 29% से 33% वसूल किया। पेपर धारा 4.1 में वर्णित पंक्ति-स्तरीय ओरेकल के तहत पंक्ति ग्रैन्युलैरिटी पर पूर्ण निष्कासन परिशुद्धता, 1.00 की भी रिपोर्ट करता है।

मॉडल के अनुसार परिणाम तेजी से भिन्न-भिन्न हुए। लेखक समान वायर बाइट्स के साथ Claude Haiku 4.5 के लिए 100% प्रथम-प्रयास अनुपालन की रिपोर्ट करते हैं, जबकि Claude सॉनेट 5 के लिए यह 11% या उससे कम है। वे सॉनेट के व्यवहार को इनपुट-स्कीमा रूढ़िवाद के लिए जिम्मेदार मानते हैं: मूल अनुरोध से अनुपस्थित फ़ील्ड जोड़ने वाले फिक्स को अस्वीकार करना। इसके विपरीत, टेबल-स्तरीय अमान्यकरण ने सह-स्थित प्रविष्टियों को नष्ट कर दिया और सात में से पांच मॉडलों पर पोस्ट-ड्रिफ्ट प्रथम-प्रयास दरों को 0% तक कम कर दिया। अनुबंध ने प्रतिक्रिया पेलोड में 15% जोड़ा, और लेखक मूल्यांकन के दौरान शून्य अनुबंध विफलताओं की रिपोर्ट करते हैं।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

पेपर लगातार एजेंट मेमोरी को एक विश्वसनीयता और दक्षता समस्या के रूप में प्रस्तुत करता है: हर बार सुधारों को पुन: गणना करने से बासी सलाह से बचा जाता है लेकिन कैशिंग द्वारा प्रदान की जा सकने वाली टोकन और मॉडल-कॉल बचत का त्याग कर दिया जाता है। इसके रिपोर्ट किए गए परिणाम बताते हैं कि पंक्ति स्तर पर मेमोरी को अमान्य करने से उपयोगी कैश प्रविष्टियों को संरक्षित किया जा सकता है, हालांकि निष्कर्ष एक प्रीप्रिंट के मूल्यांकन से आते हैं और उत्पादन प्रदर्शन स्थापित नहीं करते हैं।

व्यावहारिक मुद्दा केवल यह नहीं है कि कोई एजेंट याद रख सकता है या नहीं। यह है कि बाहरी सेवा में परिवर्तन होने पर मेमोरी उपयोग के लिए सुरक्षित रहती है या नहीं। एक कैश्ड पुनर्प्राप्ति सुझाव बार-बार तर्क, टोकन उपयोग और मॉडल कॉल को कम कर सकता है, लेकिन यदि आसपास का एपीआई या डेटा भटक गया है तो वही शॉर्टकट एक मूक विफलता बन सकता है। प्रस्तावित प्रोटोकॉल ताजगी की जानकारी को सेवा और ग्राहक के बीच बातचीत का हिस्सा बनाता है।

वैधता और अनुपालन के बीच पेपर का अंतर उपयोगी है क्योंकि यह दो अलग-अलग विफलता स्रोतों को अलग करता है। एक प्रोटोकॉल यह पहचान सकता है कि कौन सी कैश्ड प्रविष्टियों को छोड़ दिया जाना चाहिए, फिर भी एक एजेंट एक वैध सुझाव को लागू करने में विफल हो सकता है। हाइकु 4.5 और सॉनेट 5 के बीच रिपोर्ट किया गया विरोधाभास इंगित करता है कि अकेले प्रोटोकॉल डिज़ाइन यह निर्धारित नहीं कर सकता है कि एक योजनाकार को संरक्षित मेमोरी से लाभ होता है या नहीं। मॉडल व्यवहार एक अलग परिचालन बाधा बनी हुई है।

रिपोर्ट किए गए पंक्ति-स्तरीय परिणाम उन सिस्टमों के लिए एक संभावित डिज़ाइन सिद्धांत का सुझाव देते हैं जो कई पुनर्प्राप्ति सुझावों को एक साथ संग्रहीत करते हैं: केवल प्रभावित प्रविष्टियों को अमान्य करें जब प्रोटोकॉल उन्हें पहचान सकता है। तालिका-स्तरीय तुलना पेपर के परीक्षणों के भीतर परिणामी है क्योंकि व्यापक अमान्यता ने असंबंधित प्रविष्टियों को समाप्त कर दिया और अधिकांश परीक्षण किए गए मॉडलों पर शून्य पोस्ट-ड्रिफ्ट प्रथम-प्रयास दरें उत्पन्न कीं। यदि उस निष्कर्ष को दोहराया जाता है, तो यह लंबे समय तक चलने वाले एजेंटों की लागत और विश्वसनीयता के लिए मायने रखेगा।

दक्षता का दावा भी सीमित है। लेखक चार मॉडलों पर बेसलाइन टोकन लागत की 29% से 33% की वसूली की रिपोर्ट करते हैं, सभी सातों पर नहीं, और प्रोटोकॉल प्रतिक्रिया पेलोड में 15% जोड़ता है। स्रोत यह नहीं बताता है कि वे लागतें विलंबता, बैंडविड्थ, बुनियादी ढांचे के व्यय या उत्पादन में उपयोगकर्ता-दृश्यमान विश्वसनीयता में कैसे परिवर्तित होती हैं। न ही सार यह स्थापित करता है कि परीक्षण किए गए डोमेन या सेवा पथ तैनात एजेंटों द्वारा उपयोग किए जाने वाले एपीआई की सीमा का प्रतिनिधित्व करते हैं।

यह स्वतंत्र रूप से मान्य उत्पादन परिणाम के बजाय एक प्रीप्रिंट है। स्रोत मूल्यांकन आकार और शीर्षक परिणामों की पहचान करता है लेकिन सात मॉडलों में से पांच की पहचान, दो डोमेन के नाम, सटीक बहाव परिदृश्य या अनिश्चितता अनुमान प्रदान नहीं करता है। सही निष्कासन परिशुद्धता स्पष्ट रूप से एक पंक्ति-स्तरीय ओरेकल से जुड़ी हुई है, इसलिए इसे सबूत के रूप में नहीं पढ़ा जाना चाहिए कि तैनात ग्राहकों को हमेशा पता चलेगा कि कौन सी पंक्तियाँ पुरानी हैं।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

मुख्य खुले प्रश्न यह हैं कि क्या प्रोटोकॉल अधिक योजनाकारों, सेवाओं, डोमेन और वास्तविक दुनिया के बहाव पैटर्न के साथ काम करता है, और क्या इसका 15% प्रतिक्रिया-पेलोड ओवरहेड तैनात सिस्टम में स्वीकार्य है। आगे की जांच में पेपर के ओरेकल-आधारित निष्कासन मूल्यांकन, सात परीक्षण किए गए अज्ञात मॉडल और नामित Claude मॉडल के बीच बड़े अनुपालन अंतर के कारणों की भी जांच की जानी चाहिए।

प्रतिकृति को यह परीक्षण करना चाहिए कि जब सेवाएँ विभिन्न दरों पर स्कीमा, शब्दार्थ या डेटा बदलती हैं तो संस्करण-स्टाम्प वैधता नियतात्मक रहती है या नहीं। पेपर प्रत्येक मॉडल और सेवा पथ और शून्य अनुबंध विफलताओं में समान वैधता परिणामों की रिपोर्ट करता है, लेकिन स्रोत यह निर्धारित करने के लिए पर्याप्त विवरण में बहाव घटनाओं की सीमा का वर्णन नहीं करता है कि परिणाम कितने व्यापक रूप से लागू होता है।

मॉडल-साइड अनुपालन अलग जांच का पात्र है। Claude Haiku 4.5 पर 100% प्रथम-प्रयास अनुपालन और Claude सॉनेट 5 पर 11% या उससे कम के बीच रिपोर्ट किए गए अंतर से पता चलता है कि एजेंट एक ही प्रोटोकॉल पेलोड की अलग-अलग व्याख्या कर सकते हैं। भविष्य के मूल्यांकन से यह स्पष्ट होना चाहिए कि क्या समस्या नामित मॉडलों के लिए विशिष्ट है, शीघ्र या स्कीमा डिज़ाइन के लिए है, या योजनाकारों के बीच संरचनात्मक रूप से अपरिचित सुधारों को अस्वीकार करने की व्यापक प्रवृत्ति के लिए है।

लागत समझौता टोकन से परे मापा जाना चाहिए। एपिसोड की लंबाई, नेटवर्क स्थितियों और कितनी बार कैश्ड सुझावों का पुन: उपयोग किया जाता है, इसके आधार पर 15% प्रतिक्रिया-पेलोड वृद्धि मामूली या महत्वपूर्ण हो सकती है। स्रोत चार मॉडलों के लिए टोकन-लागत वसूली की रिपोर्ट करता है लेकिन विलंबता, बैंडविड्थ, मौद्रिक या विफलता-दर परिणाम प्रदान नहीं करता है, इसलिए वे कार्यान्वयनकर्ताओं के लिए सार्थक अज्ञात बने रहते हैं।

मूल्यांकन का पंक्ति-स्तरीय दैवज्ञ जांच का एक और बिंदु है। जब प्रभावित पंक्ति ज्ञात होती है तो ओरेकल के तहत पूर्ण परिशुद्धता प्रस्तावित ग्रैन्युलैरिटी के व्यवहार को प्रदर्शित करती है, लेकिन यह स्थापित नहीं करती है कि एक वास्तविक ग्राहक सामान्य सेवा संकेतों से सही पंक्ति की पहचान कर सकता है। स्वचालित पहचान, झूठी नकारात्मक और झूठी सकारात्मकता के बारे में साक्ष्य यह निर्धारित करेंगे कि प्रयोगात्मक सेटअप के बाहर रिपोर्ट किए गए लाभ में से कितना जीवित रहता है।

अंत में, कार्य की तुलना समान कार्यों और बहाव स्थितियों के तहत लगातार एजेंट स्थिति और मेमोरी अमान्यकरण के अन्य तरीकों से की जानी चाहिए। स्रोत एक प्रोटोकॉल प्रस्ताव और एक रिपोर्ट किया गया बेंचमार्क स्थापित करता है, लेकिन यह अनिर्दिष्ट विकल्पों पर तैनाती उपलब्धता, अपनाने, स्वतंत्र प्रतिकृति या श्रेष्ठता स्थापित नहीं करता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?