क्या हुआ?
शोधकर्ता माइकल वू और आर्किमिडीज़ कैनेडो ने "अमान्य अनुबंध" का प्रस्ताव दिया है, जो एआई एजेंटों के लिए एक प्रोटोकॉल परत है जो पूरे एपिसोड में एपीआई त्रुटियों से पुनर्प्राप्ति सुझावों को कैश करता है। अनुबंध प्रत्येक सुझाव के लिए संस्करण स्टांप और कैशेबिलिटी संकेत संलग्न करते हैं ताकि ग्राहक मान्य प्रविष्टियों को संरक्षित करते हुए सर्वर-साइड डेटा बहाव के बाद पुरानी प्रविष्टियों को हटा सकें।
यह पेपर एआई एजेंटों को संबोधित करता है जो एपीआई त्रुटियों का सामना करने के बाद पुनर्प्राप्ति सुझावों को बनाए रखते हैं। इसकी मुख्य चिंता यह है कि एक एपिसोड में काम करने वाला सुझाव सर्वर-साइड डेटा परिवर्तन के बाद गलत हो सकता है। प्रत्येक एपिसोड पर दोबारा सुधार लाने से उस विफलता मोड से बचा जा सकता है, लेकिन लेखकों का कहना है कि यह कैशिंग से हुई बचत वापस देता है। उनका प्रस्तावित समाधान, जिसे अमान्यकरण अनुबंध कहा जाता है, कैश को एक अपरिभाषित ब्लॉक के रूप में मानने के बजाय प्रत्येक पुनर्प्राप्ति सुझाव में प्रोटोकॉल मेटाडेटा जोड़ता है।
अनुबंध सुझावों के लिए संस्करण स्टाम्प और कैशेबिलिटी संकेत संलग्न करता है। इसके बाद क्लाइंट बदले हुए डेटा से जुड़ी प्रविष्टियों को बाहर कर सकता है, जबकि उन प्रविष्टियों को बरकरार रख सकता है जो अभी भी वैध हैं। लेखक परिणामी बचत को वैधता में अलग करते हैं - कैश्ड सुझावों का वह अंश जो बहाव की घटना के बाद सही रहता है - और अनुपालन - वह अंश जिसे एक योजनाकार अपने पहले प्रयास में सही ढंग से लागू करता है। पेपर में कहा गया है कि वैधता प्रोटोकॉल द्वारा निर्धारित की जाती है और विक्रेता-स्वतंत्र है, जबकि अनुपालन योजनाकार मॉडल पर निर्भर करता है।
मूल्यांकन में सात मॉडल, तीन सर्विंग पथ, दो डोमेन और लगभग 9,400 एपिसोड शामिल थे। सार रिपोर्ट है कि पंक्ति-स्तरीय अमान्यकरण ने सभी मॉडलों में 0 और 66.7 प्रतिशत अंक के बीच अनुपालन में वृद्धि की है; तीन मॉडलों में 55.6 और 66.7 अंक के बीच बढ़त देखी गई। सात मॉडलों में से चार ने बेसलाइन टोकन लागत का 29% से 33% वसूल किया। पेपर धारा 4.1 में वर्णित पंक्ति-स्तरीय ओरेकल के तहत पंक्ति ग्रैन्युलैरिटी पर पूर्ण निष्कासन परिशुद्धता, 1.00 की भी रिपोर्ट करता है।
मॉडल के अनुसार परिणाम तेजी से भिन्न-भिन्न हुए। लेखक समान वायर बाइट्स के साथ Claude Haiku 4.5 के लिए 100% प्रथम-प्रयास अनुपालन की रिपोर्ट करते हैं, जबकि Claude सॉनेट 5 के लिए यह 11% या उससे कम है। वे सॉनेट के व्यवहार को इनपुट-स्कीमा रूढ़िवाद के लिए जिम्मेदार मानते हैं: मूल अनुरोध से अनुपस्थित फ़ील्ड जोड़ने वाले फिक्स को अस्वीकार करना। इसके विपरीत, टेबल-स्तरीय अमान्यकरण ने सह-स्थित प्रविष्टियों को नष्ट कर दिया और सात में से पांच मॉडलों पर पोस्ट-ड्रिफ्ट प्रथम-प्रयास दरों को 0% तक कम कर दिया। अनुबंध ने प्रतिक्रिया पेलोड में 15% जोड़ा, और लेखक मूल्यांकन के दौरान शून्य अनुबंध विफलताओं की रिपोर्ट करते हैं।
यह क्यों मायने रखता है?
पेपर लगातार एजेंट मेमोरी को एक विश्वसनीयता और दक्षता समस्या के रूप में प्रस्तुत करता है: हर बार सुधारों को पुन: गणना करने से बासी सलाह से बचा जाता है लेकिन कैशिंग द्वारा प्रदान की जा सकने वाली टोकन और मॉडल-कॉल बचत का त्याग कर दिया जाता है। इसके रिपोर्ट किए गए परिणाम बताते हैं कि पंक्ति स्तर पर मेमोरी को अमान्य करने से उपयोगी कैश प्रविष्टियों को संरक्षित किया जा सकता है, हालांकि निष्कर्ष एक प्रीप्रिंट के मूल्यांकन से आते हैं और उत्पादन प्रदर्शन स्थापित नहीं करते हैं।
व्यावहारिक मुद्दा केवल यह नहीं है कि कोई एजेंट याद रख सकता है या नहीं। यह है कि बाहरी सेवा में परिवर्तन होने पर मेमोरी उपयोग के लिए सुरक्षित रहती है या नहीं। एक कैश्ड पुनर्प्राप्ति सुझाव बार-बार तर्क, टोकन उपयोग और मॉडल कॉल को कम कर सकता है, लेकिन यदि आसपास का एपीआई या डेटा भटक गया है तो वही शॉर्टकट एक मूक विफलता बन सकता है। प्रस्तावित प्रोटोकॉल ताजगी की जानकारी को सेवा और ग्राहक के बीच बातचीत का हिस्सा बनाता है।
वैधता और अनुपालन के बीच पेपर का अंतर उपयोगी है क्योंकि यह दो अलग-अलग विफलता स्रोतों को अलग करता है। एक प्रोटोकॉल यह पहचान सकता है कि कौन सी कैश्ड प्रविष्टियों को छोड़ दिया जाना चाहिए, फिर भी एक एजेंट एक वैध सुझाव को लागू करने में विफल हो सकता है। हाइकु 4.5 और सॉनेट 5 के बीच रिपोर्ट किया गया विरोधाभास इंगित करता है कि अकेले प्रोटोकॉल डिज़ाइन यह निर्धारित नहीं कर सकता है कि एक योजनाकार को संरक्षित मेमोरी से लाभ होता है या नहीं। मॉडल व्यवहार एक अलग परिचालन बाधा बनी हुई है।
रिपोर्ट किए गए पंक्ति-स्तरीय परिणाम उन सिस्टमों के लिए एक संभावित डिज़ाइन सिद्धांत का सुझाव देते हैं जो कई पुनर्प्राप्ति सुझावों को एक साथ संग्रहीत करते हैं: केवल प्रभावित प्रविष्टियों को अमान्य करें जब प्रोटोकॉल उन्हें पहचान सकता है। तालिका-स्तरीय तुलना पेपर के परीक्षणों के भीतर परिणामी है क्योंकि व्यापक अमान्यता ने असंबंधित प्रविष्टियों को समाप्त कर दिया और अधिकांश परीक्षण किए गए मॉडलों पर शून्य पोस्ट-ड्रिफ्ट प्रथम-प्रयास दरें उत्पन्न कीं। यदि उस निष्कर्ष को दोहराया जाता है, तो यह लंबे समय तक चलने वाले एजेंटों की लागत और विश्वसनीयता के लिए मायने रखेगा।
दक्षता का दावा भी सीमित है। लेखक चार मॉडलों पर बेसलाइन टोकन लागत की 29% से 33% की वसूली की रिपोर्ट करते हैं, सभी सातों पर नहीं, और प्रोटोकॉल प्रतिक्रिया पेलोड में 15% जोड़ता है। स्रोत यह नहीं बताता है कि वे लागतें विलंबता, बैंडविड्थ, बुनियादी ढांचे के व्यय या उत्पादन में उपयोगकर्ता-दृश्यमान विश्वसनीयता में कैसे परिवर्तित होती हैं। न ही सार यह स्थापित करता है कि परीक्षण किए गए डोमेन या सेवा पथ तैनात एजेंटों द्वारा उपयोग किए जाने वाले एपीआई की सीमा का प्रतिनिधित्व करते हैं।
यह स्वतंत्र रूप से मान्य उत्पादन परिणाम के बजाय एक प्रीप्रिंट है। स्रोत मूल्यांकन आकार और शीर्षक परिणामों की पहचान करता है लेकिन सात मॉडलों में से पांच की पहचान, दो डोमेन के नाम, सटीक बहाव परिदृश्य या अनिश्चितता अनुमान प्रदान नहीं करता है। सही निष्कासन परिशुद्धता स्पष्ट रूप से एक पंक्ति-स्तरीय ओरेकल से जुड़ी हुई है, इसलिए इसे सबूत के रूप में नहीं पढ़ा जाना चाहिए कि तैनात ग्राहकों को हमेशा पता चलेगा कि कौन सी पंक्तियाँ पुरानी हैं।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
मुख्य खुले प्रश्न यह हैं कि क्या प्रोटोकॉल अधिक योजनाकारों, सेवाओं, डोमेन और वास्तविक दुनिया के बहाव पैटर्न के साथ काम करता है, और क्या इसका 15% प्रतिक्रिया-पेलोड ओवरहेड तैनात सिस्टम में स्वीकार्य है। आगे की जांच में पेपर के ओरेकल-आधारित निष्कासन मूल्यांकन, सात परीक्षण किए गए अज्ञात मॉडल और नामित Claude मॉडल के बीच बड़े अनुपालन अंतर के कारणों की भी जांच की जानी चाहिए।
प्रतिकृति को यह परीक्षण करना चाहिए कि जब सेवाएँ विभिन्न दरों पर स्कीमा, शब्दार्थ या डेटा बदलती हैं तो संस्करण-स्टाम्प वैधता नियतात्मक रहती है या नहीं। पेपर प्रत्येक मॉडल और सेवा पथ और शून्य अनुबंध विफलताओं में समान वैधता परिणामों की रिपोर्ट करता है, लेकिन स्रोत यह निर्धारित करने के लिए पर्याप्त विवरण में बहाव घटनाओं की सीमा का वर्णन नहीं करता है कि परिणाम कितने व्यापक रूप से लागू होता है।
मॉडल-साइड अनुपालन अलग जांच का पात्र है। Claude Haiku 4.5 पर 100% प्रथम-प्रयास अनुपालन और Claude सॉनेट 5 पर 11% या उससे कम के बीच रिपोर्ट किए गए अंतर से पता चलता है कि एजेंट एक ही प्रोटोकॉल पेलोड की अलग-अलग व्याख्या कर सकते हैं। भविष्य के मूल्यांकन से यह स्पष्ट होना चाहिए कि क्या समस्या नामित मॉडलों के लिए विशिष्ट है, शीघ्र या स्कीमा डिज़ाइन के लिए है, या योजनाकारों के बीच संरचनात्मक रूप से अपरिचित सुधारों को अस्वीकार करने की व्यापक प्रवृत्ति के लिए है।
लागत समझौता टोकन से परे मापा जाना चाहिए। एपिसोड की लंबाई, नेटवर्क स्थितियों और कितनी बार कैश्ड सुझावों का पुन: उपयोग किया जाता है, इसके आधार पर 15% प्रतिक्रिया-पेलोड वृद्धि मामूली या महत्वपूर्ण हो सकती है। स्रोत चार मॉडलों के लिए टोकन-लागत वसूली की रिपोर्ट करता है लेकिन विलंबता, बैंडविड्थ, मौद्रिक या विफलता-दर परिणाम प्रदान नहीं करता है, इसलिए वे कार्यान्वयनकर्ताओं के लिए सार्थक अज्ञात बने रहते हैं।
मूल्यांकन का पंक्ति-स्तरीय दैवज्ञ जांच का एक और बिंदु है। जब प्रभावित पंक्ति ज्ञात होती है तो ओरेकल के तहत पूर्ण परिशुद्धता प्रस्तावित ग्रैन्युलैरिटी के व्यवहार को प्रदर्शित करती है, लेकिन यह स्थापित नहीं करती है कि एक वास्तविक ग्राहक सामान्य सेवा संकेतों से सही पंक्ति की पहचान कर सकता है। स्वचालित पहचान, झूठी नकारात्मक और झूठी सकारात्मकता के बारे में साक्ष्य यह निर्धारित करेंगे कि प्रयोगात्मक सेटअप के बाहर रिपोर्ट किए गए लाभ में से कितना जीवित रहता है।
अंत में, कार्य की तुलना समान कार्यों और बहाव स्थितियों के तहत लगातार एजेंट स्थिति और मेमोरी अमान्यकरण के अन्य तरीकों से की जानी चाहिए। स्रोत एक प्रोटोकॉल प्रस्ताव और एक रिपोर्ट किया गया बेंचमार्क स्थापित करता है, लेकिन यह अनिर्दिष्ट विकल्पों पर तैनाती उपलब्धता, अपनाने, स्वतंत्र प्रतिकृति या श्रेष्ठता स्थापित नहीं करता है।