क्या हुआ?
NVIDIA ने संरचित मार्कडाउन मेमोरी, एक SQLite दायित्व बहीखाता और ओपनशेल रनटाइम नियंत्रणों का उपयोग करते हुए, NemoClaw के साथ निर्मित मेमोरी-संचालित चीफ ऑफ स्टाफ एजेंट के लिए एक तकनीकी डिजाइन प्रकाशित किया। कंपनी ने एजेंटिक आरएजी बेसलाइन के मुकाबले बेंचमार्क परिणामों में सुधार की रिपोर्ट दी है, जबकि यह नोट किया गया है कि उदाहरण आविष्कृत डेटा और ऑफ़लाइन वॉकथ्रू का उपयोग करता है।
NVIDIA का कहना है कि इसका NemoClaw उदाहरण एक मेमोरी-संचालित चीफ ऑफ स्टाफ एजेंट बनाता है जो लोगों, परियोजनाओं, प्राथमिकताओं, लक्ष्यों और आवर्ती कार्य पैटर्न का मानव-पठनीय "स्वयं मॉडल" बनाए रखता है। मेमोरी को अनुक्रमण, क्रॉस-रेफरेंस, उत्पत्ति और विकास सीमाओं के साथ संरचित मार्कडाउन पृष्ठों में संग्रहीत किया जाता है। एक अलग SQLite बहीखाता सबूत, ज्ञान और निर्णय के बीच अंतर को संरक्षित करते हुए दायित्वों, रैंकिंग, सुधार और ऑडिट घटनाओं को रिकॉर्ड करता है।
रेसिपी में बाउंडेड रैंकिंग लॉजिक, एक इंटेंट गेट शामिल है जो बताई गई उपयोगकर्ता प्राथमिकताओं, एपेंड-ओनली करेक्शन ऑडिट, शेड्यूल्ड मेमोरी रखरखाव, सिंथेटिक संदेश और मेमोरी पेज, यूनिट परीक्षण और एक ऑफ़लाइन वॉकथ्रू से जुड़े दायित्वों को प्राथमिकता देता है। NVIDIA का कहना है कि यह रेसिपी खुला स्रोत है और इसे NemoClaw के लिए तैनात करने योग्य हर्मीस प्रोफ़ाइल के रूप में पैक किया गया है। वर्तमान उदाहरण संदेश नहीं भेजता है या स्रोत प्रणालियों को संशोधित नहीं करता है, और इसके नमूना लोगों, संगठनों, परियोजनाओं और संदेशों का आविष्कार किया जाता है।
NVIDIA की रिपोर्ट है कि, नेमोट्रॉन 3 अल्ट्रा का उपयोग करते हुए, सेल्फ-मॉडल कॉन्फ़िगरेशन 186 प्रश्नों पर 90.9% समग्र सटीकता तक पहुंच गया, जबकि एजेंटिक पुनर्प्राप्ति-संवर्धित-पीढ़ी बेसलाइन के लिए यह 82.8% था। यह कठिन प्रश्नों, परिवर्तित-तथ्य ट्रैकिंग, पॉइंट-इन-टाइम तर्क, इकाई असंबद्धता, मल्टीसोर्स संश्लेषण और उद्धरण कवरेज पर उच्च स्कोर की भी रिपोर्ट करता है। ये उदाहरण भंडार के एजेंट मेमोरी बेंचमार्क के परिणाम हैं, स्वतंत्र मूल्यांकन नहीं।
रनटाइम पर, NVIDIA का कहना है कि NemoClaw OpenShell के साथ एकीकृत होता है, जो एजेंट को सैंडबॉक्स करता है और फ़ाइल-सिस्टम, प्रक्रिया और नेटवर्क एक्सेस को नियंत्रित करता है। प्रबंधित अनुमान और एमसीपी कनेक्शन के लिए क्रेडेंशियल सैंडबॉक्स के बाहर रहते हैं। स्रोत इस बात पर जोर देता है कि पुनर्प्राप्त सामग्री और मेमोरी मॉडल के इनपुट हैं, विश्वसनीय सुरक्षा नीति नहीं। मूल्य निर्धारण, सामान्य उपलब्धता और समर्थित लाइव कनेक्टर निर्दिष्ट नहीं हैं।
स्रोत विवरण: developer.nvidia.com ↗
यह क्यों मायने रखता है?
डिज़ाइन डेवलपर्स को स्रोत साक्ष्य, व्युत्पन्न मेमोरी, एजेंट निर्णय और अधिकृत कार्यों को अलग करने का एक ठोस तरीका प्रदान करता है - बदलते कार्यस्थल संदर्भ में संचालित होने वाली प्रणालियों के लिए एक महत्वपूर्ण अंतर। NVIDIA के रिपोर्ट किए गए बेंचमार्क लाभ संभावित रूप से उपयोगी हैं, लेकिन वे कंपनी के स्वयं के उदाहरण मूल्यांकन से आते हैं और इस स्रोत में स्वतंत्र रूप से स्थापित नहीं किए गए हैं।
लंबे समय तक चलने वाले एजेंटों को यह अंतर करने की आवश्यकता है कि स्रोत संदेश क्या कहता है और सिस्टम क्या मानता है, उसने क्या निर्णय लिया है और उसे क्या करने की अनुमति है। NVIDIA की वास्तुकला उन सीमाओं को स्पष्ट करती है, जो साक्ष्य अंतर्ग्रहण, स्मृति रखरखाव, पुनर्प्राप्ति और अंतिम निर्णय लेने में त्रुटियों का निदान करना आसान बना सकती है।
सुधार वर्कफ़्लो उल्लेखनीय है क्योंकि उपयोगकर्ता दायित्वों को स्थानांतरित या अनदेखा कर सकते हैं, बाद में उन निर्णयों को संरक्षित कर सकते हैं और परिणामी प्राथमिकता नीति का निरीक्षण या संपादन कर सकते हैं। यह उपयोगकर्ताओं को केवल छिपी हुई मॉडल स्थिति पर निर्भर रहने के बजाय एक दृश्यमान फीडबैक पथ देता है। यह उन सहायकों के लिए व्यावहारिक रूप से उपयोगी हो सकता है जिन्हें हर जरूरी अनुरोध को समान रूप से महत्वपूर्ण माने बिना बदलती प्राथमिकताओं के अनुरूप ढलना होगा।
रिपोर्ट किए गए लाभ बदले हुए तथ्यों और समय-समय पर तर्क के लिए सबसे मजबूत हैं, उन समस्याओं के प्रकार जिन्हें सामान्य वार्तालाप इतिहास और पुनर्प्राप्ति खराब तरीके से संभाल सकते हैं। हालाँकि, मूल्यांकन स्रोत के अपने बेंचमार्क और उदाहरण कार्यान्वयन तक ही सीमित है। एक मीट्रिक - कॉर्पस के प्रति वफादारी - बेसलाइन की तुलना में स्वयं मॉडल के लिए कम थी, जो रेखांकित करती है कि समग्र सटीकता में सुधार ट्रेडऑफ़ को समाप्त नहीं करता है।
सुरक्षा मॉडल का एक व्यावहारिक निहितार्थ भी है: मेमोरी किसी कार्रवाई को अधिकृत किए बिना सूचित कर सकती है। सैंडबॉक्स के बाहर क्रेडेंशियल रखने और रनटाइम पर अनुमतियाँ लागू करने से गलत या दुर्भावनापूर्ण निर्देश का प्रभाव सीमित हो सकता है, लेकिन स्रोत लाइव एंटरप्राइज़ परिनियोजन से स्वतंत्र सुरक्षा परीक्षण या साक्ष्य प्रदान नहीं करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
क्या नुस्खा वास्तविक कार्यस्थल डेटा, लाइव कनेक्टर और विभिन्न मॉडलों के साथ समान प्रदर्शन करता है, और ऑफ़लाइन उदाहरण से आगे बढ़ने पर संगठन क्रेडेंशियल्स, गोपनीयता, अवधारण, विलोपन और मानव अनुमोदन को कैसे संभालते हैं।
अगला सार्थक परीक्षण वास्तविक कार्यस्थल खातों और लाइव कनेक्टर्स के साथ तैनाती है। NVIDIA का कहना है कि उन एकीकरणों के लिए क्रेडेंशियल्स, गोपनीयता, अवधारण और विलोपन के अलग-अलग उपचार की आवश्यकता होती है, लेकिन स्रोत विशिष्ट नीतियों, अनुमोदन प्रवाह या कनेक्टर उपलब्धता का वर्णन नहीं करता है।
स्वतंत्र मूल्यांकन को यह परीक्षण करना चाहिए कि क्या रिपोर्ट किए गए सुधार मॉडल, डोमेन, मेमोरी आकार और बदलती जानकारी में बने रहते हैं, जबकि गलत प्राथमिकता, पुरानी या गलत यादें, उद्धरण विफलताएं और निर्धारित रखरखाव की लागत को मापते हैं।
डेवलपर्स को यह भी देखना चाहिए कि ओपनशेल नीतियां यथार्थवादी शीघ्र-इंजेक्शन और टूल-उपयोग परिदृश्यों के तहत कैसे व्यवहार करती हैं। NVIDIA सैंडबॉक्स और शासन सुविधाओं का वर्णन करता है, लेकिन यह स्रोत बाहरी ऑडिट या प्रतिकूल मूल्यांकन के माध्यम से उनकी प्रभावशीलता स्थापित नहीं करता है।
मूल्य निर्धारण, संपूर्ण स्टैक के लिए लाइसेंसिंग विवरण, उत्पादन समर्थन और सामान्य उपलब्धता पोस्ट में दर्ज़ नहीं हैं। वे अज्ञात इस बात को प्रभावित करेंगे कि क्या नुस्खा मुख्य रूप से एक शैक्षिक संदर्भ है या उद्यम परिनियोजन के लिए एक व्यावहारिक मार्ग है।