क्या हुआ?
फोर्ब्स की रिपोर्ट है कि सेमीएनालिसिस ने एजेंटएक्स प्रकाशित किया है, जो एक ओपन-सोर्स बेंचमार्क है जो निश्चित संकेतों का उपयोग करने के बजाय अज्ञात कोडिंग-एजेंट सत्रों को दोबारा चलाता है। कवर किए गए कॉन्फ़िगरेशन में, सेमीएनालिसिस ने पाया कि Nvidia हार्डवेयर में एक निर्दिष्ट ऑपरेटिंग बिंदु पर एएमडी पर पांच गुना लागत-दक्षता लाभ था, कुछ खुले सर्विंग स्टैक पर बड़े अंतराल के साथ। आपूर्ति किया गया स्रोत स्वतंत्र रूप से बेंचमार्क की पुष्टि नहीं करता है या उसके परिणामों को पुन: प्रस्तुत नहीं करता है।
फोर्ब्स की रिपोर्ट है कि सेमीएनालिसिस ने 24 अगस्त को प्रोडक्शन-स्टाइल अनुमान के लिए ट्रेस-रिप्ले बेंचमार्क के रूप में एजेंटएक्स को प्रकाशित किया। समान संकेत और आउटपुट लंबाई भेजने के बजाय, एजेंटएक्स वास्तविक कोडिंग-एजेंट सत्रों की संरचना को दोहराता है, जिसमें लंबे इतिहास, कई मोड़ और ठहराव शामिल हैं, जबकि एक एजेंट टूल का उपयोग करता है। फोर्ब्स का कहना है कि सेमीएनालिसिस ने अपने स्वयं के कर्मचारियों से जुड़े Claude Code और Codex अनुरोधों से 8,000 से अधिक सत्रों और 610 बिलियन टोकन का एक कोष बनाया। सार्वजनिक संस्करण 1.0 उपसमुच्चय में 393 Claude Code सत्र हैं और इसे Apache 2.0 के अंतर्गत जारी किया गया है। स्रोत उन आंकड़ों का स्वतंत्र सत्यापन प्रदान नहीं करता है।
फोर्ब्स की रिपोर्ट है कि सार्वजनिक निशानों को 64 टोकन के सत्र-स्कोप वाले जंजीर हैश ब्लॉक में परिवर्तित कर दिया जाता है, मूल संकेतों और कोड को हटाते समय उपसर्ग संबंधों को संरक्षित किया जाता है। सेमीएनालिसिस ने 142,000 टोकन की औसत इनपुट लंबाई, 444 टोकन का औसत आउटपुट और घुमावों के बीच एक औसत 3.84-सेकंड का अंतर बताया। फोर्ब्स का यह भी कहना है कि 393 सार्वजनिक सत्रों में से 175 में कम से कम एक उप-एजेंट पैदा हुआ। उन विशेषताओं का उद्देश्य यह परीक्षण करना है कि क्या सेवा प्रणालियाँ कुंजी-मूल्य कैश स्थिति को बनाए रखती हैं और बारी-बारी से उसका पुन: उपयोग करती हैं, उस स्थिति को धारण करने वाले कार्यकर्ता के लिए एक सत्र को रूट करती हैं और बार-बार संदर्भ के अनावश्यक पुन: प्रसंस्करण से बचती हैं।
एक रिपोर्ट किए गए ऑपरेटिंग बिंदु पर, फोर्ब्स का कहना है कि सेमीएनालिसिस ने Nvidia हार्डवेयर को AMD की तुलना में पांच गुना अधिक लागत-कुशल के रूप में मापा, जब प्रति उपयोगकर्ता प्रति सेकंड 150 आउटपुट टोकन पर ओपन-सोर्स SGLang सर्विंग स्टैक के माध्यम से GLM 5.3 चलाया गया। लेख में कहा गया है कि AMD के MI355X के साथ B200 की तुलना में प्रति उपयोगकर्ता 108 टोकन प्रति सेकंड पर लगभग 57% का Nvidia लाभ और प्रति उपयोगकर्ता 141 टोकन प्रति सेकंड पर 247% का लाभ दिखाया गया है। SGLang के माध्यम से Qwen 3.5 पर, फोर्ब्स की रिपोर्ट है कि Nvidia प्रति उपयोगकर्ता 90 टोकन प्रति सेकंड पर 20 गुना से अधिक आगे था। ये कॉन्फ़िगरेशन-विशिष्ट परिणाम हैं, सार्वभौमिक हार्डवेयर अनुपात नहीं।
यह क्यों मायने रखता है?
रिपोर्ट बताती है कि एजेंटों के लिए एआई-अनुमान प्रदर्शन सॉफ्टवेयर, कैश पुन: उपयोग, रूटिंग और लंबी-संदर्भ सेवा पर निर्भर करता है - न कि केवल त्वरक विनिर्देशों पर। यह बुनियादी ढांचे की खरीदारी, क्लाउड मूल्य निर्धारण और AMD और Nvidia की प्रतिस्पर्धात्मकता को प्रभावित कर सकता है। निष्कर्ष परीक्षण किए गए हार्डवेयर, मॉडल, सॉफ़्टवेयर संस्करण और कार्यभार के निशान तक सीमित हैं।
व्यावहारिक महत्व यह है कि एजेंट का कार्यभार अंतिम उत्तर तैयार करने की तुलना में संदर्भ को संसाधित करने या पुन: उपयोग करने में कहीं अधिक समय खर्च कर सकता है। फोर्ब्स ने केवल 444 आउटपुट टोकन के मुकाबले 142,000 टोकन के औसत एजेंटएक्स इनपुट की रिपोर्ट दी है, जो कई पारंपरिक बेंचमार्क के विपरीत एक पैटर्न है। यदि समान ट्रैफ़िक उत्पादन में आम है, तो कैश्ड संदर्भ और रूट फॉलो-अप को कुशलतापूर्वक पुन: उपयोग करने की क्षमता कोडिंग एजेंटों, अनुसंधान सहायकों और अन्य टूल-उपयोग प्रणालियों की लागत और प्रतिक्रिया को प्रभावित कर सकती है। आपूर्ति किया गया स्रोत यह स्थापित नहीं करता है कि निशान व्यापक बाज़ार के कितने प्रतिनिधि हैं।
फोर्ब्स Nvidia के कथित लाभ का श्रेय सॉफ्टवेयर स्तर को देता है। लेख Nvidia के TensorRT-LLM स्टैक में कैश प्रबंधन, रूटिंग, शेड्यूलिंग, विशेष कर्नेल और सीमा-जागरूक वृद्धिशील टोकननाइजेशन का वर्णन करता है। फोर्ब्स का कहना है कि वृद्धिशील टोकननाइजेशन एक Qwen 3.5 ट्रेस में 1,087 परीक्षण किए गए ट्रांजिशन में पूर्ण-टोकनाइजेशन परिणामों से मेल खाता है, जबकि औसत प्रसंस्करण समय प्रति मोड़ 185.1 मिलीसेकंड से घटाकर 11.3 मिलीसेकंड कर दिया गया है। यदि सटीक है, तो ऐसे सुधार बार-बार काम को कम करके पुराने या अन्यथा तुलनीय त्वरक को अधिक प्रतिस्पर्धी बना सकते हैं। उनका यह भी मतलब है कि सॉफ़्टवेयर में बदलाव होने पर बेंचमार्क रैंकिंग तेज़ी से बदल सकती है।
रिपोर्ट प्रतिस्पर्धा के लिए मायने रखती है क्योंकि यह इस धारणा को चुनौती देती है कि दूसरा त्वरक आपूर्तिकर्ता अकेले हार्डवेयर मूल्य निर्धारण के माध्यम से Nvidia की स्थिति को स्वचालित रूप से कम कर देगा। फोर्ब्स का कहना है कि AMD का ATOM इंजन एक Kimi K3 विलंबता वक्र के हिस्से में vLLM पर चलने वाले GB300 NVL72 सिस्टम को मात देता है, और AMD का MI355X DeepSeek V4 पर SGLang के साथ B200 से मेल खाता है, इससे पहले बाद में Nvidia और Inferact अनुकूलन को अपस्ट्रीम में विलय कर दिया गया था। यह उलटफेर एएमडी की क्षमता और सॉफ्टवेयर अपनाने के महत्व दोनों को दर्शाता है। फोर्ब्स यह भी रिपोर्ट करता है कि ATOM का उत्पादन उपयोग सीमित है और AMD बैकएंड को कुछ vLLM संदर्भ-समानांतर पथों के लिए सूचीबद्ध नहीं किया गया था, लेकिन वे सॉफ़्टवेयर स्थितियाँ बदल सकती हैं।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
मुख्य अनुवर्ती यह है कि क्या AMD के ATOM अनुकूलन और लंबे-संदर्भ सेवा के लिए समर्थन को vLLM और SGLang जैसे मुख्यधारा के सॉफ़्टवेयर में अधिक व्यापक रूप से अपनाया जाता है। खरीदारों को उत्पादन उपसर्ग-कैश हिट दर, होस्ट-मेमोरी उपयोग, सत्र रूटिंग और टर्न-लेवल विलंबता की भी जांच करनी चाहिए। फोर्ब्स के अनुसार, सेमीएनालिसिस से एक महीने के भीतर बेंचमार्क अपडेट होने की उम्मीद है।
सबसे महत्वपूर्ण अनुवर्ती यह है कि सॉफ़्टवेयर अपडेट के बाद रिपोर्ट किया गया अंतर बना रहता है या नहीं। फोर्ब्स का कहना है कि सेमीएनालिसिस ने एक महीने के भीतर एक एजेंटएक्स अपडेट निर्धारित किया है, और लेख में कहा गया है कि 21 अगस्त को एक अपस्ट्रीम परिवर्तन ने DeepSeek V4 तुलना को बदल दिया। भविष्य के संस्करणों को यह दिखाना चाहिए कि क्या AMD की ATOM क्षमताएं आमतौर पर उपयोग किए जाने वाले सर्विंग स्टैक तक पहुंचती हैं, क्या vLLM और SGLang लंबे-संदर्भ समानता और ऑफलोड के लिए अधिक परिपक्व AMD समर्थन जोड़ते हैं, और क्या दोनों पक्षों पर तुलनीय अनुकूलन लागू होने के बाद भी Nvidia की बढ़त बनी रहती है।
बुनियादी ढांचे के खरीदारों को समग्र टोकन-प्रति-सेकंड आंकड़ों पर भरोसा करने के बजाय प्रदाताओं से कार्यभार-विशिष्ट साक्ष्य मांगना चाहिए। फोर्ब्स ने उत्पादन समवर्ती पर निरंतर उपसर्ग-कैश हिट दरों की जांच करने की सिफारिश की है, त्वरक मेमोरी को वापस करने के लिए उपयोग की जाने वाली होस्ट मेमोरी की मात्रा, और क्या सत्र रूटिंग अपने कैश्ड उपसर्ग को पकड़ने वाले कार्यकर्ता के साथ बातचीत रखती है। लेख में बताया गया है कि सेमीएनालिसिस ने अतिरिक्त होस्ट-मेमोरी पुन: उपयोग के साथ, विभिन्न समवर्ती स्तरों के तहत एक बी300 कॉन्फ़िगरेशन पर 91% और बी200 कॉन्फ़िगरेशन पर 73% की उच्च-बैंडविड्थ-मेमोरी हिट दर पाई। वे माप किसी सामान्य नियम को स्थापित करने के लिए सीधे तौर पर तुलनीय नहीं हैं, लेकिन वे दिखाते हैं कि कौन से परिचालन विवरण लागत और विलंबता को प्रभावित कर सकते हैं।
बेंचमार्क कई सामग्री अज्ञात भी छोड़ देता है। फोर्ब्स का कहना है कि एजेंटएक्स अज्ञात ट्रेस सामग्री को सिंथेटिक टोकन से बदल देता है, जो सट्टा-डिकोडिंग स्वीकृति को विकृत कर सकता है, और सेमीएनालिसिस ने इसे लाइव मापने के बजाय स्पीड-बेंच से ली गई स्वीकृति लंबाई का उपयोग किया। निशान भारी संदर्भ के साथ कोडिंग हार्नेस से आते हैं, जबकि एक पतला हार्नेस एक अलग इनपुट वितरण उत्पन्न करता है। एजेंटएक्स का बंद-लूप डिज़ाइन कार्यभार मिश्रण को भी बदल सकता है क्योंकि तेज़ सिस्टम अधिक अनुरोधों को पूरा करते हैं। Google TPU अनुपस्थित हैं, और बाद में Nvidia रुबिन हार्डवेयर और AMD का MI455X वर्णित तुलना से बाहर हैं। स्रोत में विक्रेता की प्रतिक्रियाएँ, स्वतंत्र प्रतिकृतियाँ और गैर-कोडिंग एजेंट कार्यभार पर परिणाम प्रदान नहीं किए गए हैं।