समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

फोर्ब्स की रिपोर्ट है कि Nvidia ने नए AI-एजेंट बेंचमार्क पर AMD को 5 गुना तक आगे बढ़ाया

फोर्ब्स की रिपोर्ट है कि सेमीएनालिसिस के एजेंटएक्स बेंचमार्क ने Nvidia हार्डवेयर को लंबे-संदर्भ, मल्टी-टर्न कोडिंग-एजेंट वर्कलोड पर एएमडी की तुलना में काफी अधिक लागत-कुशल पाया, जबकि चेतावनी दी कि परिणाम मॉडल, सर्विंग स्टैक और सॉफ़्टवेयर संस्करण के अनुसार भिन्न होते हैं।

5 min readRead the original reporting
Source-provided image accompanying Forbes reports Nvidia led AMD by up to 5x on new AI-agent benchmark
जिम्मेदार रिपोर्टिंगस्रोत रिकार्ड किया गया
प्रकाशक
forbes.com
स्रोत लिंक
forbes.comhttps://www.forbes.com/sites/janakirammsv/2026/08/24/nvidia-amd-ai-agent-benchmark/
स्रोत प्रकार
किसी समाचार आउटलेट द्वारा रिपोर्टिंग - प्रथम-पक्ष दस्तावेज़ नहीं।

जिसकी पुष्टि हम स्वतंत्र रूप से नहीं कर सके: यह दावा नामित आउटलेट के लिए जिम्मेदार है। हमने इसे प्रथम-पक्ष दस्तावेज़ के विरुद्ध सत्यापित नहीं किया। (forbes.com)

प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

फोर्ब्स की रिपोर्ट है कि सेमीएनालिसिस ने एजेंटएक्स प्रकाशित किया है, जो एक ओपन-सोर्स बेंचमार्क है जो निश्चित संकेतों का उपयोग करने के बजाय अज्ञात कोडिंग-एजेंट सत्रों को दोबारा चलाता है। कवर किए गए कॉन्फ़िगरेशन में, सेमीएनालिसिस ने पाया कि Nvidia हार्डवेयर में एक निर्दिष्ट ऑपरेटिंग बिंदु पर एएमडी पर पांच गुना लागत-दक्षता लाभ था, कुछ खुले सर्विंग स्टैक पर बड़े अंतराल के साथ। आपूर्ति किया गया स्रोत स्वतंत्र रूप से बेंचमार्क की पुष्टि नहीं करता है या उसके परिणामों को पुन: प्रस्तुत नहीं करता है।

फोर्ब्स की रिपोर्ट है कि सेमीएनालिसिस ने 24 अगस्त को प्रोडक्शन-स्टाइल अनुमान के लिए ट्रेस-रिप्ले बेंचमार्क के रूप में एजेंटएक्स को प्रकाशित किया। समान संकेत और आउटपुट लंबाई भेजने के बजाय, एजेंटएक्स वास्तविक कोडिंग-एजेंट सत्रों की संरचना को दोहराता है, जिसमें लंबे इतिहास, कई मोड़ और ठहराव शामिल हैं, जबकि एक एजेंट टूल का उपयोग करता है। फोर्ब्स का कहना है कि सेमीएनालिसिस ने अपने स्वयं के कर्मचारियों से जुड़े Claude Code और Codex अनुरोधों से 8,000 से अधिक सत्रों और 610 बिलियन टोकन का एक कोष बनाया। सार्वजनिक संस्करण 1.0 उपसमुच्चय में 393 Claude Code सत्र हैं और इसे Apache 2.0 के अंतर्गत जारी किया गया है। स्रोत उन आंकड़ों का स्वतंत्र सत्यापन प्रदान नहीं करता है।

फोर्ब्स की रिपोर्ट है कि सार्वजनिक निशानों को 64 टोकन के सत्र-स्कोप वाले जंजीर हैश ब्लॉक में परिवर्तित कर दिया जाता है, मूल संकेतों और कोड को हटाते समय उपसर्ग संबंधों को संरक्षित किया जाता है। सेमीएनालिसिस ने 142,000 टोकन की औसत इनपुट लंबाई, 444 टोकन का औसत आउटपुट और घुमावों के बीच एक औसत 3.84-सेकंड का अंतर बताया। फोर्ब्स का यह भी कहना है कि 393 सार्वजनिक सत्रों में से 175 में कम से कम एक उप-एजेंट पैदा हुआ। उन विशेषताओं का उद्देश्य यह परीक्षण करना है कि क्या सेवा प्रणालियाँ कुंजी-मूल्य कैश स्थिति को बनाए रखती हैं और बारी-बारी से उसका पुन: उपयोग करती हैं, उस स्थिति को धारण करने वाले कार्यकर्ता के लिए एक सत्र को रूट करती हैं और बार-बार संदर्भ के अनावश्यक पुन: प्रसंस्करण से बचती हैं।

एक रिपोर्ट किए गए ऑपरेटिंग बिंदु पर, फोर्ब्स का कहना है कि सेमीएनालिसिस ने Nvidia हार्डवेयर को AMD की तुलना में पांच गुना अधिक लागत-कुशल के रूप में मापा, जब प्रति उपयोगकर्ता प्रति सेकंड 150 आउटपुट टोकन पर ओपन-सोर्स SGLang सर्विंग स्टैक के माध्यम से GLM 5.3 चलाया गया। लेख में कहा गया है कि AMD के MI355X के साथ B200 की तुलना में प्रति उपयोगकर्ता 108 टोकन प्रति सेकंड पर लगभग 57% का Nvidia लाभ और प्रति उपयोगकर्ता 141 टोकन प्रति सेकंड पर 247% का लाभ दिखाया गया है। SGLang के माध्यम से Qwen 3.5 पर, फोर्ब्स की रिपोर्ट है कि Nvidia प्रति उपयोगकर्ता 90 टोकन प्रति सेकंड पर 20 गुना से अधिक आगे था। ये कॉन्फ़िगरेशन-विशिष्ट परिणाम हैं, सार्वभौमिक हार्डवेयर अनुपात नहीं।

स्रोत विवरण: forbes.com ↗

यह क्यों मायने रखता है?

रिपोर्ट बताती है कि एजेंटों के लिए एआई-अनुमान प्रदर्शन सॉफ्टवेयर, कैश पुन: उपयोग, रूटिंग और लंबी-संदर्भ सेवा पर निर्भर करता है - न कि केवल त्वरक विनिर्देशों पर। यह बुनियादी ढांचे की खरीदारी, क्लाउड मूल्य निर्धारण और AMD और Nvidia की प्रतिस्पर्धात्मकता को प्रभावित कर सकता है। निष्कर्ष परीक्षण किए गए हार्डवेयर, मॉडल, सॉफ़्टवेयर संस्करण और कार्यभार के निशान तक सीमित हैं।

व्यावहारिक महत्व यह है कि एजेंट का कार्यभार अंतिम उत्तर तैयार करने की तुलना में संदर्भ को संसाधित करने या पुन: उपयोग करने में कहीं अधिक समय खर्च कर सकता है। फोर्ब्स ने केवल 444 आउटपुट टोकन के मुकाबले 142,000 टोकन के औसत एजेंटएक्स इनपुट की रिपोर्ट दी है, जो कई पारंपरिक बेंचमार्क के विपरीत एक पैटर्न है। यदि समान ट्रैफ़िक उत्पादन में आम है, तो कैश्ड संदर्भ और रूट फॉलो-अप को कुशलतापूर्वक पुन: उपयोग करने की क्षमता कोडिंग एजेंटों, अनुसंधान सहायकों और अन्य टूल-उपयोग प्रणालियों की लागत और प्रतिक्रिया को प्रभावित कर सकती है। आपूर्ति किया गया स्रोत यह स्थापित नहीं करता है कि निशान व्यापक बाज़ार के कितने प्रतिनिधि हैं।

फोर्ब्स Nvidia के कथित लाभ का श्रेय सॉफ्टवेयर स्तर को देता है। लेख Nvidia के TensorRT-LLM स्टैक में कैश प्रबंधन, रूटिंग, शेड्यूलिंग, विशेष कर्नेल और सीमा-जागरूक वृद्धिशील टोकननाइजेशन का वर्णन करता है। फोर्ब्स का कहना है कि वृद्धिशील टोकननाइजेशन एक Qwen 3.5 ट्रेस में 1,087 परीक्षण किए गए ट्रांजिशन में पूर्ण-टोकनाइजेशन परिणामों से मेल खाता है, जबकि औसत प्रसंस्करण समय प्रति मोड़ 185.1 मिलीसेकंड से घटाकर 11.3 मिलीसेकंड कर दिया गया है। यदि सटीक है, तो ऐसे सुधार बार-बार काम को कम करके पुराने या अन्यथा तुलनीय त्वरक को अधिक प्रतिस्पर्धी बना सकते हैं। उनका यह भी मतलब है कि सॉफ़्टवेयर में बदलाव होने पर बेंचमार्क रैंकिंग तेज़ी से बदल सकती है।

रिपोर्ट प्रतिस्पर्धा के लिए मायने रखती है क्योंकि यह इस धारणा को चुनौती देती है कि दूसरा त्वरक आपूर्तिकर्ता अकेले हार्डवेयर मूल्य निर्धारण के माध्यम से Nvidia की स्थिति को स्वचालित रूप से कम कर देगा। फोर्ब्स का कहना है कि AMD का ATOM इंजन एक Kimi K3 विलंबता वक्र के हिस्से में vLLM पर चलने वाले GB300 NVL72 सिस्टम को मात देता है, और AMD का MI355X DeepSeek V4 पर SGLang के साथ B200 से मेल खाता है, इससे पहले बाद में Nvidia और Inferact अनुकूलन को अपस्ट्रीम में विलय कर दिया गया था। यह उलटफेर एएमडी की क्षमता और सॉफ्टवेयर अपनाने के महत्व दोनों को दर्शाता है। फोर्ब्स यह भी रिपोर्ट करता है कि ATOM का उत्पादन उपयोग सीमित है और AMD बैकएंड को कुछ vLLM संदर्भ-समानांतर पथों के लिए सूचीबद्ध नहीं किया गया था, लेकिन वे सॉफ़्टवेयर स्थितियाँ बदल सकती हैं।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

मुख्य अनुवर्ती यह है कि क्या AMD के ATOM अनुकूलन और लंबे-संदर्भ सेवा के लिए समर्थन को vLLM और SGLang जैसे मुख्यधारा के सॉफ़्टवेयर में अधिक व्यापक रूप से अपनाया जाता है। खरीदारों को उत्पादन उपसर्ग-कैश हिट दर, होस्ट-मेमोरी उपयोग, सत्र रूटिंग और टर्न-लेवल विलंबता की भी जांच करनी चाहिए। फोर्ब्स के अनुसार, सेमीएनालिसिस से एक महीने के भीतर बेंचमार्क अपडेट होने की उम्मीद है।

सबसे महत्वपूर्ण अनुवर्ती यह है कि सॉफ़्टवेयर अपडेट के बाद रिपोर्ट किया गया अंतर बना रहता है या नहीं। फोर्ब्स का कहना है कि सेमीएनालिसिस ने एक महीने के भीतर एक एजेंटएक्स अपडेट निर्धारित किया है, और लेख में कहा गया है कि 21 अगस्त को एक अपस्ट्रीम परिवर्तन ने DeepSeek V4 तुलना को बदल दिया। भविष्य के संस्करणों को यह दिखाना चाहिए कि क्या AMD की ATOM क्षमताएं आमतौर पर उपयोग किए जाने वाले सर्विंग स्टैक तक पहुंचती हैं, क्या vLLM और SGLang लंबे-संदर्भ समानता और ऑफलोड के लिए अधिक परिपक्व AMD समर्थन जोड़ते हैं, और क्या दोनों पक्षों पर तुलनीय अनुकूलन लागू होने के बाद भी Nvidia की बढ़त बनी रहती है।

बुनियादी ढांचे के खरीदारों को समग्र टोकन-प्रति-सेकंड आंकड़ों पर भरोसा करने के बजाय प्रदाताओं से कार्यभार-विशिष्ट साक्ष्य मांगना चाहिए। फोर्ब्स ने उत्पादन समवर्ती पर निरंतर उपसर्ग-कैश हिट दरों की जांच करने की सिफारिश की है, त्वरक मेमोरी को वापस करने के लिए उपयोग की जाने वाली होस्ट मेमोरी की मात्रा, और क्या सत्र रूटिंग अपने कैश्ड उपसर्ग को पकड़ने वाले कार्यकर्ता के साथ बातचीत रखती है। लेख में बताया गया है कि सेमीएनालिसिस ने अतिरिक्त होस्ट-मेमोरी पुन: उपयोग के साथ, विभिन्न समवर्ती स्तरों के तहत एक बी300 कॉन्फ़िगरेशन पर 91% और बी200 कॉन्फ़िगरेशन पर 73% की उच्च-बैंडविड्थ-मेमोरी हिट दर पाई। वे माप किसी सामान्य नियम को स्थापित करने के लिए सीधे तौर पर तुलनीय नहीं हैं, लेकिन वे दिखाते हैं कि कौन से परिचालन विवरण लागत और विलंबता को प्रभावित कर सकते हैं।

बेंचमार्क कई सामग्री अज्ञात भी छोड़ देता है। फोर्ब्स का कहना है कि एजेंटएक्स अज्ञात ट्रेस सामग्री को सिंथेटिक टोकन से बदल देता है, जो सट्टा-डिकोडिंग स्वीकृति को विकृत कर सकता है, और सेमीएनालिसिस ने इसे लाइव मापने के बजाय स्पीड-बेंच से ली गई स्वीकृति लंबाई का उपयोग किया। निशान भारी संदर्भ के साथ कोडिंग हार्नेस से आते हैं, जबकि एक पतला हार्नेस एक अलग इनपुट वितरण उत्पन्न करता है। एजेंटएक्स का बंद-लूप डिज़ाइन कार्यभार मिश्रण को भी बदल सकता है क्योंकि तेज़ सिस्टम अधिक अनुरोधों को पूरा करते हैं। Google TPU अनुपस्थित हैं, और बाद में Nvidia रुबिन हार्डवेयर और AMD का MI455X वर्णित तुलना से बाहर हैं। स्रोत में विक्रेता की प्रतिक्रियाएँ, स्वतंत्र प्रतिकृतियाँ और गैर-कोडिंग एजेंट कार्यभार पर परिणाम प्रदान नहीं किए गए हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याट्रांसफार्मरआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?