خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

فوربز کے مطابق Nvidia اے ایم ڈی کے نئے اے آئی ایجنٹ بینچ مارک میں 5 گنا تک آگے رہا ہے

فوربز رپورٹ کرتا ہے کہ سیمی اینالیسس کے ایجنٹ ایکس بینچ مارک نے پایا کہ Nvidia ہارڈویئر طویل سیاق و سباق، ملٹی ٹرن کوڈنگ ایجنٹ ورک لوڈز پر AMD کے مقابلے میں نمایاں طور پر زیادہ کم لاگت ہے، جبکہ خبردار کیا گیا کہ نتائج ماڈل، اسٹیک اور سافٹ ویئر ورژن کے لحاظ سے مختلف ہوتے ہیں۔

5 min readRead the original reporting
Source-provided image accompanying Forbes reports Nvidia led AMD by up to 5x on new AI-agent benchmark
منسوب رپورٹنگماخذ ریکارڈ شدہ
پبلشر
forbes.com
ماخذ لنک
forbes.comhttps://www.forbes.com/sites/janakirammsv/2026/08/24/nvidia-amd-ai-agent-benchmark/
ماخذ کی قسم
نیوز آؤٹ لیٹ کے ذریعہ رپورٹنگ - فریق اول کی دستاویز نہیں۔

جس کی ہم آزادانہ طور پر تصدیق نہیں کر سکے۔: یہ دعویٰ نامزد آؤٹ لیٹ سے منسوب ہے۔ ہم نے فریق اول کے دستاویز سے اس کی تصدیق نہیں کی۔ (forbes.com)

سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
بڑی زبان کا ماڈل (LLM)
متن کی تخلیق اور تجزیہ کرنے کے لیے بڑے پیمانے پر ٹیکسٹ کارپورا پر تربیت یافتہ زبان کا ماڈل۔
میموری (ایجنٹ میموری)
ذخیرہ شدہ سیاق و سباق ایک AI ایجنٹ تسلسل کو بہتر بنانے کے لیے تمام مراحل یا سیشنز میں استعمال کرتا ہے۔
اپنے آپ کو جانچیں۔اے آئی ایجنٹس کوئز

کیا ہوا؟

فوربس نے رپورٹ کیا ہے کہ SemiAnalysis نے AgentX شائع کیا، ایک اوپن سورس بینچ مارک جو مقررہ اشارے استعمال کرنے کے بجائے گمنام کوڈنگ ایجنٹ سیشنز کو دوبارہ چلاتا ہے۔ احاطہ کیے گئے کنفیگریشنز میں، SemiAnalysis نے پایا کہ Nvidia ہارڈ ویئر کو ایک مخصوص آپریٹنگ پوائنٹ پر AMD کے مقابلے میں پانچ گنا لاگت کا فائدہ ہے، جس میں کچھ کھلے سرونگ اسٹیکوں پر بڑے فرق موجود ہیں۔ فراہم کردہ ذریعہ آزادانہ طور پر بینچ مارک کی تصدیق نہیں کرتا ہے یا اس کے نتائج کو دوبارہ پیش نہیں کرتا ہے۔

فوربس نے رپورٹ کیا ہے کہ SemiAnalysis نے AgentX کو 24 اگست کو پیداواری طرز کے تخمینے کے لیے ٹریس ری پلے بینچ مارک کے طور پر شائع کیا۔ یکساں اشارے اور آؤٹ پٹ کی لمبائی بھیجنے کے بجائے، AgentX اصلی کوڈنگ ایجنٹ سیشنز کی ساخت کو دوبارہ چلاتا ہے، جس میں لمبی تاریخیں، متعدد موڑ اور توقف شامل ہیں جب کہ ایجنٹ ٹولز کا استعمال کرتا ہے۔ فوربس کا کہنا ہے کہ SemiAnalysis نے 8,000 سے زیادہ سیشنز اور 610 بلین ٹوکنز کا ایک کارپس بنایا جس میں اس کا اپنا عملہ شامل تھا۔ عوامی ورژن 1.0 سب سیٹ 393 Claude Code سیشنز پر مشتمل ہے اور اسے Apache 2.0 کے تحت جاری کیا گیا ہے۔ ماخذ ان اعداد و شمار کی آزادانہ تصدیق فراہم نہیں کرتا ہے۔

فوربس نے رپورٹ کیا ہے کہ عوامی نشانات کو 64 ٹوکنز کے سیشن اسکوپڈ چینڈ ہیش بلاکس میں تبدیل کیا جاتا ہے، اصل پرامپٹ اور کوڈ کو ہٹاتے ہوئے سابقہ ​​تعلقات کو محفوظ رکھتے ہیں۔ SemiAnalysis نے 142,000 ٹوکنز کی درمیانی ان پٹ کی لمبائی، 444 ٹوکنز کی ایک میڈین آؤٹ پٹ اور موڑ کے درمیان درمیانی 3.84-سیکنڈ کا فرق بتایا۔ فوربس کا یہ بھی کہنا ہے کہ 393 عوامی اجلاسوں میں سے 175 نے کم از کم ایک ذیلی ایجنٹ کو جنم دیا۔ ان خصوصیات کا مقصد یہ جانچنا ہے کہ آیا سرونگ سسٹم کلیدی قدر کیشے کی حالت کو موڑ پر برقرار رکھتا ہے اور اسے دوبارہ استعمال کرتا ہے، اس حالت کے حامل کارکن کے لیے ایک سیشن روٹ کرتا ہے اور بار بار سیاق و سباق کی غیر ضروری ری پروسیسنگ سے بچتا ہے۔

ایک اطلاع شدہ آپریٹنگ پوائنٹ پر، فوربس کا کہنا ہے کہ Nvidia ہارڈویئر کو سیم اینالیسس نے AMD کے مقابلے میں پانچ گنا زیادہ لاگت کے طور پر ماپا جب GLM 5.3 کو اوپن سورس SGLang سرونگ اسٹیک کے ذریعے 150 آؤٹ پٹ ٹوکن فی سیکنڈ فی صارف پر چلاتے ہیں۔ مضمون میں کہا گیا ہے کہ AMD کے MI355X کے ساتھ B200 کے مقابلے میں Nvidia فی صارف 108 ٹوکن فی سیکنڈ پر 57٪ اور فی صارف 141 ٹوکن فی سیکنڈ پر 247٪ کا فائدہ دکھایا گیا ہے۔ SGLang کے ذریعے Qwen 3.5 پر، Forbes رپورٹ کرتا ہے کہ Nvidia فی صارف 90 ٹوکن فی سیکنڈ پر 20 گنا سے زیادہ آگے تھا۔ یہ کنفیگریشن کے لیے مخصوص نتائج ہیں، نہ کہ یونیورسل ہارڈویئر ریشو۔

ماخذ کی تفصیلات: forbes.com ↗

یہ کیوں اہمیت رکھتا ہے۔

رپورٹ سے پتہ چلتا ہے کہ ایجنٹوں کے لیے AI-انفرنس کی کارکردگی بہت زیادہ انحصار کرتی ہے سافٹ ویئر، کیشے کے دوبارہ استعمال، روٹنگ اور طویل سیاق و سباق کی خدمت پر — نہ صرف ایکسلریٹر کی وضاحتیں۔ اس سے بنیادی ڈھانچے کی خریداری، کلاؤڈ پرائسنگ اور AMD اور Nvidia کی مسابقت متاثر ہو سکتی ہے۔ نتائج آزمائشی ہارڈ ویئر، ماڈلز، سافٹ ویئر ورژن اور کام کے بوجھ کے نشانات تک محدود ہیں۔

عملی اہمیت یہ ہے کہ ایجنٹ کے کام کا بوجھ حتمی جوابات پیدا کرنے سے کہیں زیادہ وقت پروسیسنگ یا سیاق و سباق کو دوبارہ استعمال کرنے میں صرف کر سکتا ہے۔ فوربس صرف 444 آؤٹ پٹ ٹوکنز کے مقابلے میں 142,000 ٹوکنز کے میڈین ایجنٹ ایکس ان پٹ کی رپورٹ کرتا ہے، جو بہت سے روایتی بینچ مارکس کے برعکس ایک نمونہ ہے۔ اگر پیداوار میں اسی طرح کی ٹریفک عام ہے تو، کیش شدہ سیاق و سباق کو دوبارہ استعمال کرنے اور روٹ فالو اپ موڑ کو مؤثر طریقے سے استعمال کرنے کی صلاحیت کوڈنگ ایجنٹوں، تحقیقی معاونین اور دوسرے ٹول استعمال کرنے والے نظاموں کی لاگت اور ردعمل کو متاثر کر سکتی ہے۔ فراہم کردہ ذریعہ اس بات کو قائم نہیں کرتا ہے کہ نشانات وسیع مارکیٹ کے کتنے نمائندہ ہیں۔

فوربس Nvidia کے زیادہ تر رپورٹ شدہ فائدہ کو سافٹ ویئر کی تہہ سے منسوب کرتا ہے۔ مضمون Nvidia کے TensorRT-LLM اسٹیک میں کیش مینجمنٹ، روٹنگ، شیڈولنگ، خصوصی کرنل اور باؤنڈری سے آگاہ انکریمنٹل ٹوکنائزیشن کی وضاحت کرتا ہے۔ فوربس کا کہنا ہے کہ اضافی ٹوکنائزیشن نے ایک Qwen 3.5 ٹریس میں 1,087 ٹیسٹ شدہ ٹرانزیشنز میں مکمل ٹوکنائزیشن کے نتائج سے مماثل ہے جبکہ اوسط پروسیسنگ ٹائم فی موڑ کو 185.1 ملی سیکنڈ سے کم کر کے 11.3 ملی سیکنڈز کر دیا ہے۔ اگر درست ہے تو، اس طرح کی بہتری بار بار کام کو کم کرکے ایک پرانے یا دوسری صورت میں موازنہ کرنے والے ایکسلریٹر کو زیادہ مسابقتی بنا سکتی ہے۔ ان کا مطلب یہ بھی ہے کہ سافٹ ویئر کی تبدیلیوں کو پیش کرتے وقت بینچ مارک کی درجہ بندی تیزی سے بدل سکتی ہے۔

رپورٹ مقابلے کے لیے اہمیت رکھتی ہے کیونکہ یہ اس مفروضے کو چیلنج کرتی ہے کہ دوسرا ایکسلریٹر فراہم کنندہ صرف ہارڈ ویئر کی قیمتوں کے ذریعے Nvidia کی پوزیشن کو خود بخود تنگ کر دے گا۔ فوربس کا کہنا ہے کہ AMD کے ATOM انجن نے Kimi K3 لیٹنسی وکر کے ایک حصے میں vLLM چلانے والے GB300 NVL72 سسٹم کو شکست دی، اور یہ کہ AMD کا MI355X B200 کو DeepSeek V4 کے ساتھ SGLang کے ساتھ ملایا گیا اور بعد میں ZXQIU00QXZ 1 سے پہلے ZXQIU0QXZ کو تبدیل کیا گیا۔ اپ اسٹریم یہ الٹ AMD کی صلاحیت اور سافٹ ویئر کو اپنانے کی اہمیت دونوں کو واضح کرتا ہے۔ فوربس یہ بھی رپورٹ کرتا ہے کہ ATOM کا پیداواری استعمال محدود ہے اور یہ کہ AMD بیک اینڈز کچھ vLLM سیاق و سباق کے متوازی راستوں کے لیے درج نہیں تھے، لیکن وہ سافٹ ویئر کی حالتیں بدل سکتی ہیں۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
انٹرایکٹو تصور چیک+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

آگے کیا دیکھنا ہے۔

اہم فالو اپ یہ ہے کہ آیا AMD کی ATOM کی اصلاح اور طویل سیاق و سباق کی خدمت کے لیے تعاون کو مرکزی دھارے کے سافٹ ویئر جیسے vLLM اور SGLang میں زیادہ وسیع پیمانے پر اپنایا گیا ہے۔ خریداروں کو پروڈکشن پریفکس-کیش ہٹ ریٹ، میزبان میموری استعمال، سیشن روٹنگ اور ٹرن لیول لیٹینسی کا بھی جائزہ لینا چاہیے۔ فوربس کے مطابق، ایک ماہ کے اندر بینچ مارک کو اپ ڈیٹ کرنے کے لیے SemiAnalysis متوقع ہے۔

سب سے اہم فالو اپ یہ ہے کہ آیا سافٹ ویئر اپ ڈیٹس کے بعد رپورٹ کردہ فرق برقرار رہتا ہے۔ فوربس کا کہنا ہے کہ SemiAnalysis نے AgentX اپ ڈیٹ کو ایک مہینے کے اندر طے کیا، اور آرٹیکل نوٹ کرتا ہے کہ 21 اگست کو ایک upstream تبدیلی نے DeepSeek V4 موازنہ کو تبدیل کر دیا۔ مستقبل کے ورژنز کو یہ دکھانا چاہیے کہ آیا AMD کی ATOM کی صلاحیتیں عام طور پر استعمال ہونے والے سرونگ اسٹیک تک پہنچتی ہیں، آیا vLLM اور SGLang طویل سیاق و سباق کے متوازی اور آف لوڈ کے لیے زیادہ پختہ AMD سپورٹ کا اضافہ کرتے ہیں، اور آیا Nvidia کی برتری دونوں اطراف پر تقابلی اصلاح کے لاگو ہونے کے بعد باقی رہتی ہے۔

بنیادی ڈھانچے کے خریداروں کو فراہم کنندگان سے کام کے بوجھ سے متعلق ثبوت طلب کرنا چاہیے بجائے اس کے کہ مجموعی ٹوکن فی سیکنڈ کے اعداد و شمار پر انحصار کریں۔ فوربس تجویز کرتا ہے کہ پروڈکشن کنکرنسی پر مستقل پریفکس-کیش ہٹ ریٹ، ایکسلریٹر میموری کو بیک کرنے کے لیے استعمال ہونے والی ہوسٹ میموری کی مقدار، اور آیا سیشن روٹنگ اس کے کیشڈ سابقہ ​​والے کارکن کے ساتھ بات چیت کو برقرار رکھتی ہے۔ مضمون رپورٹ کرتا ہے کہ SemiAnalysis نے ایک B300 کنفیگریشن پر 91% کی ہائی بینڈوڈتھ-میموری ہٹ ریٹ اور B200 کنفیگریشن پر مختلف کنکرنسی لیولز پر 73% پائے، اضافی ہوسٹ میموری کے دوبارہ استعمال کے ساتھ۔ یہ پیمائشیں عام اصول قائم کرنے کے لیے براہ راست موازنہ نہیں ہیں، لیکن یہ ظاہر کرتی ہیں کہ کون سی آپریشنل تفصیلات لاگت اور تاخیر کو متاثر کر سکتی ہیں۔

بینچ مارک کئی مواد کو نامعلوم بھی چھوڑ دیتا ہے۔ فوربس کا کہنا ہے کہ AgentX گمنام ٹریس مواد کو مصنوعی ٹوکنز سے بدل دیتا ہے، جو قیاس آرائی پر مبنی ضابطہ کشائی کی قبولیت کو بگاڑ سکتا ہے، اور یہ کہ SemiAnalysis نے اس کی براہ راست پیمائش کرنے کے بجائے SPEED-Bench سے لی گئی قبولیت کی لمبائی کا استعمال کیا۔ نشانات بھاری سیاق و سباق کے ساتھ کوڈنگ ہارنیس سے آتے ہیں، جب کہ ایک دبلی پتلی ان پٹ کی تقسیم مختلف ہوتی ہے۔ AgentX کا بند لوپ ڈیزائن کام کے بوجھ کے مکس کو بھی تبدیل کر سکتا ہے کیونکہ تیز ترین سسٹم مزید درخواستیں مکمل کرتے ہیں۔ Google TPUs غائب ہیں، اور بعد میں Nvidia روبن ہارڈ ویئر اور AMD کا MI455X بیان کردہ موازنہ سے باہر ہیں۔ بیچنے والے کے جوابات، آزاد نقلیں اور نان کوڈنگ ایجنٹ ورک بوجھ کے نتائج ماخذ میں فراہم نہیں کیے گئے ہیں۔

متعلقہ گائیڈز اور کوئزز

اے آئی ایجنٹسAI ماڈلز کی وضاحتٹرانسفارمرزآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ماڈل ریلیز ٹریکر پر عمل کریں۔
یہ مفید پایا؟