Tillbaka till Nyheter
InnovationAI Understanding genomgång

Forbes rapporterar att Nvidia lett AMD med upp till 5 gånger i den nya AI-agent-benchmarken

Forbes rapporterar att SemiAnalyses AgentX-benchmark fann Nvidia hårdvara avsevärt mer kostnadseffektiv än AMD på långkontext, fler-turs kodagent-arbetsbelastningar, samtidigt som man varnar för att resultaten varierar beroende på modell, stack och mjukvaruversion.

5 min readRead the original reporting
Source-provided image accompanying Forbes reports Nvidia led AMD by up to 5x on new AI-agent benchmark
Tillskriven rapporteringKälla inspelad
Förläggare
forbes.com
Källlänk
forbes.comhttps://www.forbes.com/sites/janakirammsv/2026/08/24/nvidia-amd-ai-agent-benchmark/
Källtyp
Rapportering från ett nyhetsställe – inte ett förstapartsdokument.

Vad vi inte kunde bekräfta oberoende: Detta påstående hänförs till det namngivna försäljningsstället. Vi har inte verifierat det mot ett förstapartsdokument. (forbes.com)

SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Referenspunkt
Ett standardiserat test eller datauppsättning som används för att mäta och jämföra modellprestanda.
Stor språkmodell (LLM)
En språkmodell tränad på massiva textkorpus för att generera och analysera text.
Minne (agentminne)
Lagrat sammanhang som en AI-agent använder över steg eller sessioner för att förbättra kontinuiteten.
Testa dig självAI Agents Quiz

Vad hände

Forbes rapporterar att SemiAnalysis publicerade AgentX, ett med öppen källkod som spelar upp anonymiserade kodningsagentsessioner istället för att använda fasta uppmaningar. I de täckta konfigurationerna fann SemiAnalysis att Nvidia-hårdvaran hade upp till en femfaldig kostnadseffektivitetsfördel jämfört med AMD vid en specificerad driftpunkt, med större luckor på vissa öppna serveringsstackar. Den medföljande källan bekräftar inte självständigt riktmärket eller återger dess resultat.

Forbes rapporterar att SemiAnalysis publicerade AgentX den 24 augusti som ett spår-replay-riktmärke för produktionsliknande slutledning. Istället för att skicka enhetliga uppmaningar och utdatalängder, spelar AgentX upp strukturen för riktiga kodningsagentsessioner, inklusive långa historiker, flera vändningar och pauser medan en agent använder verktyg. Forbes säger att SemiAnalysis byggde upp en korpus med mer än 8 000 sessioner och 610 miljarder tokens från avlyssnade Claude Code- och Codex-förfrågningar som involverade sin egen personal. Den offentliga versionen 1.0-delmängden innehåller 393 Claude Code-sessioner och släpps under Apache 2.0. Källan ger ingen oberoende verifiering av dessa siffror.

Forbes rapporterar att de offentliga spåren omvandlas till sessionsomfattade kedjade hash-block med 64 tokens, vilket bevarar prefixrelationer samtidigt som ursprungliga uppmaningar och kod tas bort. SemiAnalysis rapporterade en medianinmatningslängd på 142 000 tokens, en medianutgång på 444 tokens och ett medianavstånd på 3,84 sekunder mellan varven. Forbes säger också att 175 av de 393 offentliga sessionerna skapade minst en subagent. Dessa egenskaper är avsedda att testa huruvida serversystem behåller och återanvänder nyckel-värdescachetillstånd över svängar, dirigera en session till arbetaren som håller det tillståndet och undvika onödig ombearbetning av upprepade kontexter.

Vid en rapporterad driftpunkt säger Forbes att SemiAnalysis mätte Nvidia-hårdvara som upp till fem gånger mer kostnadseffektiv än AMD när man körde GLM 5.3 genom SGLang-serverstacken med öppen källkod med 150 utdatatokens per sekund per användare. Artikeln säger att en B200-jämförelse med AMD:s MI355X visade en Nvidia-fördel på cirka 57% vid 108 tokens per sekund per användare och 247% vid 141 tokens per sekund per användare. På Qwen 3.5 genom SGLang rapporterar Forbes att Nvidia var mer än 20 gånger före med 90 tokens per sekund och användare. Dessa är konfigurationsspecifika resultat, inte ett universellt hårdvaruförhållande.

Källinformation: forbes.com ↗

Varför det spelar roll

Rapporten antyder att AI-inferensprestanda för agenter är starkt beroende av programvara, cacheåteranvändning, routing och långkontextservering – inte bara acceleratorspecifikationer. Det kan påverka inköp av infrastruktur, molnprissättning och konkurrenskraften för AMD och Nvidia. Resultaten är begränsade till den testade hårdvaran, modellerna, mjukvaruversionerna och arbetsbelastningsspår.

Den praktiska betydelsen är att agentarbetsbelastningar kan lägga mycket mer tid på att bearbeta eller återanvända sammanhang än att generera slutliga svar. Forbes rapporterar en median AgentX-inmatning på 142 000 tokens mot endast 444 output-tokens, ett mönster till skillnad från många konventionella riktmärken. Om liknande trafik är vanlig i produktionen, kan möjligheten att återanvända cachad kontext och rutta uppföljningssvängar effektivt påverka kostnaden och lyhördheten för kodningsagenter, forskningsassistenter och andra verktygsanvändande system. Den angivna källan visar inte hur representativa spåren är för den bredare marknaden.

Forbes tillskriver mycket av Nvidia:s rapporterade fördel till mjukvaruskiktet. Artikeln beskriver cachehantering, routing, schemaläggning, specialiserade kärnor och gränsmedveten inkrementell tokenisering i Nvidia:s TensorRT-LLM-stack. Forbes säger att inkrementell tokenisering matchade full-tokeniseringsresultat över 1 087 testade övergångar i ett Qwen 3.5-spår samtidigt som den genomsnittliga bearbetningstiden per varv minskade från 185,1 millisekunder till 11,3 millisekunder. Om de är korrekta kan sådana förbättringar göra en äldre eller på annat sätt jämförbar accelerator mer konkurrenskraftig genom att minska upprepat arbete. De betyder också att -rankningar kan ändras snabbt när programvaruförändringar visas.

Rapporten är viktig för konkurrensen eftersom den utmanar antagandet att en andra acceleratorleverantör automatiskt kommer att begränsa Nvidia:s position genom enbart hårdvaruprissättning. Forbes säger att AMD:s ATOM-motor slog ett GB300 NVL72-system som kör vLLM över en del av en Kimi K3-latenskurva, och att AMD:s MI355X matchade B200 på DeepSeek V4 med SGLang innan senare ZXQAIU1QX optimerades uppströms och inverterades. Den vändningen illustrerar både AMD:s potential och vikten av att använda programvara. Forbes rapporterar också att ATOM har begränsad produktionsanvändning och att AMD-backends inte var listade för vissa vLLM kontextparallella vägar, men dessa programvaruvillkor kan ändras.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konceptkontroll+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Vad du ska titta på härnäst

Nyckeluppföljningen är huruvida AMD:s ATOM-optimeringar och stöd för långkontextservering antas mer brett i vanliga mjukvaror som vLLM och SGLang. Köpare bör också undersöka produktionsprefix-cache-träfffrekvenser, värdminnesanvändning, sessionsrouting och turn-level latens. SemiAnalysis förväntas, enligt Forbes, uppdatera riktmärket inom en månad.

Den viktigaste uppföljningen är om det rapporterade gapet kvarstår efter mjukvaruuppdateringar. Forbes säger att SemiAnalysis planerade en AgentX-uppdatering inom en månad, och artikeln noterar att en uppströmsändring den 21 augusti förändrade DeepSeek V4-jämförelsen. Framtida versioner bör visa om AMD:s ATOM-kapacitet når vanliga serveringsstackar, om vLLM och SGLang lägger till mer moget AMD-stöd för parallellitet och avlastning i långa sammanhang, och om Nvidia:s ledning kvarstår efter att jämförbara optimeringar har tillämpats på båda sidor.

Infrastrukturköpare bör be leverantörer om arbetsbelastningsspecifika bevis snarare än att förlita sig på sammanlagda tokens-per-sekund-siffror. Forbes rekommenderar att man undersöker fördröjda prefix-cache-träffhastigheter vid samtidig produktion, mängden värdminne som används för att backa acceleratorminne och om sessionsrouting håller en konversation med arbetaren som håller sitt cachade prefix. Artikeln rapporterar att SemiAnalysis hittade träfffrekvenser med hög bandbredd på 91 % på en B300-konfiguration och 73 % på en B200-konfiguration under olika samtidighetsnivåer, med ytterligare återanvändning av värdminne. Dessa mätningar är inte tillräckligt direkt jämförbara för att fastställa en generell regel, men de visar vilka driftsdetaljer som kan påverka kostnad och latens.

Riktmärket lämnar också flera väsentliga okända. Forbes säger att AgentX ersätter anonymiserat spårinnehåll med syntetiska tokens, vilket kan förvränga acceptansen för spekulativ avkodning, och att SemiAnalysis använde en acceptanslängd hämtad från SPEED-Bench istället för att mäta den live. Spåren kommer från kodningsselar med tungt sammanhang, medan en smalare sele ger en annan ingångsfördelning. AgentX:s slutna kretsdesign kan också ändra arbetsbelastningsmixen eftersom snabbare system fullföljer fler förfrågningar. Google TPU:er saknas, och senare Nvidia Rubin-hårdvara och AMD:s MI455X är utanför den beskrivna jämförelsen. Leverantörssvar, oberoende replikeringar och resultat på icke-kodande agentarbetsbelastningar tillhandahålls inte i källan.

Relaterade guider och frågesporter

AI-agenterAI-modeller förklarasTransformatorerTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?