Hva skjedde
Forbes rapporterer at SemiAnalysis publiserte AgentX, en åpen kildekode- som spiller av anonymiserte kodingsagent-økter i stedet for å bruke faste ledetekster. I konfigurasjonene som dekkes, fant SemiAnalysis at Nvidia-maskinvare hadde opptil en femdobbel kostnadseffektivitetsfordel i forhold til AMD på et spesifisert driftspunkt, med større hull på noen åpne serveringsstabler. Den medfølgende kilden bekrefter ikke uavhengig referanseindeksen eller gjengir resultatene.
Forbes rapporterer at SemiAnalysis publiserte AgentX 24. august som en sporing-replay- for produksjonsmessig slutning. I stedet for å sende ensartede meldinger og utdatalengder, spiller AgentX opp strukturen til ekte koding-agent-sesjoner, inkludert lange historier, flere svinger og pauser mens en agent bruker verktøy. Forbes sier SemiAnalysis bygde et korpus på mer enn 8000 økter og 610 milliarder tokens fra avlyttede Claude Code- og Codex-forespørsler som involverer sine egne ansatte. Det offentlige versjon 1.0-undersettet inneholder 393 Claude Code-sesjoner og er utgitt under Apache 2.0. Kilden gir ikke uavhengig bekreftelse av disse tallene.
Forbes rapporterer at de offentlige sporene blir konvertert til kjedede hash-blokker med øktomfang på 64 tokens, og bevarer prefiksrelasjoner samtidig som originale meldinger og kode fjernes. SemiAnalysis rapporterte en median inngangslengde på 142 000 tokens, en median output på 444 tokens og en median 3,84 sekunders gap mellom svingene. Forbes sier også at 175 av de 393 offentlige sesjonene ga minst én subagent. Disse egenskapene har til hensikt å teste om serveringssystemer beholder og gjenbruker nøkkelverdibuffertilstand på tvers av svinger, rute en økt til arbeideren som har denne tilstanden og unngå unødvendig reprosessering av gjentatt kontekst.
På et rapportert driftspunkt sier Forbes at SemiAnalysis målte Nvidia-maskinvare som opptil fem ganger mer kostnadseffektiv enn AMD når man kjører GLM 5.3 gjennom åpen kildekode SGLang-serveringsstakken med 150 utdata-tokens per sekund per bruker. Artikkelen sier at en B200-sammenligning med AMDs MI355X viste en Nvidia-fordel på omtrent 57 % ved 108 tokens per sekund per bruker og 247 % ved 141 tokens per sekund per bruker. På Qwen 3.5 gjennom SGLang rapporterer Forbes at Nvidia var mer enn 20 ganger foran med 90 tokens per sekund per bruker. Dette er konfigurasjonsspesifikke resultater, ikke et universelt maskinvareforhold.
Hvorfor det betyr noe
Rapporten antyder at AI-inferensytelse for agenter avhenger sterkt av programvare, gjenbruk av cache, ruting og langkontekstservering – ikke bare akseleratorspesifikasjoner. Det kan påvirke innkjøp av infrastruktur, skyprising og konkurranseevnen til AMD og Nvidia. Funnene er begrenset til testet maskinvare, modeller, programvareversjoner og arbeidsbelastningsspor.
Den praktiske betydningen er at agentarbeidsmengder kan bruke mye mer tid på å behandle eller gjenbruke kontekst enn å generere endelige svar. Forbes rapporterer en median AgentX-inngang på 142 000 tokens mot bare 444 output-tokens, et mønster i motsetning til mange konvensjonelle benchmarks. Hvis lignende trafikk er vanlig i produksjonen, kan muligheten til å gjenbruke bufret kontekst og rute oppfølgingssvinger effektivt påvirke kostnadene og responsen til kodeagenter, forskningsassistenter og andre verktøybrukende systemer. Den oppgitte kilden fastslår ikke hvor representative sporene er for det bredere markedet.
Forbes tilskriver mye av Nvidias rapporterte fordel til programvarelaget. Artikkelen beskriver cacheadministrasjon, ruting, planlegging, spesialiserte kjerner og grensebevisst inkrementell tokenisering i Nvidias TensorRT-LLM-stack. Forbes sier at inkrementell tokenisering matchet full-tokeniseringsresultater på tvers av 1087 testede overganger i ett Qwen 3.5-spor, samtidig som det reduserer gjennomsnittlig behandlingstid per tur fra 185,1 millisekunder til 11,3 millisekunder. Hvis de er nøyaktige, kan slike forbedringer gjøre en eldre eller på annen måte sammenlignbar akselerator mer konkurransedyktig ved å redusere gjentatt arbeid. De betyr også at -rangeringer kan endres raskt når programvareendringer vises.
Rapporten er viktig for konkurransen fordi den utfordrer antakelsen om at en annen akseleratorleverandør automatisk vil begrense Nvidias posisjon gjennom maskinvareprising alene. Forbes sier at AMDs ATOM-motor slo et GB300 NVL72-system som kjører vLLM over deler av en Kimi K3-latenskurve, og at AMDs MI355X matchet B200 på DeepSeek V4 med SGLang før senere Nvidia- og Inferact-optimaliseringer ble slått sammen oppstrøms. Denne reverseringen illustrerer både AMDs potensial og viktigheten av programvareadopsjon. Forbes rapporterer også at ATOM har begrenset produksjonsbruk og at AMD-backends ikke var oppført for noen vLLM kontekstparallelle baner, men disse programvarebetingelsene kan endres.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Hva du skal se neste
Nøkkeloppfølgingen er om AMDs ATOM-optimaliseringer og støtte for langkontekstservering er tatt i bruk bredere i vanlig programvare som vLLM og SGLang. Kjøpere bør også undersøke produksjonsprefiks-cache-trefffrekvenser, bruk av vertsminne, øktruting og latens på turn-level. SemiAnalysis forventes, ifølge Forbes, å oppdatere innen en måned.
Den viktigste oppfølgingen er om det rapporterte gapet vedvarer etter programvareoppdateringer. Forbes sier SemiAnalysis planla en AgentX-oppdatering innen en måned, og artikkelen bemerker at en oppstrømsendring 21. august endret DeepSeek V4-sammenligningen. Fremtidige versjoner bør vise om AMDs ATOM-funksjoner når ofte brukte serveringsstabler, om vLLM og SGLang legger til mer moden AMD-støtte for langkontekstparallellisme og avlastning, og om Nvidias ledelse forblir etter at sammenlignbare optimaliseringer er brukt på begge sider.
Infrastrukturkjøpere bør be leverandører om arbeidsbelastningsspesifikke bevis i stedet for å stole på samlede tokens-per-sekund-tall. Forbes anbefaler å undersøke vedvarende prefiks-cache-trefffrekvenser ved samtidig produksjon, mengden vertsminne som brukes til å sikkerhetskopiere akseleratorminne, og om øktruting holder en samtale med arbeideren som holder sitt bufrede prefiks. Artikkelen rapporterer at SemiAnalysis fant treffrater med høy båndbredde på 91 % på én B300-konfigurasjon og 73 % på en B200-konfigurasjon under forskjellige samtidighetsnivåer, med ytterligere gjenbruk av vertsminne. Disse målingene er ikke direkte sammenlignbare nok til å etablere en generell regel, men de viser hvilke operasjonelle detaljer som kan påvirke kostnader og ventetid.
Referanseindeksen etterlater også flere vesentlige ukjente. Forbes sier at AgentX erstatter anonymisert sporinnhold med syntetiske tokens, som kan forvrenge aksept for spekulativ dekoding, og at SemiAnalysis brukte en akseptlengde hentet fra SPEED-Bench i stedet for å måle den live. Sporene kommer fra kodeseler med tung kontekst, mens en slankere sele gir en annen inputfordeling. AgentXs lukkede sløyfedesign kan også endre arbeidsmengdeblandingen ettersom raskere systemer fullfører flere forespørsler. Google TPU-er er fraværende, og senere Nvidia Rubin-maskinvare og AMDs MI455X er utenfor den beskrevne sammenligningen. Leverandørsvar, uavhengige replikasjoner og resultater på ikke-kodende agentarbeidsbelastninger er ikke oppgitt i kilden.