Wat is er gebeurd
NVIDIA beschrijft een reeks JAX- en Transformer Engine-optimalisaties voor dropless mix-of-experts-training, waaronder gegroepeerde GEMM, gefuseerde expert-parallelle dispatch- en combine-operaties, NCCL EP, XLA multistream-collectieven, MXFP8 gegroepeerde kwantisering en offloading van hostactivatie. Het bedrijf zegt dat een niet-geoptimaliseerde DeepSeek-V3-trainingsbasislijn 103 TFLOPS per GPU bereikte, vergeleken met 1.068 TFLOPS per GPU na optimalisatie, en dat de end-to-end doorvoer met ongeveer 10x verbeterde. NVIDIA rapporteert ook een schaalefficiëntie van 97% bij 1.024 GPU's. De geoptimaliseerde componenten zijn opgenomen in de NVIDIA NGC MaxText-container, met instructies voor het testen en reproduceren van de configuratie.
De post van NVIDIA richt zich op een druppelloze mix van experts-training, waarbij elk token wordt verwerkt door de geselecteerde expert, zelfs wanneer routing ongelijke expertbelastingen veroorzaakt. In tegenstelling tot op capaciteit gebaseerde benaderingen waarbij overflow- of pad-experts tot vaste maten worden teruggebracht, vereist dropless training kernels en communicatiepaden om variabele tokenaantallen te verwerken. NVIDIA zegt dat deze onregelmatige vormen onregelmatige tensoren produceren en GPU's kunnen laten wachten op verzending, algemene communicatie en deskundige berekeningen.
De gerapporteerde veranderingen vinden plaats op verschillende lagen. De gegroepeerde GEMM van Transformer Engine verwerkt expertgroepen van variabele lengte in één kerneloproep, terwijl bewerkingen worden gefuseerd en gecombineerd en de NCCL EP-backend-adresverplaatsing van tokens tussen GPU's. NVIDIA noemt ook XLA multistream-collectieven, hostactivatie-offloading en MXFP8-gegroepeerde kwantisering als bijdragers aan het resultaat.
Het bedrijf meldt dat de DeepSeek-V3 671B-configuratie de basislijn verhoogde van 103 naar 1.068 TFLOPS per GPU en een end-to-end doorvoerwinst van ongeveer 10x opleverde. Het rapporteert ook een efficiëntie van 97% bij 1.024 GPU's. Deze cijfers worden door NVIDIA gepresenteerd als observaties uit de geoptimaliseerde stapel, niet als onafhankelijk geverifieerde resultaten.
De implementatie is beschikbaar om te proberen via de NVIDIA NGC MaxText-container met ingebouwde Transformer Engine. Het bericht specificeert ghcr.io/nvidia/jax:maxtext-2026-09-09 of nieuwer en biedt configuratierichtlijnen voor DeepSeek-V3. Het waarschuwt dat verschillende modellen verschillende afstemming vereisen. Er worden geen prijs- en licentiegegevens verstrekt.
Brongegevens: developer.nvidia.com ↗
Waarom het ertoe doet
Grote mix-van-expertmodellen verminderen het rekenwerk door alleen geselecteerde expertnetwerken te activeren, maar hun ongelijke tokenroutering creëert moeilijke communicatie- en geheugenknelpunten. Als de resultaten van NVIDIA verder gaan dan de gerapporteerde configuratie, kunnen de veranderingen het trainen van zeer grote MoE-systemen efficiënter maken zonder gerouteerde tokens te laten vallen of elke expert op te vullen naar een vaste capaciteit. Dat is vooral van belang voor organisaties die grote NVIDIA GPU-clusters gebruiken, waar communicatieoverhead en verspilde rekenkracht de trainingstijd en -kosten aanzienlijk kunnen beïnvloeden. De resultaten zijn de eigen beweringen van NVIDIA; de bron biedt geen onafhankelijke benchmarking of vergelijking met elke alternatieve implementatie.
MoE-training wordt steeds belangrijker voor grote AI-modellen, omdat voorwaardelijke berekeningen de actieve berekening per token kunnen verminderen, terwijl veel parameters behouden blijven. De technische moeilijkheid verschuift naar routering, onregelmatige matrixbewerkingen, geheugengebruik en interconnect-verkeer. Het verbeteren van deze onderdelen zou de tijd en hardware kunnen verminderen die nodig is om modellen op productieschaal te trainen.
Het praktische publiek is gespecialiseerd: onderzoekers en bedrijven die al JAX, MaxText, NVIDIA GPU's en multi-GPU- of multi-node-infrastructuur gebruiken. De bron stelt niet vast dat dezelfde winst geldt voor kleinere systemen, niet-NVIDIA-hardware, compacte modellen of werkbelastingen buiten de gerapporteerde DeepSeek-V3-configuratie.
De cijfers van NVIDIA moeten worden behandeld als door de leverancier gerapporteerde prestatieclaims. De bron levert geen onafhankelijke tests, gedetailleerde kostenanalyses of volledige methodologie die voldoende is om te bepalen hoeveel van de verbetering voortkomt uit elke optimalisatie.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
De belangrijkste vraag is of de gerapporteerde winst zich herhaalt in verschillende MoE-architecturen, clusterindelingen, modelgroottes en GPU-generaties. NVIDIA is van plan om NVFP4 toe te voegen, kwantisering gecombineerd met GEMM en extra alles-tot-alles overlap. Gebruikers moeten ook kijken of deze functies standaard worden in JAX- en MaxText-workflows, en of de optimalisaties substantiële modelspecifieke afstemming vereisen. De bron documenteert een op containers gebaseerd toegangspad, maar vermeldt geen prijzen, licentievoorwaarden, ondersteuningsverplichtingen of algemene beschikbaarheid buiten de genoemde NGC-container.
Reproductie over andere MoE-modellen en hardwareconfiguraties zal aangeven of de gerapporteerde winsten breed overdraagbaar zijn of nauw gekoppeld zijn aan de clusterconfiguratie van DeepSeek-V3 en NVIDIA.
NVIDIA zegt dat toekomstig werk NVFP4, gefuseerde kwantisering met GEMM en extra totale overlap zal toevoegen. Deze toevoegingen kunnen de prestatie- en geheugenafwegingen van de stapel verder beïnvloeden.
De bron raadt aan om de staptijd, TFLOPS per GPU, het FLOP-gebruik van het model, de gegroepeerde GEMM-latentie en de verzending/combinatie-latentie bij te houden. Deze metingen zullen helpen rekenwinsten te scheiden van communicatieverbeteringen.
De post vermeldt niet de prijs van de container, de licentievoorwaarden, het ondersteuningsniveau of dat alle genoemde componenten even volwassen zijn voor productiegebruik.