Terug naar Nieuws
InnovatieAI Understanding-briefing

NVIDIA rapporteert 10x snellere dropless MoE-training in JAX

NVIDIA zegt dat de Transformer Engine- en JAX-optimalisaties de trainingsdoorvoer van de DeepSeek-V3 671B met ongeveer 10x hebben verhoogd en een efficiëntie van 97% hebben bereikt over 1.024 GPU's. Het geoptimaliseerde pad is opgenomen in een NVIDIA NGC MaxText-container van 9 september 2026 of later.

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
Primair brondocumentBron opgenomen
Uitgever
developer.nvidia.com
Bronlink
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Mengsel van deskundigen (MoE)
Een architectuur met gespecialiseerde subnetwerken waarbij per input alleen geselecteerde experts draaien.
Geheugen (agentgeheugen)
Opgeslagen context die een AI-agent in stappen of sessies gebruikt om de continuïteit te verbeteren.
Kwantisering
Modelgewichten converteren naar formaten met een lagere precisie, zoals 8-bit of 4-bit.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

NVIDIA beschrijft een reeks JAX- en Transformer Engine-optimalisaties voor dropless mix-of-experts-training, waaronder gegroepeerde GEMM, gefuseerde expert-parallelle dispatch- en combine-operaties, NCCL EP, XLA multistream-collectieven, MXFP8 gegroepeerde kwantisering en offloading van hostactivatie. Het bedrijf zegt dat een niet-geoptimaliseerde DeepSeek-V3-trainingsbasislijn 103 TFLOPS per GPU bereikte, vergeleken met 1.068 TFLOPS per GPU na optimalisatie, en dat de end-to-end doorvoer met ongeveer 10x verbeterde. NVIDIA rapporteert ook een schaalefficiëntie van 97% bij 1.024 GPU's. De geoptimaliseerde componenten zijn opgenomen in de NVIDIA NGC MaxText-container, met instructies voor het testen en reproduceren van de configuratie.

De post van NVIDIA richt zich op een druppelloze mix van experts-training, waarbij elk token wordt verwerkt door de geselecteerde expert, zelfs wanneer routing ongelijke expertbelastingen veroorzaakt. In tegenstelling tot op capaciteit gebaseerde benaderingen waarbij overflow- of pad-experts tot vaste maten worden teruggebracht, vereist dropless training kernels en communicatiepaden om variabele tokenaantallen te verwerken. NVIDIA zegt dat deze onregelmatige vormen onregelmatige tensoren produceren en GPU's kunnen laten wachten op verzending, algemene communicatie en deskundige berekeningen.

De gerapporteerde veranderingen vinden plaats op verschillende lagen. De gegroepeerde GEMM van Transformer Engine verwerkt expertgroepen van variabele lengte in één kerneloproep, terwijl bewerkingen worden gefuseerd en gecombineerd en de NCCL EP-backend-adresverplaatsing van tokens tussen GPU's. NVIDIA noemt ook XLA multistream-collectieven, hostactivatie-offloading en MXFP8-gegroepeerde kwantisering als bijdragers aan het resultaat.

Het bedrijf meldt dat de DeepSeek-V3 671B-configuratie de basislijn verhoogde van 103 naar 1.068 TFLOPS per GPU en een end-to-end doorvoerwinst van ongeveer 10x opleverde. Het rapporteert ook een efficiëntie van 97% bij 1.024 GPU's. Deze cijfers worden door NVIDIA gepresenteerd als observaties uit de geoptimaliseerde stapel, niet als onafhankelijk geverifieerde resultaten.

De implementatie is beschikbaar om te proberen via de NVIDIA NGC MaxText-container met ingebouwde Transformer Engine. Het bericht specificeert ghcr.io/nvidia/jax:maxtext-2026-09-09 of nieuwer en biedt configuratierichtlijnen voor DeepSeek-V3. Het waarschuwt dat verschillende modellen verschillende afstemming vereisen. Er worden geen prijs- en licentiegegevens verstrekt.

Brongegevens: developer.nvidia.com ↗

Waarom het ertoe doet

Grote mix-van-expertmodellen verminderen het rekenwerk door alleen geselecteerde expertnetwerken te activeren, maar hun ongelijke tokenroutering creëert moeilijke communicatie- en geheugenknelpunten. Als de resultaten van NVIDIA verder gaan dan de gerapporteerde configuratie, kunnen de veranderingen het trainen van zeer grote MoE-systemen efficiënter maken zonder gerouteerde tokens te laten vallen of elke expert op te vullen naar een vaste capaciteit. Dat is vooral van belang voor organisaties die grote NVIDIA GPU-clusters gebruiken, waar communicatieoverhead en verspilde rekenkracht de trainingstijd en -kosten aanzienlijk kunnen beïnvloeden. De resultaten zijn de eigen beweringen van NVIDIA; de bron biedt geen onafhankelijke benchmarking of vergelijking met elke alternatieve implementatie.

MoE-training wordt steeds belangrijker voor grote AI-modellen, omdat voorwaardelijke berekeningen de actieve berekening per token kunnen verminderen, terwijl veel parameters behouden blijven. De technische moeilijkheid verschuift naar routering, onregelmatige matrixbewerkingen, geheugengebruik en interconnect-verkeer. Het verbeteren van deze onderdelen zou de tijd en hardware kunnen verminderen die nodig is om modellen op productieschaal te trainen.

Het praktische publiek is gespecialiseerd: onderzoekers en bedrijven die al JAX, MaxText, NVIDIA GPU's en multi-GPU- of multi-node-infrastructuur gebruiken. De bron stelt niet vast dat dezelfde winst geldt voor kleinere systemen, niet-NVIDIA-hardware, compacte modellen of werkbelastingen buiten de gerapporteerde DeepSeek-V3-configuratie.

De cijfers van NVIDIA moeten worden behandeld als door de leverancier gerapporteerde prestatieclaims. De bron levert geen onafhankelijke tests, gedetailleerde kostenanalyses of volledige methodologie die voldoende is om te bepalen hoeveel van de verbetering voortkomt uit elke optimalisatie.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

De belangrijkste vraag is of de gerapporteerde winst zich herhaalt in verschillende MoE-architecturen, clusterindelingen, modelgroottes en GPU-generaties. NVIDIA is van plan om NVFP4 toe te voegen, kwantisering gecombineerd met GEMM en extra alles-tot-alles overlap. Gebruikers moeten ook kijken of deze functies standaard worden in JAX- en MaxText-workflows, en of de optimalisaties substantiële modelspecifieke afstemming vereisen. De bron documenteert een op containers gebaseerd toegangspad, maar vermeldt geen prijzen, licentievoorwaarden, ondersteuningsverplichtingen of algemene beschikbaarheid buiten de genoemde NGC-container.

Reproductie over andere MoE-modellen en hardwareconfiguraties zal aangeven of de gerapporteerde winsten breed overdraagbaar zijn of nauw gekoppeld zijn aan de clusterconfiguratie van DeepSeek-V3 en NVIDIA.

NVIDIA zegt dat toekomstig werk NVFP4, gefuseerde kwantisering met GEMM en extra totale overlap zal toevoegen. Deze toevoegingen kunnen de prestatie- en geheugenafwegingen van de stapel verder beïnvloeden.

De bron raadt aan om de staptijd, TFLOPS per GPU, het FLOP-gebruik van het model, de gegroepeerde GEMM-latentie en de verzending/combinatie-latentie bij te houden. Deze metingen zullen helpen rekenwinsten te scheiden van communicatieverbeteringen.

De post vermeldt niet de prijs van de container, de licentievoorwaarden, het ondersteuningsniveau of dat alle genoemde componenten even volwassen zijn voor productiegebruik.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdTransformatorenAI-trainingToekomst van AITest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?