que paso
NVIDIA describe un conjunto de optimizaciones de JAX y Transformer Engine para una capacitación sin interrupciones de una mezcla de expertos, incluido GEMM agrupado, operaciones fusionadas de despacho y combinación de expertos en paralelo, NCCL EP, colectivos multiflujo XLA, cuantificación agrupada MXFP8 y descarga de activación de host. La compañía afirma que una línea base de entrenamiento DeepSeek-V3 no optimizada alcanzó 103 TFLOPS por GPU, en comparación con 1068 TFLOPS por GPU después de la optimización, y que el rendimiento de extremo a extremo mejoró aproximadamente 10 veces. NVIDIA también informa una eficiencia de escalado del 97% en 1024 GPU. Los componentes optimizados se incluyen en el contenedor NVIDIA NGC MaxText, con instrucciones para probar y reproducir la configuración.
La publicación de NVIDIA se centra en la capacitación continua de una combinación de expertos, en la que cada token es procesado por su experto seleccionado incluso cuando el enrutamiento crea cargas de expertos desiguales. A diferencia de los enfoques basados en la capacidad que recortan los expertos en desbordamiento o pad a tamaños fijos, el entrenamiento sin caída requiere núcleos y rutas de comunicación para manejar recuentos de tokens variables. NVIDIA dice que estas formas irregulares producen tensores irregulares y pueden dejar a las GPU esperando el envío, la comunicación entre todos y el cálculo experto.
Los cambios informados operan en varias capas. El GEMM agrupado de Transformer Engine procesa grupos de expertos de longitud variable en una llamada al kernel, mientras que las operaciones de envío y combinación fusionadas y el backend NCCL EP dirigen el movimiento de tokens entre GPU. NVIDIA también cita colectivos multistream XLA, descarga de activación de host y cuantificación agrupada MXFP8 como contribuyentes al resultado.
La compañía informa que su configuración DeepSeek-V3 671B aumentó una base de 103 a 1068 TFLOPS por GPU y produjo una ganancia de rendimiento de extremo a extremo de aproximadamente 10 veces. También informa una eficiencia del 97% en 1024 GPU. NVIDIA presenta estas cifras como observaciones de su pila optimizada, no como resultados verificados de forma independiente.
La implementación está disponible para probar a través del contenedor NVIDIA NGC MaxText con Transformer Engine integrado. La publicación especifica ghcr.io/nvidia/jax:maxtext-2026-09-09 o más reciente y proporciona orientación de configuración para DeepSeek-V3. Advierte que diferentes modelos requieren diferentes ajustes. No se proporcionan detalles de precios ni licencias.
Detalles de la fuente: developer.nvidia.com ↗
Por qué es importante
Los grandes modelos de combinación de expertos reducen la computación al activar solo redes de expertos seleccionadas, pero su enrutamiento desigual de tokens crea cuellos de botella difíciles en la comunicación y la memoria. Si los resultados de NVIDIA se mantienen más allá de su configuración reportada, los cambios podrían hacer que el entrenamiento de sistemas MoE muy grandes sea más eficiente sin descartar tokens enrutados o llevar a cada experto a una capacidad fija. Esto es importante principalmente para las organizaciones que operan grandes clústeres de GPU NVIDIA, donde la sobrecarga de comunicación y el cálculo desperdiciado pueden afectar materialmente el tiempo y el costo de la capacitación. Los resultados son afirmaciones del propio NVIDIA; la fuente no proporciona evaluaciones comparativas independientes ni una comparación con cada implementación alternativa.
El entrenamiento de MoE es cada vez más importante para los grandes modelos de IA porque el cálculo condicional puede reducir el cálculo activo por token conservando muchos parámetros. La dificultad de ingeniería se desplaza hacia el enrutamiento, las operaciones matriciales irregulares, el uso de la memoria y el tráfico de interconexión. Mejorar esas piezas podría reducir el tiempo y el hardware necesarios para entrenar modelos a escala de producción.
La audiencia práctica está especializada: investigadores y empresas que ya utilizan GPU JAX, MaxText, NVIDIA e infraestructura multi-GPU o multi-nodo. La fuente no establece que las mismas ganancias se apliquen a sistemas más pequeños, hardware que no sea NVIDIA, modelos densos o cargas de trabajo fuera de la configuración DeepSeek-V3 informada.
Las cifras de NVIDIA deben tratarse como afirmaciones de desempeño informadas por los proveedores. La fuente no proporciona pruebas independientes, análisis de costos detallados ni metodología completa suficientes para determinar qué parte de la mejora proviene de cada optimización.
Mecanismo interactivo: cómo funciona realmente
Explore la tecnología subyacente detrás de este desarrollo de forma interactiva.
Which component of an AI application is the machine-learning model itself?
Qué ver a continuación
La pregunta principal es si las ganancias reportadas se reproducen en diferentes arquitecturas MoE, diseños de clúster, tamaños de modelos y generaciones de GPU. NVIDIA planea agregar NVFP4, cuantificación fusionada con GEMM y superposición total adicional. Los usuarios también deben observar si estas características se vuelven estándar en los flujos de trabajo JAX y MaxText, y si las optimizaciones requieren ajustes sustanciales específicos del modelo. La fuente documenta una ruta de acceso basada en contenedores, pero no indica precios, términos de licencia, compromisos de soporte o disponibilidad general más allá del contenedor NGC citado.
La reproducción en otros modelos MoE y configuraciones de hardware indicará si las ganancias reportadas son ampliamente transferibles o están estrechamente acopladas a la configuración de clúster de DeepSeek-V3 y NVIDIA.
NVIDIA dice que el trabajo futuro agregará NVFP4, cuantificación fusionada con GEMM y superposición total adicional. Esas adiciones podrían afectar aún más el rendimiento y la memoria de la pila.
La fuente recomienda realizar un seguimiento del tiempo de paso, TFLOPS por GPU, utilización de FLOP del modelo, latencia GEMM agrupada y latencia de envío/combinación. Esas mediciones ayudarán a separar las ganancias informáticas de las mejoras en la comunicación.
La publicación no indica el precio del contenedor, las condiciones de la licencia, el nivel de soporte o si todos los componentes citados están igualmente maduros para su uso en producción.