Volver a Noticias
InnovaciónAI Understanding sesión informativa

NVIDIA informa que un entrenamiento MoE dropless es 10 veces más rápido en JAX

NVIDIA afirma que sus optimizaciones con Transformer Engine y JAX aumentaron el rendimiento de entrenamiento del DeepSeek-V3 671B en aproximadamente 10 veces y alcanzaron una eficiencia del 97% en 1.024 GPUs. La ruta optimizada está incluida en un contenedor NVIDIA NGC MaxText fechado el 9 de septiembre de 2026 o posterior.

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
Documento de fuente primariaFuente registrada
Editor
developer.nvidia.com
Enlace fuente
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
Tipo de fuente
Documento principal: un anuncio oficial, documento, archivo o página propia que leemos directamente.
ContextoEntiende esto en 60 segundos

Empieza aquí

Términos clave

Mezcla de Expertos (MoE)
Una arquitectura con subredes especializadas donde solo se ejecutan expertos seleccionados por entrada.
Memoria (memoria del agente)
Contexto almacenado que un agente de IA utiliza en todos los pasos o sesiones para mejorar la continuidad.
Cuantización
Conversión de pesos de modelos a formatos de menor precisión, como 8 bits o 4 bits.
Ponte a pruebaModelos de IA explicados cuestionario

que paso

NVIDIA describe un conjunto de optimizaciones de JAX y Transformer Engine para una capacitación sin interrupciones de una mezcla de expertos, incluido GEMM agrupado, operaciones fusionadas de despacho y combinación de expertos en paralelo, NCCL EP, colectivos multiflujo XLA, cuantificación agrupada MXFP8 y descarga de activación de host. La compañía afirma que una línea base de entrenamiento DeepSeek-V3 no optimizada alcanzó 103 TFLOPS por GPU, en comparación con 1068 TFLOPS por GPU después de la optimización, y que el rendimiento de extremo a extremo mejoró aproximadamente 10 veces. NVIDIA también informa una eficiencia de escalado del 97% en 1024 GPU. Los componentes optimizados se incluyen en el contenedor NVIDIA NGC MaxText, con instrucciones para probar y reproducir la configuración.

La publicación de NVIDIA se centra en la capacitación continua de una combinación de expertos, en la que cada token es procesado por su experto seleccionado incluso cuando el enrutamiento crea cargas de expertos desiguales. A diferencia de los enfoques basados ​​en la capacidad que recortan los expertos en desbordamiento o pad a tamaños fijos, el entrenamiento sin caída requiere núcleos y rutas de comunicación para manejar recuentos de tokens variables. NVIDIA dice que estas formas irregulares producen tensores irregulares y pueden dejar a las GPU esperando el envío, la comunicación entre todos y el cálculo experto.

Los cambios informados operan en varias capas. El GEMM agrupado de Transformer Engine procesa grupos de expertos de longitud variable en una llamada al kernel, mientras que las operaciones de envío y combinación fusionadas y el backend NCCL EP dirigen el movimiento de tokens entre GPU. NVIDIA también cita colectivos multistream XLA, descarga de activación de host y cuantificación agrupada MXFP8 como contribuyentes al resultado.

La compañía informa que su configuración DeepSeek-V3 671B aumentó una base de 103 a 1068 TFLOPS por GPU y produjo una ganancia de rendimiento de extremo a extremo de aproximadamente 10 veces. También informa una eficiencia del 97% en 1024 GPU. NVIDIA presenta estas cifras como observaciones de su pila optimizada, no como resultados verificados de forma independiente.

La implementación está disponible para probar a través del contenedor NVIDIA NGC MaxText con Transformer Engine integrado. La publicación especifica ghcr.io/nvidia/jax:maxtext-2026-09-09 o más reciente y proporciona orientación de configuración para DeepSeek-V3. Advierte que diferentes modelos requieren diferentes ajustes. No se proporcionan detalles de precios ni licencias.

Detalles de la fuente: developer.nvidia.com ↗

Por qué es importante

Los grandes modelos de combinación de expertos reducen la computación al activar solo redes de expertos seleccionadas, pero su enrutamiento desigual de tokens crea cuellos de botella difíciles en la comunicación y la memoria. Si los resultados de NVIDIA se mantienen más allá de su configuración reportada, los cambios podrían hacer que el entrenamiento de sistemas MoE muy grandes sea más eficiente sin descartar tokens enrutados o llevar a cada experto a una capacidad fija. Esto es importante principalmente para las organizaciones que operan grandes clústeres de GPU NVIDIA, donde la sobrecarga de comunicación y el cálculo desperdiciado pueden afectar materialmente el tiempo y el costo de la capacitación. Los resultados son afirmaciones del propio NVIDIA; la fuente no proporciona evaluaciones comparativas independientes ni una comparación con cada implementación alternativa.

El entrenamiento de MoE es cada vez más importante para los grandes modelos de IA porque el cálculo condicional puede reducir el cálculo activo por token conservando muchos parámetros. La dificultad de ingeniería se desplaza hacia el enrutamiento, las operaciones matriciales irregulares, el uso de la memoria y el tráfico de interconexión. Mejorar esas piezas podría reducir el tiempo y el hardware necesarios para entrenar modelos a escala de producción.

La audiencia práctica está especializada: investigadores y empresas que ya utilizan GPU JAX, MaxText, NVIDIA e infraestructura multi-GPU o multi-nodo. La fuente no establece que las mismas ganancias se apliquen a sistemas más pequeños, hardware que no sea NVIDIA, modelos densos o cargas de trabajo fuera de la configuración DeepSeek-V3 informada.

Las cifras de NVIDIA deben tratarse como afirmaciones de desempeño informadas por los proveedores. La fuente no proporciona pruebas independientes, análisis de costos detallados ni metodología completa suficientes para determinar qué parte de la mejora proviene de cada optimización.

Interactive Mechanism

Mecanismo interactivo: cómo funciona realmente

Explore la tecnología subyacente detrás de este desarrollo de forma interactiva.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Verificación interactiva del concepto+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Qué ver a continuación

La pregunta principal es si las ganancias reportadas se reproducen en diferentes arquitecturas MoE, diseños de clúster, tamaños de modelos y generaciones de GPU. NVIDIA planea agregar NVFP4, cuantificación fusionada con GEMM y superposición total adicional. Los usuarios también deben observar si estas características se vuelven estándar en los flujos de trabajo JAX y MaxText, y si las optimizaciones requieren ajustes sustanciales específicos del modelo. La fuente documenta una ruta de acceso basada en contenedores, pero no indica precios, términos de licencia, compromisos de soporte o disponibilidad general más allá del contenedor NGC citado.

La reproducción en otros modelos MoE y configuraciones de hardware indicará si las ganancias reportadas son ampliamente transferibles o están estrechamente acopladas a la configuración de clúster de DeepSeek-V3 y NVIDIA.

NVIDIA dice que el trabajo futuro agregará NVFP4, cuantificación fusionada con GEMM y superposición total adicional. Esas adiciones podrían afectar aún más el rendimiento y la memoria de la pila.

La fuente recomienda realizar un seguimiento del tiempo de paso, TFLOPS por GPU, utilización de FLOP del modelo, latencia GEMM agrupada y latencia de envío/combinación. Esas mediciones ayudarán a separar las ganancias informáticas de las mejoras en la comunicación.

La publicación no indica el precio del contenedor, las condiciones de la licencia, el nivel de soporte o si todos los componentes citados están igualmente maduros para su uso en producción.

Guías y cuestionarios relacionados

Modelos de IA explicadostransformadoresEntrenamiento de IAFuturo de la IAPon a prueba lo que sabes: prueba un cuestionario gratuito sobre IABusque un término de IA en nuestro glosarioSiga el rastreador de lanzamientos de modelos de IA
¿Encontró esto útil?