A continuaciónSiguiente guía
Cuantización posterior al entrenamiento GPTQ y AWQ
Técnico
GUÍA Técnica
DeepSpeed (Microsoft) y Megatron-LM (NVIDIA) son las pilas de software que hacen que los modelos de entrenamiento con miles de millones de parámetros en miles de GPU sean realmente factibles.
Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.
Es imposible entrenar un modelo grande en una GPU porque los pesos, gradientes y estados del optimizador no encajan. Estas pilas dividen el trabajo entre muchas GPU. Megatron-LM fue pionero en el paralelismo tensorial, dividiendo multiplicaciones de matrices individuales dentro de cada capa en las GPU, además del paralelismo de canalización, que coloca diferentes capas en diferentes GPU. La contribución distintiva de DeepSpeed es ZeRO (Zero Redundancy Optimizer), que fragmenta los estados, gradientes y parámetros del optimizador en las GPU en lugar de replicarlos, lo que reduce drásticamente la memoria por GPU. Los dos suelen combinarse (Megatron-DeepSpeed) para entrenar modelos como BLOOM-176B y Megatron-Turing NLG. También agregan precisión mixta, puntos de control de activación y descarga a CPU o NVMe, por lo que los modelos enormes se entrenan con hardware limitado.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
Espere una integración más estrecha con el FSDP (Fully Sharded Data Parallel) nativo de PyTorch, que absorbió muchas ideas de ZeRO, borrando la línea entre las pilas de investigación y los marcos centrales. Los enfoques basados en compiladores y los planificadores automáticos de paralelismo tienen como objetivo eliminar el ajuste manual. A medida que los grupos de entrenamiento crecen hacia cientos de miles de aceleradores, la tolerancia a fallas, el escalamiento elástico y la comunicación superpuesta con la computación se convierten en las fronteras de ingeniería dominantes, junto con el soporte para nuevo hardware como NVIDIA Blackwell y chips de entrenamiento personalizados.
Entrenamiento del modelo abierto multilingüe BLOOM-176B utilizando la pila combinada Megatron-DeepSpeed en cientos de GPU.
Microsoft y NVIDIA entrenan el modelo Megatron-Turing NLG de 530 mil millones de parámetros con paralelismo 3D.
ZeRO-Offload permite a los investigadores ajustar modelos de miles de millones de parámetros en una sola GPU de estación de trabajo al transferir estados del optimizador a la RAM de la CPU.
Usar puntos de control de activación en estas pilas para ajustarse a ventanas de contexto más largas recalculando las activaciones en lugar de almacenarlas todas.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
DeepSpeed (Microsoft) y Megatron-LM (NVIDIA) son las pilas de software que hacen que los modelos de entrenamiento con miles de millones de parámetros en miles de GPU sean realmente factibles. Sin ellos, los modelos de vanguardia actuales simplemente no podrían caber en la memoria ni terminar de entrenarse en un tiempo razonable.
ZeRO (Zero Redundancy Optimizer) elimina la redundancia de memoria al dividir los estados, gradientes y parámetros del optimizador en las GPU en lugar de replicarlos en cada dispositivo.
El paralelismo tensorial divide las matemáticas dentro de una sola capa (como una matriz grande multiplicada) en múltiples GPU, lo que es una división intracapa.
ZeRO Stage 3 fragmenta los parámetros además de los gradientes y los estados del optimizador, reuniéndolos según demanda, lo que brinda la mayor reducción de memoria.
Los puntos de control de activación almacenan menos activaciones intermedias y las recalculan durante la retropropagación, intercambiando cálculos adicionales por memoria reducida.
El paralelismo 3D acumula tres estrategias ortogonales: paralelismo de datos, paralelismo tensorial (intracapa) y paralelismo de canalización (entre capas).
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Cuantización posterior al entrenamiento GPTQ y AWQ
Técnico