Piles de formation DeepSpeed et Megatron
DeepSpeed (Microsoft) et Megatron-LM (NVIDIA) sont les piles logicielles qui rendent les modèles de formation avec des milliards de paramètres sur des milliers de GPU réellement réalisables.
Aperçu
Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.
Plongée profonde
Entraîner un grand modèle sur un seul GPU est impossible car les poids, les dégradés et les états de l'optimiseur ne correspondent pas. Ces piles répartissent le travail entre plusieurs GPU. Megatron-LM a été le pionnier du parallélisme tensoriel, en découpant les multiplications matricielles individuelles à l'intérieur de chaque couche sur les GPU, ainsi que du parallélisme de pipeline, qui place différentes couches sur différents GPU. La contribution phare de DeepSpeed est ZeRO (Zero Redundancy Optimizer), qui répartit les états, les gradients et les paramètres de l'optimiseur sur les GPU au lieu de les répliquer, réduisant ainsi considérablement la mémoire par GPU. Les deux sont souvent combinés (Megatron-DeepSpeed) pour entraîner des modèles comme BLOOM-176B et Megatron-Turing NLG. Ils ajoutent également une précision mixte, des points de contrôle d'activation et un déchargement vers le processeur ou le NVMe afin que les modèles volumineux s'entraînent sur un matériel limité.
Aperçu technique
ZeRO comporte trois étapes pour augmenter les économies de mémoire : l'étape 1 partage les états de l'optimiseur, l'étape 2 partage également les gradients et l'étape 3 fragmente les paramètres eux-mêmes, les rassemblant à la demande lors des passes avant et arrière. Combiné avec le parallélisme tenseur (intra-couche) et le parallélisme pipeline (inter-couche), cela forme le « parallélisme 3D ». La principale tension réside dans la surcharge de communication : chaque division de partition ajoute du trafic GPU à GPU, de sorte que les ingénieurs ajustent la division pour maintenir les liaisons rapides NVLink et InfiniBand saturées.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir des piles de formation DeepSpeed et Megatron
Attendez-vous à une intégration plus étroite avec le FSDP (Fully Sharded Data Parallel) natif de PyTorch, qui a absorbé de nombreuses idées ZeRO, brouillant la frontière entre les piles de recherche et les frameworks de base. Les approches basées sur le compilateur et les planificateurs de parallélisme automatique visent à supprimer le réglage manuel. À mesure que les clusters de formation se développent et comptent des centaines de milliers d'accélérateurs, la tolérance aux pannes, la mise à l'échelle élastique et le chevauchement des communications avec le calcul deviennent les frontières dominantes de l'ingénierie, aux côtés de la prise en charge de nouveaux matériels tels que NVIDIA Blackwell et des puces de formation personnalisées.
Mise en œuvre dans le monde réel
Entraînement du modèle multilingue ouvert BLOOM-176B à l'aide de la pile combinée Megatron-DeepSpeed sur des centaines de GPU.
Microsoft et NVIDIA entraînent le modèle Megatron-Turing NLG de 530 milliards de paramètres avec le parallélisme 3D.
ZeRO-Offload permet aux chercheurs d'affiner des modèles de plusieurs milliards de paramètres sur un seul GPU de poste de travail en déversant les états de l'optimiseur sur la RAM du processeur.
Utiliser les points de contrôle d'activation dans ces piles pour s'adapter à des fenêtres de contexte plus longues en recalculant les activations au lieu de toutes les stocker.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DeepSpeed and Megatron Training Stacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Quantification post-formation GPTQ et AWQ
Questions fréquemment posées
What is DeepSpeed and Megatron Training Stacks?
DeepSpeed (Microsoft) et Megatron-LM (NVIDIA) sont les piles logicielles qui rendent les modèles de formation avec des milliards de paramètres sur des milliers de GPU réellement réalisables. Sans eux, les modèles pionniers d'aujourd'hui ne pourraient tout simplement pas tenir en mémoire ou terminer leur formation dans un délai raisonnable.
Quel est l'objectif principal de l'optimiseur ZeRO de DeepSpeed ?
ZeRO (Zero Redundancy Optimizer) élimine la redondance de la mémoire en partitionnant les états, les gradients et les paramètres de l'optimiseur sur les GPU plutôt que de les répliquer sur chaque appareil.
Comment le parallélisme tensoriel, tel qu'il a été lancé dans Megatron-LM, divise le modèle ?
Le parallélisme tensoriel divise les mathématiques à l'intérieur d'une seule couche (telle qu'une grande multiplication matricielle) sur plusieurs GPU, ce qui correspond à une division intra-couche.
Quelle étape ZeRO permet d'économiser le plus de mémoire en partageant également les paramètres du modèle eux-mêmes ?
ZeRO Stage 3 partage les paramètres en plus des gradients et des états de l'optimiseur, les rassemblant à la demande, offrant ainsi la plus grande réduction de mémoire.
Qu'est-ce que le « point de contrôle d'activation » permet d'économiser de la mémoire pendant l'entraînement ?
Les points de contrôle d'activation stockent moins d'activations intermédiaires et les recalculent lors de la rétro-propagation, échangeant des calculs supplémentaires contre une mémoire réduite.
Pourquoi la combinaison de ces techniques est-elle souvent appelée « parallélisme 3D » ?
Le parallélisme 3D regroupe trois stratégies orthogonales : le parallélisme des données, le parallélisme tenseur (intra-couche) et le parallélisme pipeline (inter-couche).