Partage de point de contrôle et reprise de la formation
Techniques permettant de sauvegarder l'état d'entraînement d'un modèle en morceaux (fragments) afin que des modèles géants puissent être enregistrés et rechargés sans étouffer les limites de la mémoire ou du disque, et qu'une exécution en panne puisse reprendre exactement là où elle s'est arrêtée.
Aperçu
Essential for any training job that runs for days or weeks across many GPUs.
Plongée profonde
Un point de contrôle de formation est un instantané de tout ce qui est nécessaire pour reprendre : les poids du modèle, les états de l'optimiseur, le calendrier du taux d'apprentissage, la position du chargeur de données et les graines du générateur de nombres aléatoires. Pour les modèles volumineux, cet instantané peut atteindre des centaines de gigaoctets, ce qui est bien trop volumineux pour un seul fichier ou la mémoire d'une seule machine. Le partage de point de contrôle répartit cet instantané sur de nombreux fichiers et plusieurs rangs, de sorte que chaque GPU écrit uniquement sa propre tranche en parallèle. La formation avec reprise recharge ensuite ces fragments et restaure l’état complet avec précision. Sans cela, une exécution de plusieurs semaines qui plante à l’heure 200 devrait recommencer à zéro. Des frameworks tels que PyTorch Distributed Checkpoint, DeepSpeed et le format de tenseurs de sécurité fragmentés de Hugging Face Hub font de cette routine.
Aperçu technique
Le partage fonctionne car la formation distribuée divise déjà les poids et les états de l'optimiseur entre les rangs (via les données, le tenseur ou le parallélisme ZeRO). Chaque rang sérialise uniquement sa partition, souvent dans des formats tels que des tenseurs de sécurité qui permettent un chargement paresseux et mappé en mémoire. Un fichier d'index mappe les noms de paramètres aux fichiers de partition. Pour résumer de manière déterministe, le système conserve également les états RNG, le nombre d'étapes de l'optimiseur et le décalage exact du chargeur de données, de sorte que la réexécution reproduit la même séquence de lots.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L’avenir du partage de points de contrôle et de la reprise de la formation
Les points de contrôle passent d'un événement périodique stoppant le monde à quelque chose d'asynchrone et presque gratuit. Attendez-vous à davantage de points de contrôle en mémoire et superposés qui écrivent des fragments en arrière-plan pendant que la formation se poursuit, ainsi qu'à des points de contrôle codés et répliqués avec effacement qui survivent aux pannes de nœuds courantes à l'échelle de milliers de GPU. Les magasins d'objets cloud et les niveaux NVMe locaux plus rapides hébergeront des fragments, et les formats standardisés tels que les safetensors continueront d'améliorer le chargement partiel sûr, rapide et pour la reprise de la formation et le déploiement d'inférence.
Mise en œuvre dans le monde réel
Un modèle frontalier exécuté sur des milliers de GPU qui enregistre automatiquement les points de contrôle fragmentés toutes les quelques centaines d'étapes, de sorte qu'un seul nœud défaillant ne coûte que quelques minutes, et non des jours.
Hugging Face distribue un grand modèle ouvert sous forme de plusieurs fragments de sécurité ainsi qu'un index.json afin que les utilisateurs puissent le télécharger et le charger pièce par pièce.
Un chercheur reprend un réglage fin interrompu qui rétablit l'élan exact de l'optimiseur, le nombre de pas et la position du chargeur de données pour continuer de manière transparente.
Formation sur des instances ponctuelles sur des GPU cloud préemptifs bon marché, où des points de contrôle fragmentés fréquents permettent au travail de survivre à son expulsion et à sa reprogrammation.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Checkpoint Sharding and Resumable Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Slurm pour les clusters de formation en IA
Questions fréquemment posées
What is Checkpoint Sharding and Resumable Training?
Techniques permettant de sauvegarder l'état d'entraînement d'un modèle en morceaux (fragments) afin que des modèles géants puissent être enregistrés et rechargés sans étouffer les limites de la mémoire ou du disque, et qu'une exécution en panne puisse reprendre exactement là où elle s'est arrêtée. Indispensable pour tout travail de formation qui s’exécute pendant des jours ou des semaines sur de nombreux GPU.
Pourquoi les points de contrôle de grand modèle sont-ils divisés en fragments ?
Les points de contrôle énormes (des centaines de Go) ne sont pas pratiques en tant que fichier unique ; le partitionnement permet à de nombreux rangs d'écrire leurs tranches en parallèle et permet un chargement par morceaux.
Outre les poids du modèle, que doit généralement économiser un point de contrôle avec reprise ?
Pour résumer exactement, le point de contrôle stocke les états de l'optimiseur, les états du générateur de nombres aléatoires, le nombre de pas et l'endroit où le chargeur de données s'est arrêté.
Quel est le principal avantage d’une reprise de formation pour les emplois de longue durée ?
Avec les points de contrôle pouvant être repris, une exécution interrompue recharge son dernier état enregistré et continue, au lieu de gaspiller des jours de calcul.
Comment chaque classement GPU contribue-t-il généralement à un point de contrôle fragmenté ?
Étant donné que la formation distribuée divise déjà le modèle en plusieurs rangs, chaque rang écrit uniquement sa tranche, ce qui rend la sauvegarde parallèle et économe en mémoire.
Quel rôle joue un fichier d’index dans les points de contrôle fragmentés ?
Un index (par exemple, index.json) enregistre quel fragment contient chaque paramètre afin que les chargeurs puissent récupérer et réassembler les bonnes pièces.