Τεχνικός ΟΔΗΓΟΣ

Στοίβες προπόνησης DeepSpeed ​​και Megatron

Το DeepSpeed (Microsoft) και το Megatron-LM (NVIDIA) είναι οι στοίβες λογισμικού που καθιστούν πραγματικά εφικτά μοντέλα εκπαίδευσης με δισεκατομμύρια παραμέτρους σε χιλιάδες GPU.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

Βαθιά κατάδυση

Η εκπαίδευση ενός μεγάλου μοντέλου σε μία GPU είναι αδύνατη επειδή τα βάρη, οι διαβαθμίσεις και οι καταστάσεις βελτιστοποίησης δεν ταιριάζουν. Αυτές οι στοίβες μοιράζουν την εργασία σε πολλές GPU. Η Megatron-LM πρωτοστάτησε στον παραλληλισμό τανυστών, τεμαχίζοντας μεμονωμένους πολλαπλασιασμούς μήτρας μέσα σε κάθε επίπεδο κατά μήκος των GPU, καθώς και τον παραλληλισμό αγωγών, ο οποίος τοποθετεί διαφορετικά επίπεδα σε διαφορετικές GPU. Η συμβολή υπογραφής του DeepSpeed ​​είναι το ZeRO (Zero Redundancy Optimizer), το οποίο κατακερματίζει τις καταστάσεις, τις κλίσεις και τις παραμέτρους του βελτιστοποιητή σε όλες τις GPU αντί να τις αναπαράγει, μειώνοντας δραματικά τη μνήμη ανά GPU. Αυτά τα δύο συχνά συνδυάζονται (Megatron-DeepSpeed) για να εκπαιδεύσουν μοντέλα όπως το BLOOM-176B και το Megatron-Turing NLG. Προσθέτουν επίσης μικτή ακρίβεια, σημεία ελέγχου ενεργοποίησης και εκφόρτωση σε CPU ή NVMe, έτσι ώστε τα τεράστια μοντέλα να εκπαιδεύονται σε περιορισμένο υλικό.

Τεχνική διορατικότητα

Το ZeRO έχει τρία στάδια αύξησης της εξοικονόμησης μνήμης: Το Στάδιο 1 καταργεί τις καταστάσεις βελτιστοποίησης θραυσμάτων, το Στάδιο 2 επίσης διαχωρίζει τις διαβαθμίσεις και το Στάδιο 3 κατακερματίζει τις ίδιες τις παραμέτρους, συγκεντρώνοντάς τες κατά απαίτηση κατά τα περάσματα προς τα εμπρός και προς τα πίσω. Σε συνδυασμό με τον παραλληλισμό τανυστών (ενδο-στρώμα) και τον παραλληλισμό σωληνώσεων (ενδιάμεσο στρώμα), αυτό σχηματίζει «τρισδιάστατο παραλληλισμό». Η βασική ένταση είναι η επιβάρυνση της επικοινωνίας: κάθε διαχωρισμός θραυσμάτων προσθέτει κίνηση από GPU σε GPU, έτσι οι μηχανικοί συντονίζουν τη διαίρεση για να διατηρούν κορεσμένους τους γρήγορους συνδέσμους NVLink και InfiniBand.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

The Future of DeepSpeed και Megatron Training Stacks

Αναμένετε στενότερη ενοποίηση με το εγγενές FSDP (Fully Sharded Data Parallel) της PyTorch, το οποίο απορρόφησε πολλές ιδέες ZeRO, θολώνοντας τη γραμμή μεταξύ των ερευνητικών στοίβων και των βασικών πλαισίων. Οι προσεγγίσεις που βασίζονται σε μεταγλωττιστή και οι προγραμματιστές αυτόματου παραλληλισμού στοχεύουν στην κατάργηση του χειροκίνητου συντονισμού. Καθώς τα προπονητικά cluster αυξάνονται προς εκατοντάδες χιλιάδες επιταχυντές, η ανοχή σφαλμάτων, η ελαστική κλιμάκωση και η αλληλοεπικαλυπτόμενη επικοινωνία με υπολογιστές γίνονται τα κυρίαρχα όρια της μηχανικής, παράλληλα με την υποστήριξη για νέο υλικό όπως το NVIDIA Blackwell και προσαρμοσμένα τσιπ εκπαίδευσης.

Υλοποίηση σε πραγματικό κόσμο

Εκπαίδευση του ανοιχτού πολύγλωσσου μοντέλου BLOOM-176B χρησιμοποιώντας τη συνδυασμένη στοίβα Megatron-DeepSpeed ​​σε εκατοντάδες GPU.

Microsoft και η NVIDIA εκπαιδεύουν το μοντέλο Megatron-Turing NLG 530 δισεκατομμυρίων παραμέτρων με τρισδιάστατο παραλληλισμό.

Το ZeRO-Offload επιτρέπει στους ερευνητές να προσαρμόσουν τα μοντέλα πολλών δισεκατομμυρίων παραμέτρων σε έναν ενιαίο σταθμό εργασίας GPU, διαχέοντας καταστάσεις βελτιστοποίησης στη μνήμη RAM της CPU.

Χρησιμοποιώντας το σημείο ελέγχου ενεργοποίησης σε αυτές τις στοίβες για να χωρέσετε μεγαλύτερα παράθυρα περιβάλλοντος, επαναυπολογίζοντας τις ενεργοποιήσεις αντί να τις αποθηκεύσετε όλες.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

GPTQ και AWQ μετα-προπονητική κβαντοποίηση

Συχνές ερωτήσεις

What is DeepSpeed and Megatron Training Stacks?

Το DeepSpeed (Microsoft) και το Megatron-LM (NVIDIA) είναι οι στοίβες λογισμικού που καθιστούν πραγματικά εφικτά μοντέλα εκπαίδευσης με δισεκατομμύρια παραμέτρους σε χιλιάδες GPU. Χωρίς αυτά, τα σημερινά μοντέλα συνόρων απλά δεν θα μπορούσαν να χωρέσουν στη μνήμη ή να ολοκληρώσουν την προπόνηση σε εύλογο χρόνο.

Ποιος είναι ο πρωταρχικός σκοπός του βελτιστοποιητή ZeRO της DeepSpeed;

Το ZeRO (Zero Redundancy Optimizer) εξαλείφει τον πλεονασμό της μνήμης κατατμώντας τις καταστάσεις, τις διαβαθμίσεις και τις παραμέτρους του βελτιστοποιητή σε όλες τις GPU αντί να τις αναπαράγει σε κάθε συσκευή.

Ο παραλληλισμός τανυστών, όπως πρωτοστάτησε στο Megatron-LM, χωρίζει το μοντέλο πώς;

Ο παραλληλισμός τανυστή διαμερίζει τα μαθηματικά μέσα σε ένα μόνο επίπεδο (όπως ένας μεγάλος πολλαπλασιασμός μήτρας) σε πολλές GPU, κάτι που είναι διαχωρισμός εντός του επιπέδου.

Ποιο στάδιο ZeRO παρέχει τη μεγαλύτερη εξοικονόμηση μνήμης διαμοιράζοντας επίσης τις ίδιες τις παραμέτρους του μοντέλου;

Το ZeRO Stage 3 καταστρέφει τις παραμέτρους εκτός από τις διαβαθμίσεις και τις καταστάσεις βελτιστοποίησης, συγκεντρώνοντάς τις κατά παραγγελία, δίνοντας τη μεγαλύτερη μείωση μνήμης.

Τι ανταλλάσσει το «σημείο ελέγχου ενεργοποίησης» για εξοικονόμηση μνήμης κατά τη διάρκεια της προπόνησης;

Το σημείο ελέγχου ενεργοποίησης αποθηκεύει λιγότερες ενδιάμεσες ενεργοποιήσεις και τις επαναυπολογίζει κατά τη διάρκεια της backpropagation, ανταλλάσσοντας πρόσθετους υπολογισμούς για μειωμένη μνήμη.

Γιατί ο συνδυασμός αυτών των τεχνικών ονομάζεται συχνά «3D παραλληλισμός»;

Ο τρισδιάστατος παραλληλισμός στοιβάζει τρεις ορθογώνιες στρατηγικές: παραλληλισμό δεδομένων, παραλληλισμό τανυστών (ενδο-στρώμα) και παραλληλισμό σωλήνων (ενδιάμεσο στρώμα).