Τεχνικός ΟΔΗΓΟΣ

Παραλληλισμός τανυστών για μεγάλα μοντέλα

Ένας τρόπος για να χωρίσετε τα μαθηματικά μέσα σε ένα ενιαίο επίπεδο νευρωνικού δικτύου σε πολλές GPU, έτσι ώστε ένα μοντέλο πολύ μεγάλο για μία συσκευή να μπορεί να συνεχίσει να λειτουργεί.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

Βαθιά κατάδυση

Ο παραλληλισμός τανυστών (ονομάζεται επίσης παραλληλισμός μοντέλων εντός του επιπέδου) κατακερματίζει μεμονωμένους πίνακες βάρους σε όλες τις GPU αντί να τοποθετεί ολόκληρα επίπεδα σε ξεχωριστές συσκευές. Σε έναν μετασχηματιστή, οι πολλαπλασιασμοί μεγάλου πίνακα - προβολές προσοχής και MLP τροφοδοσίας - διαχωρίζονται: για παράδειγμα, ο πρώτος πίνακας βάρους του MLP διαιρείται με στήλες και ο δεύτερος κατά σειρές, έτσι κάθε GPU υπολογίζει ένα slice και μια μοναδική ολική μείωση συνδυάζει τα αποτελέσματα. Η προσοχή μοιράζεται μεταξύ των κεφαλών, με κάθε GPU να χειρίζεται ένα υποσύνολο. Επειδή κάθε GPU εκτελεί μέρος κάθε επιπέδου ταυτόχρονα, ο παραλληλισμός τανυστών μειώνει τη μνήμη ανά GPU και επιταχύνει τον υπολογισμό, αλλά απαιτεί συχνή επικοινωνία υψηλού εύρους ζώνης μεταξύ των GPU κάθε επιπέδου. Γι' αυτό συνήθως περιορίζεται σε έναν κόμβο που συνδέεται με το NVLink και συνδυάζεται με παραλληλισμό αγωγών και δεδομένων για πολύ μεγάλες εργασίες εκπαίδευσης και εξυπηρέτησης.

Τεχνική διορατικότητα

Το κόλπο, που διαδόθηκε από τη Megatron-LM, είναι η επιλογή διαστάσεων διαμερίσματος, ώστε η επικοινωνία να είναι ελάχιστη. Ο διαχωρισμός του πρώτου πίνακα MLP κατά στήλη επιτρέπει σε κάθε GPU να εφαρμόσει τη μη γραμμικότητα τοπικά χωρίς συγχρονισμό. Ο διαχωρισμός της δεύτερης σειράς κατά σειρά σημαίνει ότι οι έξοδοι χρειάζονται απλώς μια ολική μείωση για να αθροιστούν μερικά αποτελέσματα. Έτσι, κάθε στρώμα επιφέρει περίπου δύο ολομειώσεις (εμπρός) και δύο (πίσω). Επειδή αυτές οι συλλογικότητες συμβαίνουν σε κάθε επίπεδο, κυριαρχεί ο λανθάνουσα κατάσταση—έτσι ο παραλληλισμός τανυστών ζει πίσω από γρήγορες συνδέσεις εντός κόμβων όπως το NVLink και όχι πιο αργά δίκτυα μεταξύ κόμβων.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

Το μέλλον του παραλληλισμού τανυστών για μεγάλα μοντέλα

Ο παραλληλισμός τανυστών παραμένει θεμελιώδης, αλλά αναμειγνύεται ολοένα και περισσότερο στον «3D παραλληλισμό» (τανυστής + αγωγός + δεδομένα) και συνδυάζεται με τον ειδικό παραλληλισμό για μοντέλα Mixture-of-Experts. Πλαίσια όπως το Megatron-LM, το DeepSpeed ​​και το vLLM αυτοματοποιούν τον διαμοιρασμό. Καθώς η GPU διασυνδέεται (NVLink, NVSwitch) και τα οπτικά υφάσματα γίνονται πιο γρήγορα, το όριο των ορίων κόμβου χαλαρώνει, επιτρέποντας ευρύτερες ομάδες τανυστών-παράλληλων. Αναμένετε πιο έξυπνη αυτόματη παραλληλοποίηση που επιλέγει διαστάσεις θραυσμάτων και μεγέθη ομάδων για να ελαχιστοποιήσει την επικοινωνία για μια δεδομένη τοπολογία συμπλέγματος.

Υλοποίηση σε πραγματικό κόσμο

Εκπαίδευση ενός μοντέλου παραμέτρων 175B, μοιράζοντας τους πίνακες βάρους κάθε επιπέδου σε 8 GPU σε έναν κόμβο συνδεδεμένο με NVLink χρησιμοποιώντας Megatron-LM.

Εξυπηρέτηση ενός μοντέλου συνομιλίας παραμέτρων 70B σε vLLM με tensor_parallel_size=4, ώστε τα βάρη να χωρούν σε τέσσερις GPU και να ανταποκρίνονται σε πραγματικό χρόνο.

Διαχωρίζοντας την προσοχή του μετασχηματιστή σε όλες τις GPU, έτσι ώστε κάθε συσκευή να υπολογίζει ένα υποσύνολο και στη συνέχεια να συνενώνει τις εξόδους για το επόμενο επίπεδο.

Συνδυασμός παραλληλισμού τανυστών εντός κόμβων και παραλληλισμού αγωγών μεταξύ κόμβων για εκπαίδευση μοντέλων τρισεκατομμυρίων παραμέτρων σε μεγάλα συμπλέγματα GPU.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Παραλληλισμός μοντέλου και αγωγών

Συχνές ερωτήσεις

What is Tensor Parallelism for Large Models?

Ένας τρόπος για να χωρίσετε τα μαθηματικά μέσα σε ένα ενιαίο επίπεδο νευρωνικού δικτύου σε πολλές GPU, έτσι ώστε ένα μοντέλο πολύ μεγάλο για μία συσκευή να μπορεί να συνεχίσει να λειτουργεί. Έχει σημασία, επειδή τα μοντέλα συνόρων έχουν εκατοντάδες δισεκατομμύρια παραμέτρους που καμία GPU δεν μπορεί να κρατήσει ή να υπολογίσει αρκετά γρήγορα μόνη της.

Τι χωρίζει ο παραλληλισμός τανυστών μεταξύ των GPU;

Ο παραλληλισμός τανυστή (ενδο-στρώμα) κατακερματίζει τους πίνακες βάρους μέσα σε ένα επίπεδο, έτσι κάθε GPU υπολογίζει μέρος του ίδιου στρώματος—διαφορετικό από τον παραλληλισμό αγωγών, ο οποίος τοποθετεί ολόκληρα επίπεδα σε διαφορετικές GPU.

Στο διαχωρισμό MLP τύπου Megatron, πώς κατανέμονται οι δύο πίνακες βάρους για να ελαχιστοποιηθεί η επικοινωνία;

Ο διαχωρισμός του πρώτου πίνακα κατά στήλες επιτρέπει σε κάθε GPU να εφαρμόσει τη μη γραμμικότητα τοπικά. Ο διαχωρισμός του δεύτερου κατά σειρές σημαίνει ότι ένα μόνο άθροισμα όλων των εξόδων αθροίζει τις μερικές εξόδους - ελαχιστοποιώντας τον συγχρονισμό.

Γιατί ο παραλληλισμός τανυστών συνήθως διατηρείται σε έναν μόνο κόμβο;

Κάθε επίπεδο ενεργοποιεί τη συλλογική επικοινωνία (όλα μειώνεται), επομένως η βαριά, ευαίσθητη σε καθυστέρηση κυκλοφορία απαιτεί γρήγορες συνδέσεις εντός κόμβων όπως το NVLink παρά πιο αργά δίκτυα μεταξύ κόμβων.

Πώς παραλληλίζεται συνήθως ο μηχανισμός προσοχής κάτω από τον παραλληλισμό τανυστή;

Οι κεφαλές προσοχής είναι ανεξάρτητες, επομένως κατανέμονται σε όλες τις GPU—κάθε συσκευή υπολογίζει ορισμένες κεφαλές και οι έξοδοι συνδυάζονται.

Ποια συλλογική πράξη συνδυάζει συνήθως μερικά αποτελέσματα σε παραλληλισμό τανυστών;

Το All-reduce αθροίζει τις μερικές εξόδους που υπολογίζονται σε κάθε GPU, ώστε να συμφωνούν για το αποτέλεσμα του επιπέδου. Αυτό συμβαίνει πολλές φορές ανά επίπεδο σε περάσματα προς τα εμπρός και προς τα πίσω.