Παραλληλισμός μοντέλου και αγωγών
Όταν ένα μοντέλο είναι πολύ μεγάλο για να χωρέσει σε μία GPU, ο παραλληλισμός μοντέλου και αγωγού χωρίζει το ίδιο το μοντέλο σε όλες τις συσκευές.
Επισκόπηση
This is what makes training giant language models with hundreds of billions of parameters physically possible.
Βαθιά κατάδυση
Ο παραλληλισμός μοντέλων χωρίζει ένα μοντέλο σε πολλές GPU, έτσι ώστε καμία συσκευή να μην χρειάζεται να κρατά όλα τα βάρη. Υπάρχουν δύο κύριες γεύσεις. Ο παραλληλισμός τανυστή (ενδο-στρώμα) χωρίζει τα μαθηματικά μέσα σε ένα επίπεδο, όπως η κοπή ενός μεγάλου πολλαπλασιασμού μήτρας στις GPU που κάθε μία υπολογίζει μέρος της εξόδου. Ο παραλληλισμός Pipeline (inter-layer) εκχωρεί διαφορετικά διαδοχικά επίπεδα σε διαφορετικές GPU, επομένως το μπλοκ στρώματος 1 ζει στη GPU 0, το μπλοκ 2 στη GPU 1 και ούτω καθεξής, με ενεργοποιήσεις που περνούν προς τα εμπρός σαν γραμμή συναρμολόγησης. Η πρόκληση με την αφελή διοχέτευση είναι η «φούσκα»: ενώ η GPU 0 λειτουργεί στην πρώτη παρτίδα, οι κατάντη GPU παραμένουν σε αδράνεια. Το Pipelining χωρίζει κάθε παρτίδα σε μικρο-παρτίδες, ώστε όλα τα στάδια να παραμένουν απασχολημένα, βελτιώνοντας δραματικά τη χρήση.
Τεχνική διορατικότητα
Ο παραλληλισμός τανυστή (όπως στο NVIDIA Megatron-LM) διαχωρίζει τους πίνακες βάρους κατά στήλη ή γραμμή και χρησιμοποιεί τη μείωση όλων για τον ανασυνδυασμό μερικών αποτελεσμάτων, διατηρώντας την επικοινωνία μέσα σε έναν γρήγορο κόμβο NVLink. Ο παραλληλισμός αγωγών (GPipe, PipeDream) διαιρεί την παρτίδα σε μικρο-παρτίδες που ρέουν μέσα από στάδια σε κλιμακωτό χρονοδιάγραμμα, συρρικνώνοντας τον χρόνο αδράνειας «φούσκα». Τα δύο είναι συχνά στρωμένα μαζί, με παραλληλισμό τανυστών μέσα σε έναν κόμβο και παραλληλισμό αγωγών μεταξύ των κόμβων.
Στρατηγικός αντίκτυπος
Κόστος και προϋπολογισμός
Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.
Σαφέστερες αποφάσεις
Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.
Ελεγχος ποιότητας
Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.
The Future of Model and Pipeline Parallelism
Τα πλαίσια αυτοματοποιούν ολοένα και περισσότερο το δύσκολο πρόβλημα της απόφασης πώς να χωρίσετε ένα μοντέλο σε συσκευές, χρησιμοποιώντας προφίλ και αναζήτηση για να εξισορροπήσετε τον υπολογισμό και την επικοινωνία. Αναμένετε στενότερη ενσωμάτωση τανυστή, αγωγού και παραλληλισμού δεδομένων (3D παραλληλισμός), πιο έξυπνο προγραμματισμό μικρο-παρτίδας για σχεδόν εξάλειψη των φυσαλίδων αγωγών και υλικό με ταχύτερες διασυνδέσεις, ώστε ο διαχωρισμός ενός μόνο στρώματος στα τσιπ να γίνεται φθηνότερος και πιο συνηθισμένος για ολοένα μεγαλύτερα μοντέλα.
Υλοποίηση σε πραγματικό κόσμο
Εκπαίδευση μοντέλων τύπου GPT με NVIDIA Megatron-LM, το οποίο διαχωρίζει την προσοχή κάθε επιπέδου μετασχηματιστή και τους πίνακες τροφοδοσίας σε όλες τις GPU μέσω παραλληλισμού τανυστών.
Η χρήση του GPipe για την τοποθέτηση διαφορετικών επιπέδων ενός γιγαντιαίου οράματος ή μοντέλου γλώσσας σε ξεχωριστούς επιταχυντές ενώ η μικρο-παρτίδα τους κρατά απασχολημένους.
Ο κινητήρας σωλήνων της DeepSpeed χωρίζει ένα μοντέλο πολλών εκατοντάδων δισεκατομμυρίων παραμέτρων σε στάδια σε πολλούς κόμβους.
Συνδυασμός παραλληλισμού τανυστών μέσα σε έναν μόνο διακομιστή 8 GPU με παραλληλισμό διοχέτευσης που εκτείνεται σε πολλούς διακομιστές για την εκπαίδευση ενός μοντέλου πολύ μεγάλου για ένα μηχάνημα.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.
Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.
Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.
Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.
Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.
Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model and Pipeline Parallelism quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Παραλληλισμός τανυστών για μεγάλα μοντέλα
Συχνές ερωτήσεις
What is Model and Pipeline Parallelism?
Όταν ένα μοντέλο είναι πολύ μεγάλο για να χωρέσει σε μία GPU, ο παραλληλισμός μοντέλου και αγωγού χωρίζει το ίδιο το μοντέλο σε όλες τις συσκευές. Αυτό είναι που κάνει την εκπαίδευση γιγάντια γλωσσικά μοντέλα με εκατοντάδες δισεκατομμύρια παραμέτρους φυσικά δυνατή.
Ποιο θεμελιώδες πρόβλημα λύνει ο παραλληλισμός μοντέλων και αγωγών;
Ο παραλληλισμός μοντέλων και σωλήνων διαχωρίζουν το ίδιο το μοντέλο σε όλες τις συσκευές, επιτρέποντας την εκπαίδευση δικτύων πολύ μεγαλύτερα από ό,τι θα μπορούσε να χωρέσει οποιαδήποτε μεμονωμένη GPU.
Πώς λειτουργεί η διαίρεση του παραλληλισμού τανυστή (ενδοστρωματική);
Ο παραλληλισμός τανυστή διαιρεί τον υπολογισμό σε ένα μόνο επίπεδο, για παράδειγμα χωρίζοντας έναν πίνακα μεγάλου βάρους έτσι ώστε κάθε GPU να υπολογίζει μέρος της εξόδου.
Ποια είναι η «φούσκα» στον αφελή παραλληλισμό αγωγών;
Αρχικά σε ένα βήμα διοχέτευσης, τα κατάντη στάδια δεν έχουν ακόμη είσοδο και παραμένουν σε αδράνεια, χάνοντας χρόνο GPU. αυτό το αδρανές κενό ονομάζεται φούσκα.
Πώς ο παραλληλισμός αγωγών μειώνει τη φούσκα;
Η διαίρεση μιας παρτίδας σε μικρο-παρτίδες επιτρέπει σε πολλές μικρο-παρτίδες να καταλαμβάνουν διαφορετικά στάδια ταυτόχρονα, διατηρώντας όλες τις GPU απασχολημένες και μειώνοντας τον χρόνο αδράνειας.
Γιατί ο παραλληλισμός τανυστών συνήθως διατηρείται σε έναν μόνο κόμβο;
Ο παραλληλισμός τανυστών επικοινωνεί συχνά για να ανασυνδυάσει τα αποτελέσματα μερικής μήτρας, έτσι τοποθετείται όπου το εύρος ζώνης διασύνδεσης είναι το υψηλότερο, μέσα σε έναν κόμβο πάνω από το NVLink.