Τεχνικός ΟΔΗΓΟΣ

Προπόνηση Μικτής Ακρίβειας

Η προπόνηση μεικτής ακρίβειας επιταχύνει την εκπαίδευση νευρωνικών δικτύων και μειώνει τη χρήση της μνήμης εκτελώντας τα περισσότερα μαθηματικά σε κινητή υποδιαστολή 16 bit αντί για 32 bit.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It lets the same GPU train bigger models faster with almost no loss in accuracy.

Βαθιά κατάδυση

Η παραδοσιακή προπόνηση αποθηκεύει βάρη και εκτελεί μαθηματικά σε κινητή υποδιαστολή 32 bit (FP32). Η μικτή ακρίβεια χρησιμοποιεί μορφές 16-bit χαμηλότερης ακρίβειας (FP16 ή bfloat16) για τους πολλαπλασιασμούς βαρέων πινάκων, ενώ διατηρεί ένα «κύριο αντίγραφο» 32-bit των βαρών για σταθερές ενημερώσεις. Επειδή οι αριθμοί 16 bit έχουν το μισό μέγεθος, ταιριάζουν περισσότερο στη μνήμη GPU και οι πυρήνες Tensor τους επεξεργάζονται περίπου 2-8 φορές πιο γρήγορα. Το αλίευμα είναι το στενό εύρος του FP16: οι μικροσκοπικές κλίσεις μπορούν να υποχωρήσουν στο μηδέν. Η τυπική λύση είναι η κλιμάκωση απώλειας, η οποία πολλαπλασιάζει την απώλεια με ένα μεγάλο παράγοντα πριν από την οπίσθια διάδοση, έτσι ώστε οι μικρές κλίσεις να παραμείνουν αναπαραστάσιμες και στη συνέχεια να τις διαιρέσει ξανά πριν από την ενημέρωση βάρους. Το Apex της NVIDIA και το ενσωματωμένο AMP (Automatic Mixed Precision) στο PyTorch και το TensorFlow το αυτοματοποιούν.

Τεχνική διορατικότητα

Το FP16 έχει μόνο 5 bit εκθέτη, δίνοντας ένα μικρό δυναμικό εύρος που προκαλεί υποροή κλίσης. Το Bfloat16 διατηρεί 8 bit εκθέτη (που ταιριάζουν με το εύρος του FP32), αλλά λιγότερα bit mantissa, επομένως σπάνια χρειάζεται κλιμάκωση απώλειας — ένας βασικός λόγος που το ευνοούν οι Google TPU και οι σύγχρονες GPU. Οι πυρήνες τανυστή επιταχύνουν την εργασία πολλαπλασιάζοντας τελεστές 16-bit αλλά συσσωρεύοντας μερικά αθροίσματα στο FP32, διατηρώντας την ακρίβεια όπου διαφορετικά θα συνέβαιναν τα σφάλματα αθροίσματος.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

Το μέλλον της προπόνησης μεικτής ακρίβειας

Η ακρίβεια πέφτει συνεχώς. Η εκπαίδευση FP8, η οποία υποστηρίζεται σε GPU NVIDIA Hopper και Blackwell, γίνεται πρότυπο για τα προηγμένα μοντέλα και η έρευνα σε μορφές FP4 και μικροκλιμάκωσης (MXFP) προωθεί περαιτέρω. Αναμένετε πλαίσια για αυτόματη επιλογή ακρίβειας ανά επίπεδο, υλικό για εγγενή χειρισμό ολοένα στενότερων μορφών και εκπαίδευση με επίγνωση κβαντισμού που θα θολώνουν τη γραμμή μεταξύ εκπαίδευσης χαμηλής ακρίβειας και συμπερασμάτων, συρρικνώνοντας το κόστος εκπαίδευσης μοντέλων τρισεκατομμυρίων παραμέτρων.

Υλοποίηση σε πραγματικό κόσμο

Το torch.cuda.amp.autocast του PyTorch τυλίγει έναν βρόχο εκπαίδευσης για να μειώσει περίπου στο μισό τη μνήμη και να διπλασιάσει την απόδοση σε μια ενιαία GPU

Εκπαίδευση μοντέλων μεγάλων γλωσσών όπως μετασχηματιστές τύπου GPT στο bfloat16 σε TPU για την αποφυγή συντονισμού κλιμάκωσης απώλειας

Τοποθέτηση μεγαλύτερου μεγέθους παρτίδας σε GPU RTX καταναλωτή με εναλλαγή της εκπαίδευσης εικόνας ResNet από FP32 σε FP16

Το FP8 συνδύασε την ακρίβεια στις GPU NVIDIA H100 για να μειώσει το κόστος της προεκπαίδευσης μοντέλων συνοριακής κλίμακας

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixed Precision Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Ψευδο-επισήμανση και αυτοεκπαίδευση

Συχνές ερωτήσεις

What is Mixed Precision Training?

Η προπόνηση μεικτής ακρίβειας επιταχύνει την εκπαίδευση νευρωνικών δικτύων και μειώνει τη χρήση της μνήμης εκτελώντας τα περισσότερα μαθηματικά σε κινητή υποδιαστολή 16 bit αντί για 32 bit. Επιτρέπει στην ίδια GPU να εκπαιδεύει μεγαλύτερα μοντέλα γρηγορότερα χωρίς σχεδόν καμία απώλεια στην ακρίβεια.

Γιατί η προπόνηση μεικτής ακρίβειας διατηρεί ένα «κύριο αντίγραφο» 32-bit των βαρών;

Οι ενημερώσεις βάρους είναι συχνά πολύ μικρές. Η συσσώρευσή τους σε 16-bit θα χάσει την ακρίβεια, επομένως ένα κύριο αντίγραφο πλήρους ακρίβειας διατηρεί τις ενημερώσεις ακριβείς.

Τι πρόβλημα λύνει η κλιμάκωση απώλειας στην προπόνηση FP16;

Το FP16 έχει περιορισμένο δυναμικό εύρος, επομένως οι μικρές διαβαθμίσεις μπορούν να στρογγυλοποιηθούν στο μηδέν. Ο πολλαπλασιασμός της απώλειας πριν από το backprop τα διατηρεί αντιπροσωπεύσιμα.

Τι πλεονέκτημα έχει το bfloat16 έναντι του FP16;

Το Bfloat16 διατηρεί 8 bit εκθέτη όπως το FP32, επομένως το δυναμικό του εύρος είναι μεγάλο και η υπορροή κλίσης είναι σπάνια.

Πώς οι πυρήνες Tensor διατηρούν την ακρίβεια κατά τη χρήση εισόδων 16-bit;

Οι πυρήνες τανυστή πολλαπλασιάζουν τους τελεστές των 16 bit αλλά συσσωρεύονται σε 32 bit, αποτρέποντας τη συνένωση σφαλμάτων άθροισης.

Ποιο είναι το κύριο όφελος από τη χρήση τιμών 16-bit αντί για 32-bit κατά τη διάρκεια της εκπαίδευσης;

Οι αριθμοί μισού μεγέθους χωρούν περισσότερα δεδομένα στη μνήμη GPU και επιτρέπουν στο εξειδικευμένο υλικό να επεξεργάζεται μαθηματικά μήτρα αρκετές φορές πιο γρήγορα.