ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Κβαντισμός

Η κβαντοποίηση συρρικνώνει ένα μοντέλο τεχνητής νοημοσύνης αποθηκεύοντας τους αριθμούς του με χαμηλότερη ακρίβεια, έτσι ένα μοντέλο που χρειαζόταν μια GPU κέντρου δεδομένων μπορεί μερικές φορές να λειτουργεί σε φορητό υπολογιστή ή τηλέφωνο.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Βαθιά κατάδυση

Ένα νευρωνικό δίκτυο είναι ως επί το πλείστον ένας τεράστιος σωρός αριθμών που ονομάζονται βάρη, που συνήθως αποθηκεύονται ως τιμές κινητής υποδιαστολής 16 ή 32 bit. Η κβαντοποίηση αποθηκεύει εκ νέου αυτά τα βάρη χρησιμοποιώντας λιγότερα bit, συνήθως 8-bit (INT8) ή ακόμα και ακέραιους αριθμούς 4-bit. Η μετάβαση από τα 16-bit στα 4-bit μειώνει τη μνήμη κατά προσέγγιση τέσσερις φορές, επομένως ένα μοντέλο 70 δισεκατομμυρίων παραμέτρων που χρειάζεται περίπου 140 GB στα 16-bit μπορεί να χωρέσει περίπου 35 GB στα 4-bit. Οι μικρότεροι αριθμοί κινούνται επίσης στη μνήμη πιο γρήγορα, κάτι που συνήθως επιταχύνει τη δημιουργία. Η σύλληψη είναι η ακρίβεια: η συμπίεση ενός μεγάλου εύρους τιμών σε λίγα επίπεδα εισάγει σφάλμα στρογγυλοποίησης. Οι καλές μέθοδοι ελαχιστοποιούν αυτή την απώλεια επιλέγοντας προσεκτικά τους παράγοντες κλιμάκωσης και προστατεύοντας τα πιο ευαίσθητα βάρη, έτσι ώστε το μοντέλο να συμπεριφέρεται σχεδόν πανομοιότυπα ενώ χρησιμοποιεί ένα κλάσμα των πόρων.

Τεχνική διορατικότητα

Κάθε ομάδα βαρών λαμβάνει έναν παράγοντα κλίμακας που αντιστοιχίζει τις πραγματικές τιμές σε ένα μικρό σύνολο ακεραίων αριθμών. πολλαπλασιάζοντας με την κλίμακα ανακατασκευάζει περίπου τον αρχικό αριθμό. Μέθοδοι κβαντοποίησης μετά την εκπαίδευση, όπως το GPTQ και το AWQ, αναλύουν ένα μικρό σύνολο δεδομένων βαθμονόμησης για να αποφασίσουν ποια βάρη έχουν μεγαλύτερη σημασία και ορίζουν κλίμακες για να ελαχιστοποιήσετε το σφάλμα εξόδου, αντί να στρογγυλοποιήσετε τα πάντα στα τυφλά. Οι ενεργοποιήσεις διατηρούνται συχνά με μεγαλύτερη ακρίβεια επειδή ποικίλλουν περισσότερο κατά το χρόνο εκτέλεσης. Το αποτέλεσμα είναι ένα μοντέλο που αποθηκεύει ακέραιους αριθμούς 4-bit, αλλά υπολογίζει αποτελέσματα πολύ κοντά στην έκδοση πλήρους ακρίβειας.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον της κβαντοποίησης

Αναμένετε η κβαντοποίηση να γίνει η προεπιλογή αντί για βελτιστοποίηση. Οι προμηθευτές υλικού προσθέτουν εγγενή υποστήριξη 4-bit και ακόμη και χαμηλότερων bit, και τεχνικές όπως η εκπαίδευση με επίγνωση κβαντισμού ψήνουν την ανοχή για χαμηλή ακρίβεια στο μοντέλο από την αρχή, μειώνοντας περαιτέρω την απώλεια ακρίβειας. Η έρευνα σε αναπαραστάσεις 2 bit και 1 bit (δυαδικών) είναι ενεργή, με στόχο την εκτέλεση ικανών μοντέλων σε τηλέφωνα και ενσωματωμένα τσιπ. Καθώς η τεχνητή νοημοσύνη στη συσκευή και η ιδιωτική τεχνητή νοημοσύνη αναπτύσσονται, τα αποδοτικά κβαντοποιημένα μοντέλα θα είναι κεντρικής σημασίας για την τοπική λειτουργία των βοηθών χωρίς αποστολή δεδομένων στο cloud.

Υλοποίηση σε πραγματικό κόσμο

Εκτέλεση ενός μοντέλου συνομιλίας όπως το Llama τοπικά σε μια GPU καταναλωτή χρησιμοποιώντας αρχεία GGUF ή GPTQ 4 bit αντί να χρειάζονται πολλές κάρτες κέντρων δεδομένων.

Οι βοηθοί στη συσκευή σε τηλέφωνα, όπου τα μοντέλα 8-bit ή 4-bit επιτρέπουν στις λειτουργίες ομιλίας και κειμένου να εκτελούνται χωρίς σύνδεση δικτύου.

Μείωση του κόστους συμπερασμάτων cloud για ένα bot υποστήριξης πελατών, εξυπηρετώντας ένα μοντέλο INT8, προσαρμόζοντας περισσότερα αιτήματα σε κάθε GPU.

Συσκευές αιχμής, όπως έξυπνες κάμερες ή αισθητήρες IoT που εκτελούν συμπαγή κβαντοποιημένα μοντέλα γλώσσας όρασης εντός αυστηρών ορίων μνήμης.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Υπολειμματική διανυσματική κβαντοποίηση

Συχνές ερωτήσεις

What is Quantization?

Η κβαντοποίηση συρρικνώνει ένα μοντέλο τεχνητής νοημοσύνης αποθηκεύοντας τους αριθμούς του με χαμηλότερη ακρίβεια, έτσι ένα μοντέλο που χρειαζόταν μια GPU κέντρου δεδομένων μπορεί μερικές φορές να λειτουργεί σε φορητό υπολογιστή ή τηλέφωνο. Είναι το κύριο τέχνασμα που κάνει τα μεγάλα μοντέλα γλωσσών φθηνά και αρκετά γρήγορα για να αναπτυχθούν ευρέως.

Τι αλλάζει πρωτίστως η κβαντοποίηση σε ένα νευρωνικό δίκτυο;

Η κβαντοποίηση αποθηκεύει εκ νέου τα βάρη του μοντέλου με χαμηλότερη αριθμητική ακρίβεια, όπως ακέραιους αριθμούς 8 bit ή 4 bit αντί για floats 16 ή 32 bit.

Πόση περίπου μνήμη εξοικονομείται μετατοπίζοντας τα βάρη από 16-bit σε 4-bit;

Τα 4 bit είναι το ένα τέταρτο των 16 bit, επομένως η αποθήκευση βάρους πέφτει περίπου στο ένα τέταρτο, δηλαδή περίπου 4 φορές μείωση.

Ποιο είναι το κύριο μειονέκτημα της επιθετικής κβαντοποίησης;

Η αναπαράσταση τιμών με λιγότερα επίπεδα εισάγει σφάλμα στρογγυλοποίησης, το οποίο μπορεί να υποβαθμίσει την ποιότητα εξόδου εάν δεν διαχειρίζεται προσεκτικά.

Σε τι χρησιμεύουν μέθοδοι όπως το GPTQ και το AWQ ένα μικρό σύνολο δεδομένων βαθμονόμησης;

Αυτές οι μέθοδοι μετά την εκπαίδευση αναλύουν μερικές εισόδους δειγμάτων για να ρυθμίσουν τους παράγοντες κλιμάκωσης και να προστατεύσουν τα ευαίσθητα βάρη, διατηρώντας τα αποτελέσματα κοντά στο πρωτότυπο.

Γιατί η κβαντοποίηση συχνά κάνει ένα μοντέλο πιο γρήγορο, όχι απλώς μικρότερο;

Οι τιμές χαμηλότερης ακρίβειας απαιτούν λιγότερο εύρος ζώνης μνήμης για να φορτωθούν και να μετακινηθούν, κάτι που είναι συχνά το σημείο συμφόρησης κατά τη διάρκεια της παραγωγής, επομένως η εξαγωγή συμπερασμάτων επιταχύνεται.