ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Προσοχή πολλαπλών ερωτημάτων

Το Multi-Query Attention (MQA) είναι μια εξοικονόμηση μνήμης στην προσοχή του μετασχηματιστή που μοιράζεται ένα σύνολο πλήκτρων και τιμών σε όλες τις κεφαλές προσοχής.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Βαθιά κατάδυση

Η τυπική προσοχή πολλών κεφαλών δίνει σε κάθε κεφαλή τις δικές της προβολές ερωτημάτων, κλειδιών και τιμών. Κατά τη διάρκεια της δημιουργίας, τα κλειδιά και οι τιμές για όλα τα προηγούμενα διακριτικά πρέπει να αποθηκευτούν προσωρινά και να φορτωθούν ξανά σε κάθε βήμα — αυτή η κρυφή μνήμη KV γίνεται το κύριο σημείο συμφόρησης, καθώς η ανάγνωσή της από τη μνήμη είναι πιο αργή από τα ίδια τα μαθηματικά. Το Multi-Query Attention, που προτάθηκε από τον Noam Shazeer το 2019, διατηρεί ξεχωριστές προβολές ερωτημάτων ανά κεφαλή, αλλά συμπτύσσει τα κλειδιά και τις τιμές σε μια ενιαία κοινόχρηστη κεφαλή. Αυτό συρρικνώνει την κρυφή μνήμη KV κατά έναν παράγοντα ίσο με τον αριθμό των κεφαλών, μερικές φορές 8x έως 64x μικρότερο. Το αποτέλεσμα είναι πολύ ταχύτερη αυτοπαλινδρομική αποκωδικοποίηση και ελαφρύτερο αποτύπωμα μνήμης, με μέτρια μόνο βουτιά ποιότητας. Μια μέση λύση, το Grouped-Query Attention, εξισορροπεί την ανταλλαγή.

Τεχνική διορατικότητα

Στο MQA, τα βάρη ερωτημάτων εξακολουθούν να παράγουν H ξεχωριστά διανύσματα ερωτήματος, αλλά μια προβολή μεμονωμένου κλειδιού και η προβολή μιας τιμής μοιράζονται σε όλες τις κεφαλές. Κάθε κεφαλή υπολογίζει την προσοχή χρησιμοποιώντας το δικό της ερώτημα σε σχέση με τα ίδια κλειδιά και τιμές. Επειδή οι αποθηκευμένοι τανυστές K και V δεν κλιμακώνονται πλέον με τον αριθμό των κεφαλών, το εύρος ζώνης της μνήμης κατά την αποκωδικοποίηση μειώνεται απότομα — και το εύρος ζώνης, όχι ο υπολογισμός, είναι αυτό που ρυθμίζει την ταχύτητα παραγωγής πυλών στους σύγχρονους επιταχυντές.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον της προσοχής πολλαπλών ερωτημάτων

Το MQA καθόρισε ότι μπορείτε να κλαδέψετε πλεονάζουσες κεφαλές κλειδιών/τιμών με μικρή ζημιά και αυτή η γνώση διαμορφώνει πλέον σχεδόν κάθε LLM γρήγορης εξαγωγής συμπερασμάτων. Το πεδίο έχει συγκλίνει σε μεγάλο βαθμό στο Grouped-Query Attention (GQA), που χρησιμοποιείται στο Llama 2/3 και σε πολλά άλλα, το οποίο χρησιμοποιεί μερικές ομάδες KV αντί για μία για την ανάκτηση της ποιότητας διατηρώντας παράλληλα το μεγαλύτερο μέρος της επιτάχυνσης. Η μελλοντική εργασία συνδυάζει αυτές τις ιδέες με συμπίεση κρυφής μνήμης KV, κβαντοποίηση και πολυλανθάνουσα προσοχή για να προωθήσει μεγαλύτερα περιβάλλοντα και φθηνότερη εξυπηρέτηση.

Υλοποίηση σε πραγματικό κόσμο

Επιτάχυνση δημιουργίας διακριτικών σε βοηθούς συνομιλίας όπου η κρυφή μνήμη KV, όχι ο ακατέργαστος υπολογισμός, περιορίζει την απόδοση.

Το PALM του Google, το οποίο χρησιμοποιούσε την Προσοχή πολλαπλών ερωτημάτων για να επιτρέψει την αποτελεσματική εξαγωγή συμπερασμάτων μεγάλης κλίμακας.

Εξυπηρέτηση πολλών ταυτόχρονων χρηστών σε μία GPU με συρρίκνωση της κρυφής μνήμης KV ανά αίτημα.

Προσοχή ομαδικού ερωτήματος στο Llama 2 70B και στο Llama 3, ένας άμεσος απόγονος που εξισορροπεί την ταχύτητα του MQA με την ποιότητα πλήρους προσοχής.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Ομαδοποιημένο ερώτημα Προσοχή

Συχνές ερωτήσεις

What is Multi-Query Attention?

Το Multi-Query Attention (MQA) είναι μια εξοικονόμηση μνήμης στην προσοχή του μετασχηματιστή που μοιράζεται ένα σύνολο πλήκτρων και τιμών σε όλες τις κεφαλές προσοχής. Επιταχύνει δραματικά τη δημιουργία κειμένου μειώνοντας τη μνήμη που πρέπει να ανακατέψει το μοντέλο.

Τι μοιράζεται η Προσοχή πολλαπλών ερωτημάτων σε όλες τις κεφαλές προσοχής;

Το MQA διατηρεί ξεχωριστά ερωτήματα ανά κεφάλι, αλλά μοιράζεται μία προβολή κλειδιού και μία προβολή τιμής σε όλες τις κεφαλές.

Ποιο είναι το κύριο σημείο συμφόρησης που αντιμετωπίζει το MQA κατά τη διάρκεια της αυτοπαλινδρομικής παραγωγής;

Η επαναφόρτωση της μεγάλης κρυφής μνήμης KV κάθε βήμα είναι δεσμευμένο σε εύρος ζώνης. Το MQA συρρικνώνει αυτήν την κρυφή μνήμη για να επιταχύνει την αποκωδικοποίηση.

Με ποιον περίπου παράγοντα συρρικνώνει το MQA την κρυφή μνήμη KV;

Εφόσον τα κλειδιά και οι τιμές συμπτύσσονται από κεφαλές H σε μία, η κρυφή μνήμη συρρικνώνεται κατά περίπου τον αριθμό κεφαλών.

Ποιος είναι ο κύριος συμβιβασμός της χρήσης του MQA;

Η κοινή χρήση κλειδιών και τιμών μειώνει ελαφρώς την ικανότητα αναπαράστασης, προκαλώντας μια μικρή μείωση της ποιότητας σε αντάλλαγμα για μεγάλα κέρδη ταχύτητας.

Ποια παραλλαγή βρίσκεται μεταξύ της τυπικής προσοχής πολλαπλών κεφαλών και του MQA;

Το Grouped-Query Attention (GQA) χρησιμοποιεί πολλές ομάδες KV αντί για μία, εξισορροπώντας την ποιότητα και την ταχύτητα.