ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Ομαδοποιημένο ερώτημα Προσοχή

Το Grouped-Query Attention (GQA) είναι ένας τρόπος συρρίκνωσης της μνήμης που απαιτείται κατά τη δημιουργία κειμένου, αφήνοντας πολλές κεφαλές ερωτημάτων να μοιράζονται τις ίδιες κεφαλές κλειδιών και τιμών.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Κάνει τα μεγάλα μοντέλα πολύ πιο γρήγορα στο σερβίρισμα χωρίς σχεδόν καμία απώλεια ποιότητας.

Βαθιά κατάδυση

Σε ένα τυπικό επίπεδο προσοχής πολλαπλών κεφαλών, κάθε κεφαλή έχει τα δικά της ερωτήματα, κλειδιά και τιμές. Κατά τη διάρκεια της δημιουργίας, τα κλειδιά και οι τιμές για όλα τα προηγούμενα διακριτικά αποθηκεύονται στην κρυφή μνήμη (η «κρυφή μνήμη KV»), ώστε το μοντέλο να μην τα υπολογίζει εκ νέου. Με πολλές κεφαλές και μεγάλα περιβάλλοντα, αυτή η κρυφή μνήμη γίνεται τεράστια και κυριαρχεί στο εύρος ζώνης της μνήμης κατά τον χρόνο συμπερασμάτων. Το GQA, που εισήχθη από τους ερευνητές Google το 2023, ομαδοποιεί τις κεφαλές ερωτημάτων και δίνει σε κάθε ομάδα ένα κοινό κοινό σύνολο κεφαλών κλειδιών και τιμών. Εάν έχετε 32 κεφαλές ερωτημάτων αλλά μόνο 8 ομάδες KV, η κρυφή μνήμη KV συρρικνώνεται περίπου τέσσερις φορές. Αυτό βρίσκεται μεταξύ της πλήρους προσοχής πολλαπλών κεφαλών (κάθε κεφαλή ξεχωριστά) και της προσοχής πολλών ερωτημάτων (ένα κοινό KV για όλες τις κεφαλές), καταγράφοντας το μεγαλύτερο μέρος της ταχύτητας του MQA, διατηρώντας παράλληλα την ποιότητα κοντά στην πλήρη προσοχή. Το Llama 2 70B και πολλά μεταγενέστερα μοντέλα το υιοθέτησαν.

Τεχνική διορατικότητα

Η ποιότητα προσοχής εξαρτάται σε μεγάλο βαθμό από την ύπαρξη πολλών ξεχωριστών οδηγιών ερωτημάτων, αλλά ανέχεται την κοινή χρήση κλειδιών και τιμών. Το GQA εκμεταλλεύεται αυτήν την ασυμμετρία: διατηρεί όλες τις κεφαλές ερωτημάτων, αλλά αναπαράγει κάθε κοινόχρηστη κεφαλή KV στα ερωτήματα της ομάδας του. Η εξοικονόμηση προκύπτει από το συμπέρασμα, όπου η κρυφή μνήμη KV είναι ο κύριος καταναλωτής του εύρους ζώνης μνήμης. λιγότερες κεφαλές KV σημαίνουν λιγότερα δεδομένα για ανάγνωση ανά διακριτικό που δημιουργείται. Τα μοντέλα συχνά «εκπαιδεύονται» για λίγο για να μετατρέψουν ένα υπάρχον σημείο ελέγχου πολλαπλών κεφαλών σε GQA.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον του ομαδικού ερωτήματος Προσοχή

Το GQA είναι πλέον μια τυπική προεπιλογή σε μοντέλα ανοιχτού βάρους, επειδή ανταλλάσσει καθαρά ένα μικρό κόστος ποιότητας για μεγάλες νίκες σερβιρίσματος. Αναμένετε να συνδυάζεται όλο και περισσότερο με άλλα κόλπα απόδοσης όπως το FlashAttention, η κβαντοποίηση της κρυφής μνήμης KV και νεότερα σχήματα όπως η λανθάνουσα προσοχή πολλαπλών κεφαλών που συμπιέζουν ακόμη περισσότερο τη μνήμη cache. Καθώς τα παράθυρα περιβάλλοντος μεγαλώνουν, ο έλεγχος του μεγέθους της κρυφής μνήμης KV θα παραμείνει κεντρικό πρόβλημα σχεδιασμού και η κοινή χρήση κεφαλών σε στυλ GQA θα παραμείνει βασικός μοχλός.

Υλοποίηση σε πραγματικό κόσμο

Το Llama 2 70B και το Llama 3 χρησιμοποιούν GQA για την εξυπηρέτηση μεγάλων πλαισίων με μικρότερη κρυφή μνήμη KV

Μείωση της μνήμης GPU, ώστε ένα μεγάλο μοντέλο συνομιλίας να ταιριάζει σε λιγότερους ή φθηνότερους επιταχυντές

Επιτάχυνση δημιουργίας διακριτικών σε διακριτικά σε API παραγωγής όπου το εύρος ζώνης της κρυφής μνήμης KV είναι το σημείο συμφόρησης

Ενεργοποίηση μεγαλύτερων μεγεθών παρτίδας για την εξυπηρέτηση πολλών χρηστών ταυτόχρονα χωρίς εξάντληση της μνήμης

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Προσοχή πολλαπλών ερωτημάτων

Συχνές ερωτήσεις

Τι είναι η Προσοχή σε Ομαδοποιημένα Ερωτήματα;

Το Grouped-Query Attention (GQA) είναι ένας τρόπος συρρίκνωσης της μνήμης που απαιτείται κατά τη δημιουργία κειμένου, αφήνοντας πολλές κεφαλές ερωτημάτων να μοιράζονται τις ίδιες κεφαλές κλειδιών και τιμών. Κάνει τα μεγάλα μοντέλα πολύ πιο γρήγορα στην εξυπηρέτηση χωρίς σχεδόν καμία απώλεια ποιότητας.

Στο Grouped-Query Attention, τι είναι κοινόχρηστο μεταξύ μιας ομάδας κεφαλών ερωτημάτων;

Το GQA διατηρεί ξεχωριστές κεφαλές ερωτημάτων, αλλά επιτρέπει σε κάθε ομάδα από αυτές να μοιράζεται ένα σύνολο κεφαλών κλειδιών και τιμών, συρρικνώνοντας την κρυφή μνήμη KV.

Το GQA περιγράφεται καλύτερα ως η μέση λύση ανάμεσα σε ποια δύο άκρα;

Η πολλαπλή κεφαλή δίνει σε κάθε κεφαλή το δικό της KV. πολλαπλών ερωτημάτων μοιράζεται ένα KV για όλες τις κεφαλές. Το GQA βρίσκεται ενδιάμεσα με μερικές ομάδες KV.

Ποιο μέρος της εξαγωγής συμπερασμάτων κάνει κατά κύριο λόγο φθηνότερο το GQA;

Η εξοικονόμηση εμφανίζεται κατά την παραγωγή, όπου η ανάγνωση της κρυφής μνήμης KV είναι το κυρίαρχο κόστος εύρους ζώνης μνήμης.

Εάν ένα μοντέλο έχει 32 κεφαλές ερωτημάτων και ομάδες 8 KV, η κρυφή μνήμη KV μειώνεται κατά περίπου ποιον παράγοντα;

32 κεφαλές ερωτήματος διαιρούμενες με 8 κοινόχρηστες ομάδες KV δίνουν περίπου τετραπλάσια μείωση στα κρυφά κλειδιά και τις τιμές.

Γιατί μπορεί η GQA να διατηρήσει το μεγαλύτερο μέρος της ποιότητας του μοντέλου παρά το ότι μοιράζεται τις κεφαλές KV;

Η Προσοχή ανέχεται πολύ καλύτερα την κοινή χρήση κλειδιών και τιμών από ό,τι ανέχεται την απώλεια διακριτών οδηγιών ερωτημάτων, επομένως το GQA διατηρεί την ποιότητα σε υψηλά επίπεδα.