ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Λανθάνουσα προσοχή πολλαπλών κεφαλών

Η λανθάνουσα προσοχή πολλαπλών κεφαλών (MLA) είναι ένας μηχανισμός προσοχής, που εισήχθη στο DeepSeek-V2, ο οποίος συμπιέζει την κρυφή μνήμη κλειδιού-τιμής που απαιτεί μνήμη σε ένα μικρό κοινόχρηστο λανθάνον διάνυσμα.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

Βαθιά κατάδυση

Όταν ένας μετασχηματιστής δημιουργεί κείμενο, αποθηκεύει ένα διάνυσμα κλειδιού και τιμής για κάθε προηγούμενο διακριτικό σε μια «κρυφή μνήμη KV». Αυτή η κρυφή μνήμη μεγαλώνει με το μήκος περιβάλλοντος και κυριαρχεί στη χρήση της μνήμης κατά τη διάρκεια της εξαγωγής συμπερασμάτων. Το MLA αντικαθιστά τα πολλά διανύσματα κλειδιού/τιμής πλήρους μεγέθους με ένα ενιαίο λανθάνον διάνυσμα χαμηλής κατάταξης ανά διακριτικό και, στη συνέχεια, προβάλλει αυτό το λανθάνον αντίγραφο ασφαλείας σε κλειδιά και τιμές ανά κεφαλή αμέσως. Επειδή μόνο το συμπαγές λανθάνον στοιχείο αποθηκεύεται προσωρινά, το DeepSeek-V2 ανέφερε μείωση της μνήμης κρυφής μνήμης KV κατά πάνω από 90% έναντι της τυπικής προσοχής πολλαπλών κεφαλών, επιτρέποντας μεγαλύτερα περιβάλλοντα και μεγαλύτερα μεγέθη παρτίδας. Είναι πολύ σημαντικό ότι οι πίνακες ανοδικής προβολής μπορούν να διπλωθούν σε άλλα βάρη, έτσι το MLA επιτυγχάνει αυτή τη συμπίεση με μικρή ή καθόλου μετρήσιμη απώλεια στην ποιότητα μοντελοποίησης.

Τεχνική διορατικότητα

Το MLA εκτελεί συμπίεση άρθρωσης χαμηλής βαθμίδας: η κρυφή κατάσταση κάθε διακριτικού προβάλλεται σε ένα μικρό λανθάνον διάνυσμα και ξεχωριστοί πίνακες άνω προβολής ανασυνθέτουν τα κλειδιά και τις τιμές ανά κεφαλή. Ένα έξυπνο τέχνασμα είναι η «απορρόφηση» των βαρών ανοδικής προβολής στις προβολές ερωτήματος και εξόδου, έτσι ώστε το μοντέλο να μην υλοποιεί ποτέ τα πλήρη κλειδιά/τιμές κατά τη διάρκεια της εξαγωγής συμπερασμάτων. Οι ενσωματώσεις περιστροφικής θέσης αντιμετωπίζονται με μια αποσυνδεδεμένη διαδρομή κλειδιού, καθώς η περιστροφή δεν μπορεί να απορροφηθεί με τον ίδιο τρόπο, διατηρώντας τις πληροφορίες θέσης.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον της λανθάνουσας προσοχής πολλαπλών κεφαλών

Το MLA βοήθησε να γίνουν τα DeepSeek-V2 και V3 οικονομικά για να εξυπηρετηθούν σε κλίμακα και η τεχνική εξαπλώνεται καθώς οι ομάδες κυνηγούν φθηνότερα συμπεράσματα μακροπρόθεσμου πλαισίου. Αναμένετε ότι η λανθάνουσα συμπίεση τύπου MLA θα συνδυαστεί με αραιά επίπεδα Mixture-of-Experts, κβαντισμένες κρυφές μνήμες και κερδοσκοπική αποκωδικοποίηση σε μελλοντικά ανοιχτά μοντέλα. Οι ερευνητές διερευνούν επίσης πόσο μπορεί να συρρικνωθεί η λανθάνουσα διάσταση πριν πέσει η ποιότητα και αν η ίδια ιδέα χαμηλής βαθμίδας μπορεί να συμπιέσει την προσοχή κατά τη διάρκεια της προπόνησης, όχι μόνο να συναγάγει συμπεράσματα.

Υλοποίηση σε πραγματικό κόσμο

Εξυπηρέτηση μοντέλων συνομιλίας DeepSeek-V2/V3 με δραματικά μικρότερο αποτύπωμα μνήμης GPU ανά αίτημα

Εκτέλεση ερώτησης μεγάλου εγγράφου που απαντά όπου μια μεγάλη κρυφή μνήμη KV θα εξαντλούσε διαφορετικά τη VRAM

Αύξηση του μεγέθους παρτίδας συμπερασμάτων σε μια σταθερή GPU επειδή κάθε ακολουθία αποθηκεύει μόνο ένα μικροσκοπικό λανθάνον διάνυσμα

Ενεργοποίηση μακρύτερων παραθύρων περιβάλλοντος στο υλικό βασικών προϊόντων για βοηθούς επαυξημένης ανάκτησης

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Προσοχή πολλαπλών ερωτημάτων

Συχνές ερωτήσεις

What is Multi-Head Latent Attention?

Η λανθάνουσα προσοχή πολλαπλών κεφαλών (MLA) είναι ένας μηχανισμός προσοχής, που εισήχθη στο DeepSeek-V2, ο οποίος συμπιέζει την κρυφή μνήμη κλειδιού-τιμής που απαιτεί μνήμη σε ένα μικρό κοινόχρηστο λανθάνον διάνυσμα. Επιτρέπει σε μοντέλα μεγάλων γλωσσών να λειτουργούν με πολύ λιγότερη μνήμη GPU, διατηρώντας παράλληλα την ποιότητα κοντά στην τυπική προσοχή.

Ποιο είναι το κύριο πρόβλημα που έχει σχεδιαστεί για τη μείωση της λανθάνουσας προσοχής πολλαπλών κεφαλών;

Το MLA στοχεύει την κρυφή μνήμη KV, η οποία μεγαλώνει με το μήκος περιβάλλοντος και κυριαρχεί στη μνήμη κατά τη δημιουργία κειμένου.

Πώς το MLA συρρικνώνει την κρυφή μνήμη KV;

Το MLA αποθηκεύει στην κρυφή μνήμη ένα συμπαγές λανθάνον διάνυσμα ανά διακριτικό και αναδομεί κλειδιά και τιμές από αυτό μέσω up-projection.

Ποιο μοντέλο παρουσίασε για πρώτη φορά το Multi-Head Latent Attention;

Το MLA εισήχθη από το DeepSeek στο μοντέλο DeepSeek-V2 και μεταφέρθηκε στο DeepSeek-V3.

Γιατί το MLA χρειάζεται μια ξεχωριστή «αποσυνδεδεμένη» διαδρομή για ενσωματώσεις περιστροφικής θέσης;

Ο περιστροφικός μετασχηματισμός δεν μπορεί να απορροφηθεί σε άλλους πίνακες βάρους, επομένως το MLA διατηρεί ένα μικρό αποσυνδεδεμένο βασικό στοιχείο για τη μεταφορά πληροφοριών θέσης.

Πόσο περίπου μείωση της μνήμης προσωρινής μνήμης KV ανέφερε το DeepSeek-V2 από το MLA έναντι της τυπικής προσοχής πολλαπλών κεφαλών;

Το DeepSeek-V2 ανέφερε μείωση της μνήμης cache KV κατά περισσότερο από 90%, επιτρέποντας μεγαλύτερα περιβάλλοντα και μεγαλύτερες παρτίδες.