ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

KV Cache

Η κρυφή μνήμη KV αποθηκεύει τα διανύσματα κλειδιών και τιμών που έχει ήδη υπολογίσει ένας μετασχηματιστής για προηγούμενα διακριτικά, επομένως δεν χρειάζεται να τα υπολογίζει εκ νέου για κάθε νέα λέξη που δημιουργεί.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.

Βαθιά κατάδυση

Οι μετασχηματιστές δημιουργούν κείμενο ένα διακριτικό τη φορά και το επίπεδο προσοχής κάθε νέου διακριτικού πρέπει να συγκρίνεται με κάθε προηγούμενο διακριτικό. Ο μηχανισμός προσοχής μετατρέπει κάθε διακριτικό σε ένα διάνυσμα ερωτήματος, κλειδιού και τιμής. Χωρίς αποθήκευση κρυφής μνήμης, η δημιουργία κωδικού αριθμού 1.000 θα σήμαινε επανυπολογισμό κλειδιών και τιμών για όλα τα 999 προηγούμενα διακριτικά σε κάθε βήμα — τετραγωνική, σπάταλη εργασία. Η κρυφή μνήμη KV αποθηκεύει αυτά τα διανύσματα κλειδιών και τιμών αφού πρώτα υπολογιστούν και τα επαναχρησιμοποιεί, επομένως κάθε νέο βήμα υπολογίζει μόνο διανύσματα για το μεμονωμένο νεότερο διακριτικό και παρακολουθεί την αποθηκευμένη κρυφή μνήμη. Αυτό συρρικνώνει το κόστος ανά διακριτικό από την κλιμάκωση με μήκος ακολουθίας σε σχεδόν σταθερό. Η αντιστάθμιση είναι η μνήμη: η κρυφή μνήμη αυξάνεται γραμμικά με το μήκος περιβάλλοντος, τον αριθμό των επιπέδων και τις κεφαλές προσοχής, και συχνά γίνεται ο κυρίαρχος καταναλωτής μνήμης στην υπηρεσία μακράς διάρκειας.

Τεχνική διορατικότητα

Κατά τη φάση «προπλήρωσης» το μοντέλο επεξεργάζεται ολόκληρη την προτροπή και γεμίζει την κρυφή μνήμη. κατά τη διάρκεια της «αποκωδικοποίησης» προσαρτά το K/V ενός διακριτικού ανά βήμα και επανεξετάζεται. Το μέγεθος της κρυφής μνήμης κλιμακώνεται ως 2 (K και V) × στρώματα × κεφαλές × head_dim × sequence_length × batch, με την επιλεγμένη ακρίβεια. Για να το δαμάσουν αυτό, τα σύγχρονα μοντέλα χρησιμοποιούν την προσοχή ομαδοποιημένων ερωτημάτων ή πολλαπλών ερωτημάτων για να μοιράζονται κλειδιά/τιμές μεταξύ των κεφαλών και τα συστήματα εξυπηρέτησης όπως το vLLM χρησιμοποιούν το PagedAttention για να εκχωρήσουν προσωρινή μνήμη σε μη συνεχόμενα μπλοκ, μειώνοντας τον κατακερματισμό και τη σπατάλη.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον του KV Cache

Καθώς τα παράθυρα περιβάλλοντος εκτείνονται σε εκατοντάδες χιλιάδες διακριτικά, η κρυφή μνήμη KV γίνεται το κεντρικό σημείο συμφόρησης, επομένως η καινοτομία είναι έντονη: κβαντισμός της κρυφής μνήμης σε 8 ή 4 bit, πολιτικές εξώθησης που ρίχνουν διακριτικά χαμηλής σημασίας, κοινή χρήση προθέματος μεταξύ αιτημάτων και εκφόρτωση σε CPU ή δίσκο. Οι αρχιτεκτονικές αλλαγές όπως η λανθάνουσα προσοχή πολλών κεφαλών συμπιέζουν την ίδια τη μνήμη cache. Αναμένετε συνεχή συν-σχεδιασμό παραλλαγών προσοχής και συστημάτων μνήμης που στοχεύουν στην εξυπηρέτηση πολύ μεγάλων πλαισίων φθηνά και με υψηλή απόδοση.

Υλοποίηση σε πραγματικό κόσμο

Επιτάχυνση των απαντήσεων του chatbot χρησιμοποιώντας εκ νέου αποθηκευμένα κλειδιά/τιμές από το ιστορικό συνομιλιών αντί να το επεξεργάζεστε ξανά σε κάθε στροφή.

Προσωρινή αποθήκευση προθέματος που μοιράζεται την κρυφή μνήμη για μια μεγάλη προτροπή συστήματος σε πολλούς χρήστες, μειώνοντας το κόστος και τον λανθάνοντα χρόνο.

Το PagedAttention του vLLM διαχειρίζεται την κρυφή μνήμη KV σε μπλοκ για την αποτελεσματική εξυπηρέτηση πολλών ταυτόχρονων αιτημάτων σε μία GPU.

Κβαντισμός της κρυφής μνήμης KV σε χαμηλότερη ακρίβεια για να χωρέσει μεγαλύτερα περιβάλλοντα σε περιορισμένη μνήμη GPU.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Βελτιστοποίηση προσωρινής μνήμης KV

Συχνές ερωτήσεις

What is KV Cache?

Η κρυφή μνήμη KV αποθηκεύει τα διανύσματα κλειδιών και τιμών που έχει ήδη υπολογίσει ένας μετασχηματιστής για προηγούμενα διακριτικά, επομένως δεν χρειάζεται να τα υπολογίζει εκ νέου για κάθε νέα λέξη που δημιουργεί. Είναι ο μόνος μεγαλύτερος λόγος για τον οποίο η δημιουργία κειμένου είναι γρήγορη — και το κύριο πράγμα που τρώει τη μνήμη GPU σας κατά τη διάρκεια μεγάλων συνομιλιών.

Τι αποθηκεύει η κρυφή μνήμη KV;

Η κρυφή μνήμη KV διατηρεί τα διανύσματα κλειδιών και τιμών από προηγούμενα διακριτικά, ώστε η προσοχή να μπορεί να τα επαναχρησιμοποιήσει αντί να τα επαναυπολογίσει.

Τι πρόβλημα επιλύει κυρίως η κρυφή μνήμη KV;

Χωρίς προσωρινή αποθήκευση, κάθε νέο διακριτικό θα απαιτούσε εκ νέου υπολογισμό K/V για κάθε προηγούμενο διακριτικό, κάτι που είναι σπατάλη. η κρυφή μνήμη καθιστά το κόστος ανά διακριτικό περίπου σταθερό.

Ποιο είναι το κύριο μειονέκτημα της κρυφής μνήμης KV;

Η κρυφή μνήμη μεγαλώνει με το μήκος ακολουθίας, τα επίπεδα και τις κεφαλές, και συχνά γίνεται ο κυρίαρχος καταναλωτής της μνήμης GPU στην υπηρεσία μεγάλου περιβάλλοντος.

Ποια τεχνική μειώνει το μέγεθος της κρυφής μνήμης KV με την κοινή χρήση κλειδιών και τιμών μεταξύ των κεφαλών προσοχής;

Το ομαδοποιημένο ερώτημα και η προσοχή πολλών ερωτημάτων επιτρέπουν σε πολλές κεφαλές ερωτημάτων να μοιράζονται λιγότερα σύνολα κλειδιών/τιμών, συρρικνώνοντας σημαντικά την κρυφή μνήμη.

Ποιες είναι οι δύο φάσεις συμπερασμάτων του μετασχηματιστή σε σχέση με την κρυφή μνήμη KV;

Η προπλήρωση γεμίζει τη μνήμη cache με το K/V της προτροπής. Η αποκωδικοποίηση προσαρτά ένα νέο Κ/Β διακριτικού σε κάθε βήμα και επανέρχεται στην κρυφή μνήμη.