Τεχνικός ΟΔΗΓΟΣ

Βελτιστοποίηση προσωρινής μνήμης KV

Η κρυφή μνήμη KV αποθηκεύει τα κλειδιά και τις τιμές που έχει ήδη υπολογίσει ένας μετασχηματιστής, ώστε να μην επαναλαμβάνει την εργασία για κάθε νέο διακριτικό — αλλά μπορεί να μεταφερθεί σε gigabyte.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.

Βαθιά κατάδυση

Σε έναν μετασχηματιστή, κάθε νέο διακριτικό παρακολουθεί όλα τα προηγούμενα διακριτικά μέσω των κλειδιών προσοχής (K) και των τιμών (V). Ο επανυπολογισμός των K και V για ολόκληρη την ακολουθία σε κάθε βήμα θα ήταν τετραγωνικός και σπάταλος, επομένως τα μοντέλα τα αποθηκεύουν στην κρυφή μνήμη: την κρυφή μνήμη KV. Το μειονέκτημα είναι το μέγεθος. Η κρυφή μνήμη αυξάνεται γραμμικά με το μήκος ακολουθίας, το μέγεθος παρτίδας, τα επίπεδα και τις κεφαλές, επομένως ένα αίτημα μεγάλου περιβάλλοντος μπορεί να καταναλώνει περισσότερη μνήμη GPU από ό,τι το ίδιο το μοντέλο βαραίνει. Η βελτιστοποίηση αντιμετωπίζει αυτό το θέμα από διάφορες οπτικές γωνίες: η σελιδοποιημένη μνήμη (vLLM's PagedAttention) αποθηκεύει τη μνήμη cache σε μη συνεχόμενα μπλοκ για να εξαλείψει τον κατακερματισμό και να ενεργοποιήσει την κοινή χρήση. Η κβαντοποίηση αποθηκεύει τα K και V σε 8-bit ή 4-bit. και οι αρχιτεκτονικές αλλαγές όπως το Grouped-Query Attention (GQA) και το Multi-Query Attention (MQA) επιτρέπουν σε πολλές κεφαλές ερωτημάτων να μοιράζονται λιγότερες κεφαλές κλειδιών/τιμών, μειώνοντας το μέγεθος της προσωρινής μνήμης στην πηγή.

Τεχνική διορατικότητα

Το PagedAttention δανείζεται σελιδοποίηση εικονικής μνήμης από λειτουργικά συστήματα: η κρυφή μνήμη ζει σε μπλοκ σταθερού μεγέθους που έχουν αντιστοιχιστεί μέσω ενός πίνακα αναζήτησης, επομένως τα αιτήματα χρησιμοποιούν μόνο τα μπλοκ που χρειάζονται και τα ίδια προθέματα (όπως μια προτροπή κοινόχρηστου συστήματος) μπορούν να παραπέμπουν στα ίδια μπλοκ. Multi-head Latent Attention (MLA), που χρησιμοποιείται στα μοντέλα DeepSeek, συμπιέζει τα K και V σε ένα μικρό κοινόχρηστο λανθάνον διάνυσμα, μειώνοντας δραματικά τη μνήμη διατηρώντας παράλληλα την ακρίβεια.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

Το μέλλον της βελτιστοποίησης κρυφής μνήμης KV

Καθώς τα παράθυρα περιβάλλοντος εκτείνονται σε εκατοντάδες χιλιάδες ή εκατομμύρια διακριτικά, η κρυφή μνήμη KV γίνεται το κυρίαρχο κόστος προβολής. Αναμένετε επιθετική συμπίεση και εξάλειψη της κρυφής μνήμης (απόρριψη διακριτικών χαμηλής προσοχής), κοινή χρήση προθέματος μεταξύ αιτημάτων ως προεπιλογή, εκφόρτωση ψυχρής κρυφής μνήμης σε CPU ή NVMe και αρχιτεκτονικές όπως το MLA και το GQA να γίνουν στάνταρ. Η διαχείριση της προσωρινής μνήμης θα μοιάζει ολοένα και περισσότερο με μια ιεραρχία πλήρους μνήμης με επίπεδα και έξυπνη προανάκτηση.

Υλοποίηση σε πραγματικό κόσμο

Το PagedAttention του vLLM εξυπηρετεί πολλές ταυτόχρονες συνεδρίες συνομιλίας πακετάροντας μπλοκ KV χωρίς κατακερματισμό μνήμης

Προσοχή ομαδοποιημένου ερωτήματος στα μοντέλα Llama που μειώνουν το μέγεθος της κρυφής μνήμης KV, ώστε τα μεγαλύτερα περιβάλλοντα να χωρούν στη μνήμη GPU

Κβαντισμός της κρυφής μνήμης KV σε 8-bit (KV8) για να μειωθεί κατά το ήμισυ η κρυφή μνήμη κατά τη σύνοψη μεγάλων εγγράφων

Προσωρινή αποθήκευση προθέματος που επαναχρησιμοποιεί τα μπλοκ KV ενός κοινόχρηστου συστήματος σε χιλιάδες αιτήματα API

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is KV Cache Optimization?

Η κρυφή μνήμη KV αποθηκεύει τα κλειδιά και τις τιμές που έχει ήδη υπολογίσει ένας μετασχηματιστής, ώστε να μην επαναλαμβάνει την εργασία για κάθε νέο διακριτικό — αλλά μπορεί να μεταφερθεί σε gigabyte. Η βελτιστοποίηση κρυφής μνήμης KV συρρικνώνεται και διαχειρίζεται αυτή τη μνήμη, έτσι ώστε τα μοντέλα να εξυπηρετούν μεγαλύτερα περιβάλλοντα σε περισσότερους χρήστες ταυτόχρονα.

Τι αποθηκεύει η κρυφή μνήμη KV και γιατί;

Η προσωρινή αποθήκευση κλειδιών και τιμών από προηγούμενα διακριτικά αποφεύγει την επανάληψη του υπολογισμού της προσοχής σε κάθε νέο διακριτικό, εξοικονομώντας χρόνο.

Γιατί η κρυφή μνήμη KV μπορεί να γίνει πρόβλημα μνήμης;

Το μέγεθος της κρυφής μνήμης κλιμακώνεται με μήκος περιβάλλοντος και ταυτόχρονη χρήση, έτσι ώστε τα μεγάλα αιτήματα να μπορούν να χρησιμοποιούν τεράστιες ποσότητες μνήμης GPU.

Ποια έννοια λειτουργικού συστήματος δανείζεται το PagedAttention;

Το PagedAttention αποθηκεύει την κρυφή μνήμη σε μη συνεχόμενα μπλοκ σταθερού μεγέθους που αντιστοιχίζονται μέσω ενός πίνακα, όπως ακριβώς η σελιδοποίηση του λειτουργικού συστήματος.

Πώς το Grouped-Query και το Multi-Query Attention μειώνουν το μέγεθος της κρυφής μνήμης KV;

Η κοινή χρήση κεφαλών κλειδιού/τιμής σε πολλαπλές κεφαλές ερωτήματος σημαίνει πολύ λιγότερα διανύσματα K και V για αποθήκευση.

Ποιο είναι ένα πλεονέκτημα της κοινής χρήσης προθέματος στην κρυφή μνήμη KV;

Μια προτροπή κοινόχρηστου συστήματος παράγει πανομοιότυπες καταχωρήσεις KV, έτσι πολλαπλά αιτήματα μπορούν να οδηγούν στα ίδια μπλοκ αντί να τα αντιγράφουν.