PagedAttention και vLLM
Το PagedAttention είναι μια τεχνική διαχείρισης μνήμης που αποθηκεύει τη μνήμη cache προσοχής ενός γλωσσικού μοντέλου σε μικρά επαναχρησιμοποιήσιμα μπλοκ αντί για ένα μεγάλο συνεχόμενο κομμάτι.
Επισκόπηση
Τροφοδοτεί το vLLM, μια μηχανή εξυπηρέτησης ανοιχτού κώδικα που ενισχύει δραματικά πόσα αιτήματα μπορεί να χειριστεί μια μεμονωμένη GPU.
Βαθιά κατάδυση
Όταν ένα μοντέλο γλώσσας δημιουργεί κείμενο, διατηρεί μια «κρυφή μνήμη KV» (διανύσματα κλειδιών και τιμών) για κάθε διακριτικό που έχει δει, έτσι ώστε το επόμενο διακριτικό να μπορεί να παρακολουθεί το πλήρες πλαίσιο. Παραδοσιακά, κάθε αίτημα κρατούσε μια μεγάλη συνεχόμενη πλάκα μνήμης GPU με μέγεθος για το μέγιστο δυνατό μήκος, χάνοντας τεράστια ποσά όταν οι ακολουθίες ήταν μικρότερες ή ποικίλλουν σε μήκος. Το PagedAttention, που παρουσιάστηκε στο έγγραφο vLLM του 2023 από το UC Berkeley, δανείζεται την ιδέα της σελιδοποίησης εικονικής μνήμης από λειτουργικά συστήματα: χωρίζει την κρυφή μνήμη KV σε μπλοκ σταθερού μεγέθους που μπορούν να ζουν οπουδήποτε στη μνήμη και να εκχωρούνται κατόπιν ζήτησης. Ένας πίνακας αναζήτησης αντιστοιχίζει λογικές θέσεις διακριτικών σε φυσικά μπλοκ. Αυτό σχεδόν εξαλείφει τον κατακερματισμό της μνήμης και επιτρέπει την κοινή χρήση μπλοκ, για παράδειγμα σε πολλαπλές εξόδους από την ίδια γραμμή εντολών.
Τεχνική διορατικότητα
Η κρυφή μνήμη KV χωρίζεται σε σελίδες σταθερού μεγέθους, καθεμία από τις οποίες κρατά τα κλειδιά και τις τιμές για έναν καθορισμένο αριθμό διακριτικών. Ένας πίνακας μπλοκ ανά ακολουθία αντιστοιχίζει λογικές θέσεις σε φυσικές τοποθεσίες σελίδας, επομένως η κρυφή μνήμη μιας ακολουθίας δεν χρειάζεται να είναι συνεχόμενη. Επειδή τα πανομοιότυπα προθέματα (ένα κοινό προτροπή συστήματος ή διακλαδώσεις αναζήτησης δέσμης) μπορούν να παραπέμπουν στις ίδιες φυσικές σελίδες μέσω αντιγραφής σε εγγραφή, η μνήμη επαναχρησιμοποιείται αντί για διπλότυπη, μειώνοντας τα απόβλητα από πάνω από 60% σε λίγα τοις εκατό.
Στρατηγικός αντίκτυπος
Κόστος και προϋπολογισμός
Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.
Σαφέστερες αποφάσεις
Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.
Ελεγχος ποιότητας
Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.
Το μέλλον του PagedAttention και του vLLM
Το vLLM έχει γίνει μια προεπιλεγμένη βάση συμπερασμάτων ανοιχτού κώδικα και οι ιδέες του PagedAttention εμφανίζονται πλέον στις περισσότερες στοίβες εξυπηρέτησης. Αναμένετε βαθύτερη προσωρινή αποθήκευση προθεμάτων (επαναχρησιμοποίηση των προτροπών του συστήματος προσωρινής αποθήκευσης σε όλους τους χρήστες), ανανεωμένη προπλήρωση και αποκωδικοποίηση σε ξεχωριστά μηχανήματα, πιο έξυπνες πολιτικές εξώθησης και αυστηρή ενοποίηση με κβαντοποίηση και κερδοσκοπική αποκωδικοποίηση. Καθώς τα παράθυρα περιβάλλοντος μεγαλώνουν σε εκατομμύρια διακριτικά, η αποτελεσματική διαχείριση σελιδοποιημένης KV γίνεται ακόμη πιο κεντρική για να διατηρηθεί η προσιτή εξυπηρέτηση.
Υλοποίηση σε πραγματικό κόσμο
Φιλοξενία ενός API LLM ανοιχτού κώδικα όπου το vLLM εξυπηρετεί πολλούς χρήστες ταυτόχρονων συνομιλιών από μία GPU σε υψηλή απόδοση
Κοινή χρήση μιας μεγάλης προτροπής συστήματος σε χιλιάδες αιτήματα μέσω προσωρινής αποθήκευσης προθέματος, ώστε να υποβάλλεται σε επεξεργασία μία φορά, όχι επανειλημμένα
Αναζήτηση δέσμης εκτέλεσης ή πολλαπλές ολοκληρώσεις δειγματοληψίας που μοιράζονται μπλοκ KV για την κοινή προτροπή μέσω αντιγραφής σε εγγραφή
Μείωση της σπατάλης μνήμης GPU από κατακερματισμό, έτσι ώστε ένας πάροχος να μπορεί να συσκευάσει περισσότερες ταυτόχρονες συνεδρίες στο ίδιο υλικό
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.
Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.
Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.
Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.
Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.
Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PagedAttention and vLLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Διαφορικό απόρρητο
Συχνές ερωτήσεις
Τι είναι το PagedAttention και το vLLM;
Το PagedAttention είναι μια τεχνική διαχείρισης μνήμης που αποθηκεύει τη μνήμη cache προσοχής ενός γλωσσικού μοντέλου σε μικρά επαναχρησιμοποιήσιμα μπλοκ αντί για ένα μεγάλο συνεχόμενο κομμάτι. Τροφοδοτεί το vLLM, μια μηχανή εξυπηρέτησης ανοιχτού κώδικα που ενισχύει δραματικά πόσα αιτήματα μπορεί να χειριστεί μια μεμονωμένη GPU.
Τι αποθηκεύει η «κρυφή μνήμη KV» κατά τη δημιουργία κειμένου;
Η κρυφή μνήμη KV περιέχει διανύσματα κλειδιών και τιμών για κάθε προηγούμενο διακριτικό, επιτρέποντας στο μοντέλο να παρακολουθεί το πλήρες πλαίσιο χωρίς να το υπολογίζει εκ νέου σε κάθε βήμα.
Ποια ιδέα λειτουργικού συστήματος ενέπνευσε το PagedAttention;
Το PagedAttention δανείζεται σελιδοποίηση εικονικής μνήμης: η κρυφή μνήμη KV χωρίζεται σε σελίδες σταθερού μεγέθους που μπορούν να ζουν οπουδήποτε, αντιστοιχισμένες από έναν πίνακα μπλοκ.
Ποιο πρόβλημα με την παραδοσιακή εκχώρηση κρυφής μνήμης KV επιλύει το PagedAttention;
Η κράτηση μιας μεγάλης συνεχόμενης πλάκας ανά αίτημα, μεγέθους για το μέγιστο μήκος, σπατάλησε τεράστιες ποσότητες μνήμης GPU. Η σελιδοποίηση εκχωρεί μικρά τετράγωνα κατόπιν ζήτησης, μειώνοντας τα απόβλητα.
Πώς το PagedAttention επιτρέπει σε πολλαπλές εξόδους να μοιράζονται μνήμη για μια κοινή προτροπή;
Τα ίδια προθέματα (κοινόχρηστες προτροπές ή κλάδοι αναζήτησης δέσμης) αναφέρονται στις ίδιες φυσικές σελίδες KV, αντιγράφοντας μόνο όταν ένας κλάδος αποκλίνει.
Πού αναπτύχθηκε αρχικά το vLLM και το PagedAttention;
Το vLLM και ο αλγόριθμος PagedAttention βγήκαν από το UC Berkeley σε μια εφημερίδα του 2023 και γρήγορα έγιναν μια ευρέως χρησιμοποιούμενη μηχανή εξυπηρέτησης ανοιχτού κώδικα.