Τεχνικός ΟΔΗΓΟΣ

Συνεχής παρτίδα

Η συνεχής παρτίδα είναι μια τεχνική σερβιρίσματος που προσθέτει και αφαιρεί αιτήματα από μια τρέχουσα παρτίδα διακριτικό προς διακριτικό, αντί να περιμένει να ολοκληρωθεί μια ολόκληρη σταθερή παρτίδα.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.

Βαθιά κατάδυση

Οι GPU είναι πιο γρήγορες όταν επεξεργάζονται πολλά αιτήματα μαζί σε μια παρτίδα. Η αφελής προσέγγιση, η στατική παρτίδα, ομαδοποιεί ένα σταθερό σύνολο αιτημάτων, τα εκτελεί όλα μέχρι την ολοκλήρωση και μετά ξεκινά την επόμενη παρτίδα. Το πρόβλημα: οι έξοδοι των μοντέλων γλώσσας ποικίλλουν πολύ σε μήκος, επομένως τα σύντομα αιτήματα ολοκληρώνονται νωρίς και οι υποδοχές τους παραμένουν αδρανείς ενώ η παρτίδα περιμένει για τη μεγαλύτερη, σπαταλώντας τους κύκλους GPU και καθυστερώντας τις νέες αφίξεις. Η συνεχής παρτίδα (ονομάζεται επίσης ομαδική κατά τη διάρκεια της πτήσης ή επανάληψης, που διαδόθηκε από το χαρτί Orca και χρησιμοποιείται σε vLLM, TensorRT-LLM και TGI) λειτουργεί με την ευαισθησία ενός μόνο βήματος αποκωδικοποίησης. Αφού δημιουργηθεί κάθε διακριτικό, οι ολοκληρωμένες ακολουθίες εξέρχονται από την παρτίδα και τα πρόσφατα ληφθέντα αιτήματα εισάγονται αμέσως. Αυτό διατηρεί την παρτίδα πλήρη και την GPU κορεσμένη, ενισχύοντας συχνά την απόδοση αρκετές φορές με χαμηλότερη καθυστέρηση για τους χρήστες που αναμένουν.

Τεχνική διορατικότητα

Η βασική αλλαγή είναι από τη συγκέντρωση ολόκληρων αιτημάτων στη ομαδοποίηση μεμονωμένων επαναλήψεων. Σε κάθε βήμα αποκωδικοποίησης, ο προγραμματιστής δημιουργεί το ενεργό σύνολο: εκτελεί ένα πέρασμα προς τα εμπρός σε όλες τις ακολουθίες κατά τη διάρκεια της πτήσης, εκπέμπει ένα διακριτικό η καθεμία, εξάγει ό,τι έχει φτάσει σε ένα διακριτικό ή όριο μήκους τέλους ακολουθίας και δέχεται αιτήματα σε ουρά για την πλήρωση των ελευθερώσεων. Ο συνδυασμός αυτού με την ευέλικτη μνήμη KV του PagedAttention καθιστά την εισαγωγή και την αφαίρεση ακολουθιών κατά τη διάρκεια της πτήσης φθηνή, καθώς η κρυφή μνήμη κάθε ακολουθίας ζει σε ανεξάρτητα μπλοκ.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

Το μέλλον της συνεχούς παρτίδας

Η συνεχής παρτίδα είναι πλέον στάνταρ στην παραγωγή σερβιρίσματος LLM. Η μελλοντική εργασία βελτιώνει τον χρονοπρογραμματιστή: διαχωρισμός της βαριάς υπολογιστικής φάσης προπλήρωσης από την ελαφρύτερη φάση αποκωδικοποίησης (αποσύνθεση), τεμαχισμένη προπλήρωση για την αποφυγή καθυστερήσεων στην αποκωδικοποίηση, πολιτικές προτεραιότητας και δικαιοσύνης για μικτούς φόρτους εργασίας και στενότερη σύζευξη με κερδοσκοπική αποκωδικοποίηση, ώστε να επικυρώνονται πολλαπλά πρόχειρα διακριτικά ανά βήμα. Ο στόχος είναι η συμπίεση των μέγιστων διακριτικών ανά δευτερόλεπτο ανά GPU, διατηρώντας παράλληλα τον λανθάνοντα χρόνο μεμονωμένης απόκρισης χαμηλό και προβλέψιμο.

Υλοποίηση σε πραγματικό κόσμο

Ένα API συνομιλίας που δέχεται αμέσως μηνύματα χρήστη στην τρέχουσα παρτίδα αντί να τα βάζει στην ουρά για την επόμενη παρτίδα

Εκδίωξη μιας σύντομης ολοκληρωμένης απάντησης στη μέση της παρτίδας και συμπλήρωση της υποδοχής της, έτσι ώστε η GPU να μην αδράνει ποτέ, περιμένοντας μια μεγάλη γενιά

Συνδυασμός συνεχούς παρτίδας με το PagedAttention του vLLM για την εισαγωγή και αφαίρεση ακολουθιών φθηνά σε κάθε βήμα αποκωδικοποίησης

Μια υπηρεσία ολοκλήρωσης κώδικα που διατηρεί υψηλά διακριτικά ανά δευτερόλεπτο υπό έντονη κυκλοφορία μεταβλητού μήκους, διατηρώντας την παρτίδα γεμάτη

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Continuous Batching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Kubernetes για φόρτους εργασίας ML

Συχνές ερωτήσεις

What is Continuous Batching?

Η συνεχής παρτίδα είναι μια τεχνική σερβιρίσματος που προσθέτει και αφαιρεί αιτήματα από μια τρέχουσα παρτίδα διακριτικό προς διακριτικό, αντί να περιμένει να ολοκληρωθεί μια ολόκληρη σταθερή παρτίδα. Διατηρεί τη GPU συνεχώς απασχολημένη και αυξάνει απότομα πόσους χρήστες μπορεί να εξυπηρετήσει ένα μοντέλο AI ταυτόχρονα.

Ποια είναι η κύρια αδυναμία της στατικής (σταθερής) παρτίδας για την εξυπηρέτηση LLM;

Επειδή τα μήκη εξόδου ποικίλλουν, οι ολοκληρωμένες ακολουθίες παραμένουν σε αδράνεια μέχρι να ολοκληρωθεί η πιο αργή, χάνοντας τους κύκλους GPU και καθυστερώντας τα νέα αιτήματα.

Με ποια ευαισθησία προσθέτει και αφαιρεί αιτήματα η συνεχής ομαδοποίηση;

Η συνεχής ομαδοποίηση (επίπεδο επανάληψης) ενημερώνει το ενεργό σύνολο μετά από κάθε βήμα αποκωδικοποίησης, έτσι ώστε να λειτουργεί διακριτικά και όχι ανά ολόκληρο αίτημα.

Όταν μια ακολουθία τελειώνει στη μέση της παρτίδας υπό συνεχή παρτίδα, τι συμβαίνει με την υποδοχή της;

Οι ολοκληρωμένες ακολουθίες αποβάλλονται και οι αιτήσεις αναμονής εισάγονται αμέσως, διατηρώντας την παρτίδα γεμάτη και την GPU απασχολημένη.

Ποια τεχνική συνδυάζεται φυσικά με τη συνεχή παρτίδα για να κάνει την εισαγωγή/αφαίρεση ακολουθιών φθηνή;

Το PagedAttention αποθηκεύει την κρυφή μνήμη KV κάθε ακολουθίας σε ανεξάρτητα μπλοκ, επομένως η προσθήκη ή η αφαίρεση μιας ακολουθίας κατά τη διάρκεια της πτήσης δεν διαταράσσει τη μνήμη άλλων.

Σε ποια ερευνητική εργασία αποδίδεται συνήθως η διάδοση της ομαδοποίησης σε επίπεδο επανάληψης (συνεχούς);

Το έγγραφο Orca εισήγαγε τον προγραμματισμό σε επίπεδο επανάληψης και η ιδέα υιοθετήθηκε από την εξυπηρέτηση συστημάτων όπως το vLLM, το TGI και το TensorRT-LLM.