Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το χαρτί λέει ότι η διαχείριση προσωρινής μνήμης με επίγνωση του πράκτορα μειώνει την καθυστέρηση του πρώτου διακριτικού έως και 45% στην υπηρεσία πολλαπλών παραγόντων

Μια νέα προεκτύπωση arXiv περιγράφει το CacheScout, ένα επίπεδο που έχει δημιουργηθεί στον διακομιστή vLLM ανοιχτού κώδικα που αποφασίζει τι θα κρατήσει στη μνήμη cache κλειδιού-τιμής ενός μοντέλου με βάση τον παράγοντα που είναι πιθανό να εκτελεστεί στη συνέχεια. Οι συγγραφείς αναφέρουν διψήφιο λανθάνοντα χρόνο και κέρδη απόδοσης. ο φόρτος εργασίας, τα μοντέλα και το υλικό δεν αναφέρονται περιληπτικά.

7 min readRead the primary source
Source-provided image accompanying Paper Says Agent-Aware Cache Management Cuts First-Token Delay Up to 45% in Multi-Agent Serving
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2608.14624
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Token
Ένα κομμάτι κειμένου επεξεργασμένο από γλωσσικά μοντέλα, όπως ένα κομμάτι λέξης ή ένα σύμβολο.
Τεχνητή Νοημοσύνη (AI)
Το ευρύ πεδίο κατασκευής συστημάτων που εκτελούν εργασίες που απαιτούν αναγνώριση προτύπων, συλλογισμό, γλώσσα ή λήψη αποφάσεων.
Μνήμη (μνήμη πράκτορα)
Το αποθηκευμένο πλαίσιο που χρησιμοποιεί ένας πράκτορας τεχνητής νοημοσύνης σε βήματα ή περιόδους σύνδεσης για να βελτιώσει τη συνέχεια.
Δοκιμάστε τον εαυτό σαςΚουίζ για πράκτορες AI

Τι έγινε

Μια προεκτύπωση που δημοσιεύτηκε στο arXiv περιγράφει το CacheScout, ένα επίπεδο χρόνου εκτέλεσης για διακομιστές που φιλοξενούν συστήματα μοντέλων γλωσσών πολλαπλών πρακτόρων. Αντί να απορρίπτει τον υπολογισμό που έχει αποθηκευτεί στην κρυφή μνήμη σε μια βάση που χρησιμοποιήθηκε λιγότερο πρόσφατα, μαθαίνει στο διαδίκτυο ποιος πράκτορας τείνει να ακολουθεί ποιον, στη συνέχεια χρησιμοποιεί αυτές τις προβλέψεις για να αποφασίσει τι θα κρατήσει και τι θα φορτώσει εκ των προτέρων. Χτισμένο σε vLLM, αναφέρεται ότι αυξάνει τα ποσοστά επισκέψεων στην κρυφή μνήμη κατά 10 έως 18 ποσοστιαίες μονάδες και μειώνει τον μέσο χρόνο μέχρι το πρώτο διακριτικό κατά 18 έως 45 τοις εκατό.

Μια προεκτύπωση που αναφέρεται ως arXiv:2608.14624, που υποβλήθηκε στις 16 Ιουλίου 2026 και καταχωρήθηκε με την Τεχνητή Νοημοσύνη (cs.AI), περιγράφει ένα σύστημα που ονομάζεται CacheScout. Αναφέρονται εννέα συγγραφείς: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang και Liting Hu. Η σελίδα καταχώρισης που αποτελεί τη βάση για αυτό το άρθρο δεν δηλώνει τις θεσμικές τους σχέσεις και η εργασία φέρει μια ενιαία έκδοση χωρίς ένδειξη αξιολόγησης από ομοτίμους ή δημοσίευσης σε συνέδριο ή περιοδικό.

Το πρόβλημα που περιγράφουν οι συγγραφείς είναι συγκεκριμένο στον τρόπο κατασκευής συστημάτων πολλαπλών πρακτόρων. Ένα αίτημα χρήστη χωρίζεται σε μια ακολουθία εξειδικευμένων πρακτόρων και καθένας από αυτούς τους πράκτορες εκτελείται σε ένα σταθερό μπλοκ περιβάλλοντος: μια προτροπή συστήματος, ένα σύνολο ορισμών εργαλείων και παραδείγματα λίγων λήψεων. Όταν ένα μοντέλο γλώσσας επεξεργάζεται κείμενο, παράγει μια ενδιάμεση κατάσταση προσοχής, που συνήθως ονομάζεται κρυφή μνήμη κλειδιού-τιμής ή κρυφή μνήμη KV, την οποία ένα σύστημα εξυπηρέτησης μπορεί να αποθηκεύσει και να επαναχρησιμοποιήσει, έτσι ώστε το ίδιο κύριο κείμενο να μην χρειάζεται να υποβληθεί ξανά σε επεξεργασία. Επειδή τα περιβάλλοντα πρακτόρων επαναλαμβάνονται, οι συγγραφείς υποστηρίζουν ότι υπάρχει καταρχήν μεγάλος αριθμός επαναχρησιμοποίησης.

Ο ισχυρισμός τους είναι ότι οι τρέχοντες διακομιστές αποτυγχάνουν να το καταγράψουν. Τα υπάρχοντα συστήματα, λέει η περίληψη, διαχειρίζονται την κρυφή μνήμη KV αντιδραστικά, χρησιμοποιώντας προσωρινή αποθήκευση προθέματος σε συνδυασμό με αντικατάσταση με βάση την πρόσφατη έκδοση — διατηρώντας ό,τι χρησιμοποιήθηκε πιο πρόσφατα και απομακρύνοντας τα υπόλοιπα. Σε μια διοχέτευση πράκτορα, το περιβάλλον ενός πράκτορα μπορεί να παραμείνει αχρησιμοποίητο ενώ εκτελούνται άλλοι πράκτορες, επομένως αποβάλλεται λίγο πριν γίνει εκ νέου επίκληση αυτού του πράκτορα και η εργασία επαναληφθεί. Η δηλωμένη γνώση του CacheScout είναι ότι η μελλοντική επαναχρησιμοποίηση διέπεται από τη σημασιολογία της εκτέλεσης του πράκτορα και όχι μόνο από την πρόσφατη χρήση.

Ο μηχανισμός, όπως περιγράφεται, είναι να μάθουμε τις μεταβάσεις εκτέλεσης πράκτορα ενώ το σύστημα εκτελείται — ποιος πράκτορας τείνει να ακολουθήσει ποιον — χωρίς προκαθορισμένο γράφημα ροής εργασίας και χωρίς εκπαίδευση εκτός σύνδεσης, και στη συνέχεια χρησιμοποιήστε αυτό το μοντέλο εκμάθησης για να καθοδηγήσετε τόσο την εξάλειψη όσο και την προληπτική προανάκτηση καταχωρήσεων κρυφής μνήμης. Οι συγγραφείς λένε ότι η κρίσιμη διαδρομή εξυπηρέτησης παραμένει αμετάβλητη, πράγμα που σημαίνει ότι ο μηχανισμός πρόβλεψης προορίζεται να βρίσκεται δίπλα στον χειρισμό αιτημάτων και όχι στο εσωτερικό του. Η υλοποίηση είναι χτισμένη πάνω από το vLLM, έναν ευρέως χρησιμοποιούμενο διακομιστή συμπερασμάτων ανοιχτού κώδικα.

Τα αναφερόμενα αποτελέσματα, τα οποία θα πρέπει να διαβαστούν ως ισχυρισμοί των συγγραφέων και όχι ως γεγονότα που έχουν τεκμηριωθεί από ανεξάρτητα, είναι τα εξής: σε αυτό που η περίληψη ονομάζει αντιπροσωπευτικούς πραγματικούς φόρτους εργασίας πολλών πρακτόρων, το ποσοστό επιτυχίας της κρυφής μνήμης βελτιώνεται κατά 10 έως 18 ποσοστιαίες μονάδες, οι μέσες πτώσεις από το χρόνο έως το πρώτο κουπόνι 18 έως το 45 τοις εκατό, η μέση άνοδος ανά στροφή 29 τοις εκατό, η μέση καθυστέρηση ανά στροφή κατά 29%. στο 57 τοις εκατό. Η περίληψη προσθέτει ότι τα οφέλη γενικεύονται σε μεγαλύτερα μοντέλα, με το time-to-first- μειωμένο έως και 54 τοις εκατό και την απόδοση κατά 37 τοις εκατό υψηλότερη. Δεν ονομάζει τους φόρτους εργασίας, τα μοντέλα, τις GPU, τα μεγέθη της κρυφής μνήμης ή τη διαμόρφωση της γραμμής βάσης πέρα ​​από την περιγραφόμενη συμπεριφορά προθέματος-προσωρινή αποθήκευση-συν-πρόσφατη εμφάνιση και δεν αναφέρει απόλυτους αριθμούς καθυστέρησης.

Στοιχεία πηγής: arxiv.org

Γιατί έχει σημασία

Τα προϊόντα αντιπροσώπων πραγματοποιούν πολλές κλήσεις μοντέλων ανά εργασία και κάθε κλήση συνήθως αποστέλλει ξανά την ίδια προτροπή συστήματος, ορισμούς εργαλείων και παραδείγματα. Ο επανυπολογισμός αυτού του κοινόχρηστου προθέματος αποτελεί μεγάλο μερίδιο του λογαριασμού και της αναμονής που νιώθει ένας χρήστης. Η αντιμετώπιση της κρυφής μνήμης ως κάτι προβλέψιμο από τη δομή της ροής εργασίας, και όχι από την πρόσφατη, στοχεύει αυτή τη σπατάλη χωρίς να αλλάζει τα αποτελέσματα του μοντέλου.

Τα οικονομικά των προϊόντων αντιπροσώπων εξαρτώνται από το επαναλαμβανόμενο πλαίσιο. Ένας βοηθός κωδικοποίησης, μια ροή εργασιών υποστήριξης πελατών ή ένας ερευνητικός πράκτορας μπορεί να πραγματοποιήσει δεκάδες κλήσεις μοντέλων για να ολοκληρώσει μια εργασία και κάθε κλήση συνήθως στέλνει ξανά ένα μακρύ, σχεδόν πανομοιότυπο προοίμιο οδηγιών και σχημάτων εργαλείων. Το κόστος της επεξεργασίας αυτού του προοιμίου — το στάδιο προπλήρωσης — καταβάλλεται ξανά σε κάθε κλήση, εκτός εάν ο διακομιστής μπορεί να επαναχρησιμοποιήσει την κατάσταση προσωρινής αποθήκευσης. Καθώς τα αποθέματα εργαλείων αυξάνονται, αυτό το σταθερό μπλοκ μεγαλώνει μαζί τους, έτσι το μερίδιο υπολογισμού που δαπανάται για την εκ νέου ανάγνωση του ίδιου κειμένου τείνει να αυξάνεται αντί να συρρικνώνεται.

Οι δύο μετρήσεις που δίνει έμφαση στην εφημερίδα αντιστοιχούν απευθείας σε αυτό που παρατηρούν οι άνθρωποι. Η ένδειξη Time-to-first- είναι η παύση πριν εμφανιστεί οτιδήποτε. Η καθυστέρηση ανά στροφή είναι η αναμονή για το τέλος ενός βήματος. Σε μια ενιαία ανταλλαγή chatbot, μερικές εκατοντάδες χιλιοστά του δευτερολέπτου είναι ένας μικρός ερεθισμός. σε έναν βρόχο πράκτορα που αλυσοδένει πολλά βήματα, η ίδια καθυστέρηση ανά κλήση πολλαπλασιάζεται και είναι ένας κοινός λόγος που τα χαρακτηριστικά του πράκτορα αισθάνονται υποτονικά ακόμα και όταν το υποκείμενο μοντέλο είναι γρήγορο. Η διεκπεραίωση έχει σημασία από την άλλη πλευρά του καθολικού: υψηλότερη απόδοση αιχμής σημαίνει ότι το ίδιο υλικό εξυπηρετεί περισσότερους ταυτόχρονους χρήστες, κάτι που είναι ζήτημα κόστους για οποιονδήποτε πληρώνει για GPU.

Η εννοιολογική κίνηση είναι το μέρος που είναι πιο πιθανό να διαρκέσει περισσότερο από αυτή τη συγκεκριμένη υλοποίηση. Οι πολιτικές προσωρινής αποθήκευσης που δανείζονται από λειτουργικά συστήματα και διακομιστές ιστού υποθέτουν ότι το μέλλον μοιάζει με το πρόσφατο παρελθόν. Ο φόρτος εργασίας του πράκτορα παραβιάζει αυτήν την υπόθεση με δομημένο τρόπο εκμάθησης, επειδή η σειρά με την οποία εκτελούνται οι πράκτορες είναι ιδιότητα της εφαρμογής και όχι τυχαία. Συγκεκριμένα, οι συγγραφείς λένε ότι μαθαίνουν αυτή τη δομή στο διαδίκτυο αντί να απαιτούν από τους προγραμματιστές να δηλώνουν ένα γράφημα ροής εργασίας - μια επιλογή σχεδίασης που ταιριάζει με τον τρόπο με τον οποίο γράφονται πραγματικά τα πλαίσια πράκτορα, με διακλάδωση, δρομολόγηση υπό όρους και ενορχήστρωση που αποφασίζεται από ένα μοντέλο κατά την εκτέλεση.

Αρκετά όρια αξίζει να δηλωθούν ξεκάθαρα. Η επαναχρησιμοποίηση της κρυφής μνήμης KV είναι μια υπολογιστική συντόμευση για εργασία που διαφορετικά θα επαναλάμβανε το μοντέλο, επομένως κατ' αρχήν δεν θα πρέπει να αλλάζει τις εξόδους του μοντέλου. η περίληψη δεν αναφέρει ελέγχους ποιότητας παραγωγής ή ορθότητας, έτσι ώστε η προσδοκία να είναι συμπέρασμα από το πώς λειτουργεί η τεχνική και όχι κάτι που επαληθεύει η πηγή. Το μέγεθος των κερδών εξαρτάται από τους φόρτους εργασίας που επαναλαμβάνουν πραγματικά περιβάλλοντα, από το ότι το σύστημα βρίσκεται υπό αρκετή πίεση μνήμης ώστε να έχουν σημασία οι αποφάσεις έξωσης και από το υλικό. Οι ποσοστιαίες βελτιώσεις που μετρώνται σε σχέση με μία διαμόρφωση γραμμής βάσης μπορούν να συρρικνωθούν έναντι μιας καλύτερα συντονισμένης. Η προληπτική λήψη καταναλώνει επίσης το εύρος ζώνης και τη χωρητικότητα της μνήμης και η περίληψη δεν ποσοτικοποιεί το κόστος μιας λανθασμένης πρόβλεψης.

Interactive Mechanism

Interactive Mechanism: How It Actually Works

Explore the underlying technology behind this development interactively.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactive Concept Check+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

Τι να παρακολουθήσετε στη συνέχεια

Ο φόρτος εργασίας, τα μοντέλα, το υλικό και οι διαμορφώσεις βασικής γραμμής του πλήρους χαρτιού θα καθορίσουν πόσο από το αναφερόμενο κέρδος επιβιώνει σε επαφή με άλλες αναπτύξεις. Αξίζει επίσης να παρακολουθήσετε: εάν ο κώδικας κυκλοφορεί ή μεταφέρεται στο vLLM, εάν οι καθυστερήσεις της ουράς βελτιώνονται παράλληλα με τους αναφερόμενους μέσους όρους και πώς συμπεριφέρεται το μαθημένο μοντέλο όταν η παραγγελία των πρακτόρων είναι πραγματικά απρόβλεπτη.

Το πρώτο πράγμα που πρέπει να ελέγξετε είναι το πλήρες χαρτί και όχι η περίληψη: ποιοι φόρτοι εργασίας πολλαπλών παραγόντων χρησιμοποιήθηκαν και εάν είναι δημόσιοι, ποια μοντέλα και GPU, πόσο μεγάλη ήταν η προσωρινή μνήμη σε σχέση με το σύνολο εργασίας και πώς ακριβώς διαμορφώθηκε η γραμμή βάσης. Οι συγκρίσεις με μια προεπιλεγμένη ρύθμιση vLLM είναι πιο αδύναμο τεστ από τις συγκρίσεις με άλλες προσεγγίσεις με επίγνωση της κρυφής μνήμης ή κλιμακωτής προσωρινής αποθήκευσης. Χωρίς αυτές τις λεπτομέρειες, τα αναφερόμενα εύρη είναι δύσκολο να τοποθετηθούν σε σχέση με την εργασία των υπαρχόντων συστημάτων.

Δεύτερον, εάν εμφανίζεται ο κωδικός. Το CacheScout περιγράφεται ως ένα επίπεδο πάνω από το vLLM, επομένως το πρακτικό ερώτημα είναι εάν κυκλοφορεί, εάν προτείνεται για upstreaming και εάν οι πάροχοι συμπερασμάτων ή οι συντηρητές του πλαισίου εξυπηρέτησης υιοθετούν την ιδέα. Τα έγγραφα συστημάτων αυτού του είδους επηρεάζουν τις αναπτύξεις κυρίως μέσω υλοποιήσεων και μια τεχνική που απαιτεί επεμβατικές αλλαγές σε έναν χρονοπρογραμματιστή ταξιδεύει πιο αργά από μια τεχνική που ταιριάζει σε ένα υπάρχον σημείο επέκτασης.

Τρίτον, στιβαρότητα. Το μοντέλο μετάβασης που έχει μάθει θα πρέπει να βοηθά περισσότερο όταν η σειρά των πρακτόρων είναι σταθερή και μπορεί να υποβαθμιστεί όταν η δρομολόγηση είναι εξαιρετικά δυναμική ή αντίθετη, και η περίληψη δεν αναφέρει τη συμπεριφορά σε αυτό το καθεστώς, ούτε τα γενικά έξοδα εκμάθησης και προανάκτησης υπό φορτίο. Η συμπεριφορά πολλών ενοικιαστών είναι ένα άλλο ανοιχτό ερώτημα που δεν αντιμετωπίζει η πηγή: εάν η προανάκτηση ενός φόρτου εργασίας παραγκωνίζει τον άλλο και πώς η κοινή χρήση της κρυφής μνήμης αλληλεπιδρά με την απομόνωση μεταξύ των χρηστών, η οποία είναι μια επαναλαμβανόμενη ανησυχία για την επαναχρησιμοποίηση του προθέματος γενικά.

Τέταρτον, οι αριθμοί που δεν αναφέρθηκαν. Η περίληψη παρέχει μέσα για την καθυστέρηση από το χρόνο έως το πρώτο και ανά στροφή. Οι καθυστερήσεις ουράς στο 95ο ή 99ο εκατοστημόριο είναι το αντικείμενο των συμφωνιών σε επίπεδο υπηρεσιών και μια πολιτική που βελτιώνει τους μέσους όρους μπορεί να αφήσει ή να επιδεινώσει την ουρά. Η ανεξάρτητη αναπαραγωγή, ένας τόπος διεξαγωγής αξιολόγησης από ομοτίμους και οι μετρήσεις του φόρτου εργασίας που δεν επέλεξαν οι συγγραφείς θα αύξαναν την εμπιστοσύνη. Μέχρι τότε αυτή είναι μια πολλά υποσχόμενη κατεύθυνση με αυτοαναφερόμενα αποτελέσματα, όχι ένα σταθερό αποτέλεσμα.

Σχετικοί οδηγοί και κουίζ

Πράκτορες AIΕπεξήγηση μοντέλων AIΜετασχηματιστέςChatGPT και LLMΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μας
Βρήκατε αυτό χρήσιμο;