Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το ProViP χρησιμοποιεί κλάδεμα με επίγνωση του κεφαλιού για να κόψει οπτικά διακριτικά σε μοντέλα γλώσσας όρασης

Μια νέα προεκτύπωση arXiv προτείνει το ProViP, μια μέθοδο χωρίς εκπαίδευση που αφαιρεί σταδιακά τα περιττά οπτικά διακριτικά και εστιάζει το κλάδεμα στις κεφαλές προσοχής που είναι πιο χρήσιμες για την επιλογή κρίσιμων οπτικών πληροφοριών. Σε ένα αναφερόμενο πείραμα LLaVA-1.5-7B, διατήρησε το 95,9% της αρχικής απόδοσης ενώ παρέδωσε ένα…

6 min readRead the primary source
Primary-source image accompanying ProViP uses head-aware pruning to cut visual tokens in vision-language models
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2608.25332
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Κλάδεμα
Αφαίρεση λιγότερο σημαντικών βαρών μοντέλων ή νευρώνων για μείωση του μεγέθους και υπολογισμού.
Vision-Language Model (VLM)
Ένα πολυτροπικό μοντέλο που επεξεργάζεται από κοινού οπτικές και κειμενικές πληροφορίες.
Μεγάλο μοντέλο γλώσσας (LLM)
Ένα μοντέλο γλώσσας εκπαιδευμένο σε τεράστια σώματα κειμένου για τη δημιουργία και ανάλυση κειμένου.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Οι ερευνητές έχουν προτείνει το ProViP, ένα πλαίσιο χωρίς εκπαίδευση για τη μείωση του αριθμού των οπτικών διακριτικών που υποβάλλονται σε επεξεργασία από μοντέλα γλώσσας όρασης κατά τη διάρκεια της εξαγωγής συμπερασμάτων. Η εργασία υποστηρίζει ότι η οπτική συμβολική σημασία δεν κατανέμεται ομοιόμορφα σε όλες τις κεφαλές προσοχής: ένα μικρό κλάσμα κεφαλιών φαίνεται να είναι ιδιαίτερα χρήσιμο για τον προσδιορισμό των οπτικών πληροφοριών που απαιτούνται για μια εργασία. Το ProViP χρησιμοποιεί αυτή την παρατήρηση για να κάνει το κλάδεμα διακριτικών αντί να βασίζεται μόνο στην προσοχή που συγκεντρώνεται σε όλο το επίπεδο κλαδέματος.

Η εργασία, που υποβλήθηκε στο arXiv στις 26 Αυγούστου 2026, αντιμετωπίζει ένα πρακτικό πρόβλημα συμπερασμάτων σε μοντέλα γλώσσας όρασης ή VLM. Αυτά τα συστήματα μετατρέπουν την οπτική είσοδο σε οπτικά διακριτικά που στη συνέχεια επεξεργάζονται από ένα μεγάλο μοντέλο γλωσσικής ραχοκοκαλιάς. Οι συγγραφείς λένε ότι ο αριθμός των οπτικών διακριτικών έχει αυξηθεί γρήγορα και ότι αυτό δημιουργεί μνήμη και υπολογιστικό κόστος, αυξάνοντας την καθυστέρηση συμπερασμάτων. Η πηγή παρουσιάζει το κλάδεμα συμβολικών ως τρόπο μείωσης αυτού του φόρτου απορρίπτοντας οπτικά διακριτικά που κρίνονται περιττά.

Οι συγγραφείς επικεντρώνονται στον τρόπο με τον οποίο εκτιμάται η συμβολική σημασία. Περιγράφουν μια κοινή προσέγγιση στην οποία οι βαθμολογίες προσοχής από όλες τις κεφαλές σε ένα στρώμα κλαδέματος συγκεντρώνονται και τα μάρκες με χαμηλότερες συνδυασμένες βαθμολογίες αφαιρούνται. Ο κεντρικός ισχυρισμός τους είναι ότι η ικανότητα αναγνώρισης κρίσιμων οπτικών σημείων συγκεντρώνεται σε ένα μικρό κλάσμα κεφαλιών προσοχής. Σύμφωνα με την περίληψη της εργασίας, η συγκέντρωση πληροφοριών από αυτές τις επιλεγμένες κεφαλές μπορεί να βελτιώσει την απόδοση της εργασίας σε σύγκριση με την ίδια αντιμετώπιση όλων των κεφαλών. Αυτό είναι το αναφερόμενο εύρημα της εργασίας, όχι ένα ανεξάρτητο αποτέλεσμα.

Το ProViP εφαρμόζει την ιδέα σε δύο στάδια. Προτού η ραχοκοκαλιά του μοντέλου γλώσσας ξεκινήσει τη διαδικασία συλλογισμού του, αφαιρεί τα περιττά οπτικά διακριτικά χρησιμοποιώντας ενσωματωμένη ομοιότητα μεταξύ των διακριτικών εισόδου. Κατά τη διάρκεια του συλλογισμού, εκτελεί πρόσθετο κλάδεμα χρησιμοποιώντας την προτεινόμενη στρατηγική επιλογής με επίγνωση κεφαλής. Το πλαίσιο περιγράφεται ως χωρίς εκπαίδευση, που σημαίνει ότι η μέθοδος προορίζεται να λειτουργήσει χωρίς πρόσθετο στάδιο εκπαίδευσης για το μοντέλο. Η πηγή δεν αναφέρει εάν το ProViP απαιτεί βαθμονόμηση συγκεκριμένου μοντέλου ή άλλη ρύθμιση πέρα ​​από τη διαδικασία κλαδέματος.

Το αποτέλεσμα της επικεφαλίδας στην πηγή είναι ένα πείραμα στο LLaVA-1.5-7B. Οι συγγραφείς αναφέρουν ότι το ProViP διατήρησε το 95,9% της αρχικής απόδοσης και πέτυχε 1,62x επιτάχυνση συμπερασμάτων, ενώ κλάδεψε το 88,9% των οπτικών διακριτικών. Η περίληψη δεν προσδιορίζει την εργασία ή τις εργασίες πίσω από αυτό το σχήμα, τη διαμόρφωση γραμμής βάσης, το υλικό, τη μέτρηση του λανθάνοντος χρόνου ή τον ακριβή ορισμό της διατηρούμενης απόδοσης. Αυτές οι λεπτομέρειες που λείπουν έχουν σημασία κατά την ερμηνεία του αποτελέσματος και εμποδίζουν τον αριθμό να αντιμετωπίζεται ως γενική εγγύηση.

Στοιχεία πηγής: arxiv.org ↗

Γιατί έχει σημασία

Τα μοντέλα γλώσσας όρασης μπορούν να επιφέρουν σημαντική μνήμη και υπολογιστικό κόστος όταν επεξεργάζονται μεγάλο αριθμό οπτικών διακριτικών. Εάν η αναφερθείσα ανταλλαγή ισχύει για περισσότερα μοντέλα και εργασίες, το κλάδεμα με επίγνωση θα μπορούσε να κάνει την οπτική λογική γρηγορότερη χωρίς να απαιτείται επανεκπαίδευση του μοντέλου. Το αποτέλεσμα είναι ακόμη ένας πρώιμος ερευνητικός ισχυρισμός από μια μόνο προεκτύπωση arXiv και η πηγή δεν καθορίζει πόσο γενικά γενικεύονται η μετρούμενη απόδοση και η επιτάχυνση.

Το πρακτικό πρόβλημα είναι σημαντικό για οποιαδήποτε ανάπτυξη στην οποία ένα VLM πρέπει να επεξεργάζεται εικόνες γρήγορα ή να χειρίζεται πολλά αιτήματα. Κάθε οπτικό διακριτικό που διατηρείται για μεταγενέστερη επεξεργασία συμβάλλει στον υπολογιστικό φόρτο εργασίας και στη χρήση μνήμης του μοντέλου. Μια μέθοδος που μπορεί να αφαιρέσει τα περισσότερα διακριτικά διατηρώντας παράλληλα μεγάλο μέρος της μετρούμενης απόδοσης ενός μοντέλου θα μπορούσε να μειώσει τον όγκο της εργασίας που εκτελείται κατά την εξαγωγή συμπερασμάτων. Η πηγή υποστηρίζει αυτό το δυναμικό μέσω του αναφερθέντος πειράματός της, αλλά δεν δημιουργεί λειτουργική εξοικονόμηση πέρα ​​από την αναφερόμενη επιτάχυνση.

Η προτεινόμενη συνεισφορά του ProViP είναι επίσης εννοιολογική. Αμφισβητεί την υπόθεση ότι οι κεφαλές προσοχής πρέπει να αντιμετωπίζονται ως εξίσου ενημερωτικές κατά την επιλογή οπτικών διακριτικών. Εάν η παρατήρηση των συγγραφέων είναι αναπαραγώγιμη, τα συστήματα κλαδέματος μπορεί να ωφεληθούν από τον εντοπισμό ποιες κεφαλές φέρουν χρήσιμα σήματα επιλογής αντί να υπολογίζουν τον μέσο όρο σε όλες τις κεφαλές. Αυτό θα μπορούσε να προσφέρει έναν πιο στοχευμένο τρόπο συμπίεσης της οπτικής εισόδου διατηρώντας παράλληλα πληροφορίες σχετικές με την εργασία.

Ο σχεδιασμός χωρίς εκπαίδευση θα μπορούσε να καταστήσει ευκολότερη την αξιολόγηση της μεθόδου σε υπάρχοντα VLM από τις προσεγγίσεις που απαιτούν επανεκπαίδευση ή τελειοποίηση. Μπορεί να είναι ιδιαίτερα χρήσιμο σε ρυθμίσεις όπου τα βάρη του μοντέλου είναι σταθερά και η αποτελεσματικότητα των συμπερασμάτων είναι ο κύριος διαθέσιμος στόχος βελτιστοποίησης. Ωστόσο, το "χωρίς εκπαίδευση" δεν αποδεικνύει από μόνο του ότι η μέθοδος είναι απλή στην ενσωμάτωση, συμβατή με κάθε αρχιτεκτονική ή ωφέλιμη σε κάθε διαμόρφωση υπηρεσίας. Η πηγή δεν παρέχει καμία μελέτη ανάπτυξης ή λεπτομέρειες εφαρμογής πέρα ​​από την περίληψη.

Ο ισχυρότερος περιορισμός είναι τα περιορισμένα στοιχεία που είναι διαθέσιμα στην πηγή. Η εργασία είναι μια πρόσφατα υποβληθείσα προτύπωση arXiv και όχι μια δημοσίευση με κριτές και η περίληψη υπογραμμίζει ένα παράδειγμα που αφορά το LLaVA-1.5-7B. Δεν αναφέρει πώς συγκρίνεται το ProViP με άλλες μεθόδους κλαδέματος σε μια ευρεία σουίτα σημείων αναφοράς, εάν οι απώλειες ακρίβειας συγκεντρώνονται σε συγκεκριμένες εργασίες ή πόσο από την επιτάχυνση προέρχεται από το ίδιο το κλάδεμα και όχι από τις επιλογές υλοποίησης. Τα αναφερόμενα στοιχεία είναι επομένως ελπιδοφόρα αλλά προσωρινά.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Οι σημαντικοί επόμενοι έλεγχοι είναι οι πλήρεις πειραματικές λεπτομέρειες της εργασίας: ποιες εργασίες και σημεία αναφοράς χρησιμοποιήθηκαν, ποιο υλικό παρήγαγε την επιτάχυνση, πώς μετρήθηκε η απόδοση και εάν η μέθοδος παραμένει αξιόπιστη σε διαφορετικά μοντέλα γλώσσας όρασης και τύπους εικόνας. Η αναπαραγωγή θα πρέπει επίσης να ελέγξει εάν το επιθετικό κλάδεμα προκαλεί συγκεκριμένες αστοχίες στη λεπτομερή αναγνώριση, την οπτική γείωση ή άλλες εργασίες που εξαρτώνται από μικρές λεπτομέρειες εικόνας.

Το πλήρες έγγραφο θα πρέπει να διευκρινίσει την πειραματική βάση για το ποσοστό διατήρησης απόδοσης 95,9%. Οι αναγνώστες πρέπει να γνωρίζουν ποια σημεία αναφοράς και εργασίες χρησιμοποιήθηκαν, τι σημαίνει «αρχική απόδοση» και εάν η σύγκριση έγινε με ένα μη κλαδευμένο σύστημα LLaVA-1.5-7B υπό τις ίδιες συνθήκες. Το έγγραφο θα πρέπει επίσης να αναφέρει αποτελέσματα σε πολλαπλούς τυχαίους σπόρους ή ρυθμίσεις αξιολόγησης, όπου χρειάζεται, καθώς μια μεμονωμένη εργασία ή σύνολο δεδομένων θα μπορούσε να κάνει τον συμβιβασμό να φαίνεται καλύτερος από ό,τι σε ευρύτερη χρήση.

Το υλικό και οι συνθήκες εξυπηρέτησης θα είναι κεντρικά για την αξιολόγηση της ταχύτητας 1,62x. Οι μελλοντικές αναφορές θα πρέπει να εξετάζουν τους επεξεργαστές ή τους επιταχυντές που χρησιμοποιούνται, τα μεγέθη παρτίδας, τις αναλύσεις εικόνας, τα μήκη ακολουθίας και εάν η μέτρηση περιλαμβάνει το γενικό κόστος των ομοιοτήτων υπολογιστών και την επιλογή κεφαλών προσοχής. Μια μέθοδος κλαδέματος μπορεί να μειώσει τον θεωρητικό υπολογισμό χωρίς να παράγει την ίδια πραγματική βελτίωση του λανθάνοντος χρόνου, εάν τα βήματα επιλογής είναι δαπανηρά ή ανεπαρκώς υποστηρίζονται από τη στοίβα εξυπηρέτησης.

Οι ερευνητές θα πρέπει να ελέγξουν εάν το επιθετικό κλάδεμα αλλάζει τα είδη των λαθών που κάνει ένα VLM. Η κατάργηση του 88,9% των οπτικών διακριτικών μπορεί να διατηρήσει τις συγκεντρωτικές βαθμολογίες συγκριτικής αξιολόγησης, ενώ βλάπτει τις λεπτομέρειες που είναι σημαντικές για μικρά αντικείμενα, χωρικές σχέσεις, κείμενο σε εικόνες ή οπτική γείωση. Η πηγή δεν αναφέρει τέτοιες καταστάσεις αποτυχίας. Αξιολογήσεις που επιθεωρούν τόσο τη συνολική ακρίβεια όσο και παραδείγματα χαμένων οπτικών πληροφοριών θα βοηθούσαν να καθοριστεί εάν η μέθοδος είναι κατάλληλη για εφαρμογές ευαίσθητες στην ασφάλεια ή εξαρτώμενες από τις λεπτομέρειες.

Η αναπαραγωγή σε αρχιτεκτονικές και εισόδους θα καθορίσει εάν η αξιούμενη συγκέντρωση χρήσιμης ικανότητας επιλογής είναι μια γενική ιδιότητα ή μια παρατήρηση συγκεκριμένου μοντέλου. Σημαντικές δοκιμές θα περιλαμβάνουν άλλους βασικούς άξονες VLM, διαφορετικά μεγέθη και περιεχόμενο εικόνας, καθώς και εργασίες που απαιτούν είτε ευρεία κατανόηση σκηνής είτε λεπτομερή οπτικά στοιχεία. Η κατάσταση του κώδικα, η διαθεσιμότητα υλοποίησης και η αξιολόγηση από ομοτίμους είναι επίσης άγνωστα από την πηγή. Μέχρι να απαντηθούν αυτές οι ερωτήσεις, το ProViP θα πρέπει να θεωρείται ως ερευνητική πρόταση με ενθαρρυντικό αρχικό αποτέλεσμα και όχι ως επικυρωμένο πρότυπο παραγωγής.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΜετασχηματιστέςΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;