Kembali ke Berita
InovasiAI Understanding taklimat

VisCache Melaporkan Inferens Model Bahasa Penglihatan yang Lebih Pantas Dengan Pemangkasan Cache Visual Terpilih

Kertas arXiv baharu mencadangkan VisCache, rangka kerja tanpa latihan yang mengurangkan storan cache KV visual untuk model bahasa penglihatan sambil mengekalkan 19% hingga 28% daripada cache. Penulis melaporkan kelajuan sehingga 2.35 kali, tetapi hasilnya tidak disahkan secara bebas di sini.

5 min readRead the primary source
Primary-source image accompanying VisCache Reports Faster Vision-Language Model Inference With Selective Visual Cache Pruning
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.24063
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Penglihatan (VLM)
Model multimodal yang memproses maklumat visual dan teks secara bersama.
Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Pemangkasan
Mengalih keluar pemberat model atau neuron yang kurang penting untuk mengurangkan saiz dan mengira.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Penyelidik Lyuke Wang, Zhuo Li dan Guangxu Zhu memperkenalkan VisCache, rangka kerja untuk mengurangkan kos pengiraan dan ingatan inferens konteks panjang dalam model bahasa besar bahasa penglihatan. Kertas itu telah diserahkan kepada arXiv pada 25 Ogos 2026, dan menerangkan kaedah dua peringkat yang mengalih keluar maklumat visual yang berlebihan semasa cuba mengekalkan maklumat yang penting untuk proses perhatian model.

Kertas kerja menangani masalah sistem tertentu dalam model bahasa besar bahasa penglihatan: inferens konteks panjang boleh memerlukan pengiraan dan ingatan yang besar kerana model mengekalkan nilai kunci visual, atau KV, cache. Cache ini adalah sebahagian daripada mekanisme perhatian dan menyimpan maklumat yang digunakan sebagai model memproses token kemudian. Penulis berpendapat bahawa kaedah pemampatan sedia ada sering memangkas token visual dan lapisan model secara seragam, yang boleh membuang maklumat secara tidak sekata dan mengurangkan prestasi. VisCache dipersembahkan sebagai rangka kerja tanpa latihan, pasang dan main yang bertujuan untuk menjadikan pemampatan itu lebih selektif.

VisCache mempunyai dua peringkat yang dilaporkan. Pertama, model bahasa penglihatan ringan menapis redundansi temporal dengan memajukan hanya bingkai kekunci bermaklumat secara semantik. Ini bertujuan untuk mengurangkan maklumat visual berulang dalam urutan di mana banyak bingkai bersebelahan menyumbang sedikit kandungan baharu. Kedua, makalah itu memperkenalkan PruneKV, algoritma yang direka di sekitar tingkah laku perhatian model bahasa penglihatan. Abstrak mengatakan PruneKV menggunakan peruntukan parabola bagi belanjawan pemangkasan merentas lapisan dan prosedur kemas kini asimetri: ia secara selektif memangkas kekunci sambil menggabungkan nilai. Matlamat yang dinyatakan adalah untuk mengekalkan konteks kritikal sambil mengecilkan cache yang disimpan.

Dalam eksperimen yang diringkaskan oleh abstrak, penulis melaporkan bahawa VisCache mencapai kelajuan inferens sehingga 2.35 kali dan mengurangkan penggunaan memori sambil mengekalkan hanya 19% hingga 28% daripada cache KV. Mereka juga mengatakan ia mengekalkan prestasi kompetitif berbanding garis dasar sedia ada dan menghasilkan pertukaran prestasi kecekapan yang menggalakkan. Sumber mengenal pasti kerja itu sebagai versi 1 pracetak arXiv dan mengatakan kod tersedia, tetapi ia tidak memberikan nama model yang diuji, set data, skor peringkat tugas, konfigurasi perkakasan, pengukuran kependaman, kadar ralat atau keadaan tepat di sebalik kelajuan maksimum.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Jika keputusan yang dilaporkan bertahan di luar percubaan pengarang, mengurangkan keperluan cache KV visual boleh menjadikan sistem bahasa penglihatan konteks panjang lebih murah dan lebih mudah dijalankan di bawah kekangan memori. Ini mungkin penting untuk aplikasi yang menganalisis video panjang, jujukan imej atau input berbilang mod lain, walaupun sumbernya tidak menetapkan kesediaan pengeluaran, keserasian model yang luas atau prestasi dunia sebenar.

Kepentingan praktikal kerja datang daripada tumpuannya pada inferens dan bukannya latihan model. Sistem bahasa penglihatan yang memproses video panjang atau jujukan imej lanjutan boleh dikekang oleh ingatan dan pengiraan berulang walaupun selepas model telah dilatih. Kaedah yang mengekalkan kebanyakan prestasi tugas dengan cache visual yang lebih kecil boleh membenarkan lebih banyak input dimuatkan dalam memori pemecut yang tersedia, mengurangkan pergerakan data cache dan berpotensi menurunkan kos atau kependaman perkhidmatan multimodal. Ini adalah implikasi daripada mekanisme yang dilaporkan, bukan hasil yang ditetapkan secara bebas oleh sumber.

Pendekatan yang dicadangkan juga menyerlahkan mengapa konteks visual mungkin memerlukan rawatan yang berbeza daripada konteks teks. Video boleh mengandungi banyak bingkai dengan sedikit perubahan semantik, manakala sebilangan kecil bingkai mungkin mengandungi maklumat yang penting untuk menjawab soalan. Begitu juga, kepentingan perwakilan visual mungkin berbeza merentasi lapisan model. Penapisan bingkai kunci kertas dan pemangkasan bergantung pada lapisan direka bentuk berdasarkan perbezaan tersebut daripada menggunakan satu peraturan pengekalan di mana-mana sahaja. Jika pendekatan itu mantap, ia boleh memberi pembangun cara lain untuk mengurus permintaan sumber model multimodal tanpa melatih semula setiap model untuk perwakilan termampat.

Tuntutan itu kekal awal. Sumbernya ialah penyerahan arXiv, bukan bukti penerimaan semakan rakan sebaya atau replikasi bebas. "Prestasi kompetitif" bukanlah jaminan yang tepat dan abstrak tidak menyatakan sama ada kaedah itu mengekalkan ketepatan sama rata merentas tugas, panjang video, jenis imej atau aplikasi sensitif kegagalan. Ia juga tidak menetapkan bahawa kelajuan yang dilaporkan akan diterjemahkan terus ke dalam bil awan yang lebih rendah atau kependaman yang boleh dilihat oleh pengguna yang lebih baik, kerana hasil tersebut bergantung pada perkakasan, pelaksanaan perisian, batching dan kos peringkat penapisan tambahan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Soalan utama ialah sama ada VisCache membuat generalisasi merentas model bahasa penglihatan yang berbeza, tugas, input visual dan persekitaran perkakasan, dan berapa banyak ketepatan yang hilang dalam kes yang sukar. Replikasi bebas, kod yang dikeluarkan dan keputusan penanda aras terperinci akan menjadi penting untuk menilai sama ada keuntungan kecekapan yang dilaporkan mewakili kemajuan sistem yang berguna secara meluas atau keputusan terhad kepada keadaan ujian kertas.

Keutamaan pertama ialah kebolehulangan. Penulis mengatakan kod tersedia, jadi penyelidik dan jurutera luar boleh menguji sama ada kelajuan maksimum 2.35 kali yang dilaporkan dan julat pengekalan 19% hingga 28% berulang pada konfigurasi yang sama. Pengesahan berguna akan merangkumi definisi garis dasar penuh, model dan liputan set data, kependaman hujung ke hujung, memori puncak, penggunaan tenaga dan overhed yang diperkenalkan oleh model penapisan ringan. Hasil maksimum sahaja tidak menunjukkan faedah biasa merentas beban kerja.

Penyelidik juga harus meneliti kegagalan kualiti yang disebabkan oleh pemangkasan. Pemilihan kerangka kunci boleh mengalih keluar peristiwa ringkas tetapi penting, manakala pemampatan cache yang agresif boleh menjejaskan objek, tindakan atau perhubungan yang muncul sekali sahaja. Reka bentuk pemangkasan kunci asimetri dan gabungan nilai mungkin mengekalkan beberapa maklumat dengan lebih baik daripada pemangkasan seragam, tetapi sumber tidak mengenal pasti tugas mana yang paling sensitif atau cara ralat berubah apabila pengekalan jatuh. Oleh itu, penilaian harus menguji perolehan butiran visual kecil, penaakulan temporal jarak jauh dan urutan lawan atau samar-samar, bukan sahaja skor agregat.

Akhir sekali, tuntutan penempatan harus diasingkan daripada tuntutan penyelidikan. Tidak diketahui dari sumber ini model bahasa penglihatan yang boleh menggunakan VisCache tanpa pengubahsuaian, sama ada kaedah itu berfungsi merentasi jenis pemecut yang berbeza, atau sama ada faedahnya kekal apabila model memberi perkhidmatan kepada ramai pengguna secara serentak. Versi masa hadapan kertas kerja, analisis semakan rakan sebaya, penanda aras yang lebih luas dan laporan daripada pengguna bebas boleh menjelaskan perkara tersebut. Sehingga itu, VisCache paling difahami sebagai cadangan penyelidikan yang menjanjikan dengan peningkatan kecekapan yang dilaporkan, bukan sebagai penyelesaian universal yang terbukti untuk inferens multimodal konteks panjang.

Panduan & kuiz berkaitan

Model AI DiterangkanTransformerChatGPT & LLMUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?