Haberlere Geri Dön
YenilikAI Understanding brifing

VisCache, Seçmeli Görsel Önbellek Budamayla Daha Hızlı Görüntü-Dil Modeli Çıkarımı Bildiriyor

Yeni bir arXiv makalesi, önbelleğin %19 ila %28'ini korurken görsel dil modelleri için görsel KV önbellek depolama alanını azaltan, eğitim gerektirmeyen bir çerçeve olan VisCache'i önermektedir. Yazarlar 2,35 kata kadar hızlanmalar bildiriyor ancak sonuçlar burada bağımsız olarak doğrulanmadı.

5 min readRead the primary source
Primary-source image accompanying VisCache Reports Faster Vision-Language Model Inference With Selective Visual Cache Pruning
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.24063
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Vizyon-Dil Modeli (VLM)
Görsel ve metinsel bilgileri ortaklaşa işleyen çok modlu bir model.
Çıkarım
Eğitilmiş bir modelin tahminler veya çıktılar ürettiği çalışma zamanı aşaması.
Budama
Boyutu ve hesaplamayı azaltmak için daha az önemli model ağırlıklarının veya nöronların kaldırılması.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Araştırmacılar Lyuke Wang, Zhuo Li ve Guangxu Zhu, vizyon dili büyük dil modellerinde uzun bağlam çıkarımının hesaplama ve bellek maliyetlerini azaltmaya yönelik bir çerçeve olan VisCache'i tanıttı. Makale 25 Ağustos 2026'da arXiv'ye gönderildi ve modelin dikkat süreci için önemli olan bilgileri korumaya çalışırken gereksiz görsel bilgileri ortadan kaldıran iki aşamalı bir yöntemi tanımlıyor.

Makale, görsel dil büyük dil modellerinde belirli bir sistem sorununu ele alıyor: uzun bağlam çıkarımı, model görsel anahtar-değer veya KV önbelleklerini koruduğu için önemli miktarda hesaplama ve bellek gerektirebilir. Bu önbellekler dikkat mekanizmasının bir parçasıdır ve model daha sonraki belirteçleri işlerken kullanılan bilgileri tutar. Yazarlar, mevcut sıkıştırma yöntemlerinin sıklıkla görsel belirteçleri ve model katmanlarını eşit şekilde budadığını, bunun da bilgileri eşit olmayan bir şekilde atabildiğini ve performansı düşürebildiğini iddia ediyor. VisCache, bu sıkıştırmayı daha seçici hale getirmeyi amaçlayan, eğitim gerektirmeyen, tak ve çalıştır bir çerçeve olarak sunulmaktadır.

VisCache'in rapor edilen iki aşaması vardır. İlk olarak, hafif bir görüş dili modeli, yalnızca anlamsal olarak bilgilendirici ana kareleri ileterek zamansal artıklığı filtreler. Bu, birçok bitişik çerçevenin çok az yeni içeriğe katkıda bulunduğu dizilerde tekrarlanan görsel bilgilerin azaltılmasını amaçlamaktadır. İkinci olarak makale, görme-dil modellerinin dikkat davranışı etrafında tasarlanmış bir algoritma olan PruneKV'yi tanıtıyor. Özette, PruneKV'nin katmanlar arasında parabolik bir budama bütçesi tahsisi ve asimetrik bir güncelleme prosedürü kullandığı belirtiliyor: değerleri birleştirirken anahtarları seçici olarak budaıyor. Belirtilen amaç, depolanan önbelleği daraltırken kritik bağlamı korumaktır.

Özetle özetlenen deneylerde yazarlar, VisCache'in 2,35 kata kadar çıkarım hızı elde ettiğini ve KV önbelleğinin yalnızca %19 ila %28'ini korurken bellek kullanımını azalttığını bildirmektedir. Ayrıca mevcut temellere göre rekabetçi performansı koruduğunu ve olumlu bir verimlilik-performans dengesi ürettiğini de söylüyorlar. Kaynak, çalışmayı bir arXiv ön baskısının 1. sürümü olarak tanımlıyor ve kodun mevcut olduğunu söylüyor ancak test edilen model adlarını, veri kümelerini, görev düzeyi puanlarını, donanım yapılandırmasını, gecikme ölçümlerini, hata oranlarını veya maksimum hızın arkasındaki kesin koşulları sağlamıyor.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Bildirilen sonuçlar yazarların deneylerinin ötesine geçerse, görsel KV önbellek gereksinimlerinin azaltılması, uzun bağlamlı görüş dili sistemlerini daha ucuz hale getirebilir ve bellek kısıtlamaları altında çalıştırılmasını daha kolay hale getirebilir. Kaynak üretime hazır olma durumunu, geniş model uyumluluğunu veya gerçek dünya performansını belirlemese de bu, uzun videoları, görüntü dizilerini veya diğer çok modlu girdileri analiz eden uygulamalar için önemli olabilir.

Çalışmanın pratik önemi model eğitiminden ziyade çıkarıma odaklanılmasından kaynaklanmaktadır. Uzun videoları veya genişletilmiş görüntü dizilerini işleyen görsel dil sistemleri, bir model eğitildikten sonra bile bellek ve tekrarlanan hesaplamalar nedeniyle kısıtlanabilir. Görev performansının çoğunu çok daha küçük bir görsel önbellekle koruyan bir yöntem, mevcut hızlandırıcı belleğine daha fazla girişin sığmasına olanak tanıyabilir, önbelleğe alınan verilerin hareketini azaltabilir ve potansiyel olarak çok modlu hizmetlerin maliyetini veya gecikmesini azaltabilir. Bunlar, kaynak tarafından bağımsız olarak belirlenen sonuçlar değil, rapor edilen mekanizmanın sonuçlarıdır.

Önerilen yaklaşım aynı zamanda görsel bağlamın neden metin bağlamından farklı bir yaklaşıma ihtiyaç duyabileceğini de vurgulamaktadır. Bir video, çok az anlam değişikliği olan çok sayıda kare içerebilirken, az sayıda kare, bir soruyu yanıtlamak için gerekli olan bilgileri içerebilir. Benzer şekilde görsel temsilin önemi de modelin katmanlarına göre değişiklik gösterebilir. Makalenin ana kare filtrelemesi ve katmana bağlı budaması, her yerde tek bir saklama kuralı uygulamak yerine bu farklılıklar etrafında tasarlanmıştır. Yaklaşım sağlamsa, geliştiricilere, her modeli sıkıştırılmış bir gösterim için yeniden eğitmeden, çok modlu modellerin kaynak taleplerini yönetmeleri için başka bir yol sunabilir.

İddialar ön hazırlık niteliğindedir. Kaynak bir arXiv gönderimidir, hakemli kabulün veya bağımsız çoğaltmanın kanıtı değildir. "Rekabetçi performans" kesin bir garanti değildir ve özette, yöntemin görevler, video uzunlukları, görüntü türleri veya hataya duyarlı uygulamalar genelinde doğruluğu eşit şekilde koruyup korumadığı belirtilmemektedir. Bu sonuçlar donanıma, yazılım uygulamasına, toplu işleme ve ek filtreleme aşamasının maliyetine bağlı olduğundan, rapor edilen hızlanmanın doğrudan daha düşük bulut faturalarına veya kullanıcı tarafından görülebilen daha iyi gecikme süresine dönüşeceğini de ortaya koymaz.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Ana sorular, VisCache'in farklı görüş dili modelleri, görevleri, görsel girdileri ve donanım ortamları genelinde genelleştirilip genelleştirilmediği ve zor durumlarda doğruluğun ne kadar kaybolduğudur. Bağımsız çoğaltma, yayımlanan kod ve ayrıntılı kıyaslama sonuçları, rapor edilen verimlilik kazanımlarının genel olarak yararlı bir sistem ilerlemesini mi yoksa makalenin test koşullarıyla sınırlı bir sonucu mu temsil ettiğini değerlendirmek için önemli olacaktır.

İlk öncelik tekrarlanabilirliktir. Yazarlar, kodun mevcut olduğunu söylüyor; böylece dışarıdan araştırmacılar ve mühendisler, bildirilen 2,35 kat maksimum hızlanma ve %19 ila %28 tutma aralığının aynı yapılandırmalarda tekrarlanıp tekrarlanmadığını test edebilirler. Yararlı doğrulama, tam temel tanımları, model ve veri kümesi kapsamını, uçtan uca gecikmeyi, en yüksek belleği, enerji kullanımını ve hafif filtreleme modelinin getirdiği ek yükü içerecektir. Tek başına maksimum sonuç, iş yükleri genelinde tipik faydayı göstermez.

Araştırmacılar ayrıca budamadan kaynaklanan kalite hatalarını da incelemelidir. Ana kare seçimi kısa ama önemli olayları kaldırabilirken, agresif önbellek sıkıştırması yalnızca bir kez görünen nesneleri, eylemleri veya ilişkileri etkileyebilir. Asimetrik anahtar budama ve değer birleştirme tasarımı, bazı bilgileri tekdüze budamadan daha iyi koruyabilir, ancak kaynak, hangi görevlerin en hassas olduğunu veya elde tutma düştükçe hataların nasıl değiştiğini tanımlamaz. Bu nedenle değerlendirmeler, yalnızca toplam puanları değil, küçük görsel ayrıntıların, uzun vadeli zamansal akıl yürütmenin ve karşıt veya belirsiz dizilerin geri çağrılmasını da test etmelidir.

Son olarak, dağıtım iddiaları araştırma iddialarından ayrılmalıdır. Bu kaynaktan hangi görüş dili modellerinin VisCache'i değişiklik yapmadan kullanabileceği, yöntemin farklı hızlandırıcı türlerinde çalışıp çalışmadığı veya modeller aynı anda birçok kullanıcıya hizmet verdiğinde faydalarının devam edip etmediği bilinmiyor. Makalenin gelecek versiyonları, hakemli analizler, daha kapsamlı kıyaslamalar ve bağımsız kullanıcılardan gelen raporlar bu noktaları açıklığa kavuşturabilir. O zamana kadar VisCache'in, uzun bağlamlı çok modlu çıkarım için kanıtlanmış evrensel bir çözüm olarak değil, verimlilik kazanımları bildirilen umut verici bir araştırma teklifi olarak anlaşılması en iyisidir.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıTransformatörlerChatGPT ve LLM'lerBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?