Vissza a Hírekhez
InnovációAI Understanding eligazítás

A ProViP fej-felismerő metszéssel vágja ki a vizuális tokeneket a látásnyelvi modellekben

Az új arXiv előnyomtatás a ProViP-t javasolja, egy olyan képzés nélküli módszert, amely fokozatosan eltávolítja a redundáns vizuális tokeneket, és a kritikus vizuális információk kiválasztásához leghasznosabb figyelemfejekre összpontosítja a metszést. Az egyik bejelentett LLaVA-1.5-7B kísérletben megőrizte az eredeti teljesítmény 95,9%-át, miközben…

6 min readRead the primary source
Primary-source image accompanying ProViP uses head-aware pruning to cut visual tokens in vision-language models
Elsődleges forrású dokumentumForrás rögzített
Kiadó
arxiv.org
Forrás link
arxiv.orghttps://arxiv.org/abs/2608.25332
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Metszés
A kevésbé fontos modellsúlyok vagy neuronok eltávolítása a méret csökkentése és a számítás érdekében.
Vision-Language Model (VLM)
Multimodális modell, amely közösen dolgozza fel a vizuális és szöveges információkat.
Nagy nyelvű modell (LLM)
Hatalmas szövegkorpusokra kiképzett nyelvi modell szöveg generálására és elemzésére.
Teszteld magadAI modellek magyarázata kvíz

Mi történt

A kutatók javaslatot tettek a ProViP-re, egy képzés nélküli keretrendszerre a látásnyelvi modellek által feldolgozott vizuális tokenek számának csökkentésére a következtetés során. A tanulmány azzal érvel, hogy a vizuális jelek fontossága nem oszlik meg egyenletesen az összes figyelemfej között: a fejek egy kis része különösen hasznosnak tűnik a feladathoz szükséges vizuális információk azonosításához. A ProViP ezt a megfigyelést arra használja fel, hogy tudatossá tegye a tokenmetszés fejét, ahelyett, hogy csak a teljes metszésrétegen összesített figyelemre hagyatkozna.

A arXiv-hez 2026. augusztus 26-án benyújtott cikk egy gyakorlati következtetési problémával foglalkozik a látásnyelvi modellekben vagy VLM-ekben. Ezek a rendszerek a vizuális bemenetet vizuális tokenekké alakítják, amelyeket aztán egy nagy nyelvi modell gerince dolgoz fel. A szerzők azt mondják, hogy a vizuális tokenek száma gyorsan nőtt, és ez memória és számítási többletterhelést eredményez, növelve a következtetési késleltetést. A forrás a tokenmetszés módszerét mutatja be, amellyel csökkenthető ez a teher a feleslegesnek ítélt vizuális tokenek eldobásával.

A szerzők a token fontosságának becslésére összpontosítanak. Egy általános megközelítést írnak le, amelyben a metszésréteg összes fejének figyelempontszámait összesítik, és eltávolítják az alacsonyabb kombinált pontszámú tokeneket. Központi állításuk az, hogy a kritikus vizuális tokenek azonosításának képessége a figyelemfejek kis részében összpontosul. A cikk absztraktja szerint a kiválasztott fejektől származó információk összesítése javíthatja a feladatteljesítményt az összes fej egyformán történő kezeléséhez képest. Ez a lap által közölt megállapítás, nem pedig egy önállóan megállapított eredmény.

A ProViP két szakaszban alkalmazza az ötletet. Mielőtt a nyelvi modell gerince elkezdené az érvelési folyamatot, eltávolítja a redundáns vizuális tokeneket a beviteli tokenek közötti hasonlóság beágyazásával. Az érvelés során további metszést hajt végre a javasolt fejtudatos kiválasztási stratégia segítségével. A keretrendszert képzésmentesnek írják le, ami azt jelenti, hogy a módszer a modell további képzési szakasza nélkül működik. A forrás nem közli, hogy a ProViP modellspecifikus kalibrálást vagy más beállítást igényel-e a metszési eljáráson túl.

A forrás fő eredménye egy LLaVA-1.5-7B kísérlet. A szerzők arról számolnak be, hogy a ProViP megtartotta az eredeti teljesítmény 95,9%-át, és 1,62-szeres következtetési sebességet ért el, miközben a vizuális tokenek 88,9%-át levágta. Az absztrakt nem azonosítja az ábra mögött álló feladatot vagy feladatokat, az alapkonfigurációt, a hardvert, a késleltetés mérését vagy a megőrzött teljesítmény pontos meghatározását. A hiányzó részletek fontosak az eredmény értelmezésekor, és megakadályozzák, hogy a számot általános garanciaként kezeljék.

Forrás részletei: arxiv.org ↗

Miért számít

A látásnyelvi modellek jelentős memória- és számítási többletterhelést okozhatnak, amikor nagyszámú vizuális tokent dolgoznak fel. Ha a jelentett kompromisszum több modellre és feladatra vonatkozik, a fejtudatos metszés gyorsabbá teheti a vizuális érvelést anélkül, hogy a modell átképzését igényelné. Az eredmény még mindig egy korai kutatási állítás egyetlen arXiv előnyomatból, és a forrás nem állapítja meg, hogy a mért teljesítmény és gyorsulás milyen széles körben általánosítható.

A gyakorlati probléma minden olyan telepítésnél jelentős, amelyben a VLM-nek gyorsan kell feldolgoznia a képeket, vagy sok kérést kell kezelnie. Minden későbbi feldolgozásra megőrzött vizuális token hozzájárul a modell számítási terheléséhez és memóriahasználatához. Egy olyan módszer, amely képes eltávolítani a legtöbb tokent, miközben megőrzi a modell mért teljesítményének nagy részét, csökkentheti a következtetés során végzett munka mennyiségét. A forrás alátámasztja ezt a lehetőséget a bejelentett kísérletével, de nem hoz létre működési megtakarítást a megadott gyorsuláson túl.

A ProViP javasolt hozzájárulása szintén koncepcionális. Megkérdőjelezi azt a feltételezést, hogy a figyelemfejeket egyformán informatívnak kell tekinteni a vizuális tokenek kiválasztásakor. Ha a szerzők megfigyelése reprodukálható, a metszőrendszerek számára előnyös lehet annak azonosítása, hogy mely fejek hordoznak hasznos kiválasztási jeleket, ahelyett, hogy az összes fejre átlagolnának. Ez célzottabb módot kínálhat a vizuális bemenet tömörítésére, miközben megőrzi a feladathoz kapcsolódó információkat.

A képzés nélküli kialakítás megkönnyítheti a módszer értékelését a meglévő VLM-eken, mint az átképzést vagy finomhangolást igénylő megközelítéseket. Különösen hasznos lehet olyan beállításokban, ahol a modell súlya rögzített, és a következtetési hatékonyság a fő elérhető optimalizálási cél. A „képzésmentes” azonban önmagában nem jelenti azt, hogy a módszer egyszerűen integrálható, minden architektúrával kompatibilis, vagy minden kiszolgálási konfigurációban előnyös. A forrás az absztrakton túl nem tartalmaz telepítési tanulmányt vagy megvalósítási részleteket.

A legerősebb korlát a forrásban elérhető szűk bizonyíték. A cikk egy újonnan benyújtott arXiv preprint, nem pedig lektorált kiadvány, és az absztrakt egy példát emel ki az LLaVA-1.5-7B-vel. Nem mondja meg, hogy a ProViP hogyan viszonyul a többi metszési módszerhez egy széles benchmark csomagban, hogy a pontossági veszteségek bizonyos feladatokra koncentrálódnak-e, vagy hogy a gyorsulás mekkora része magából a metszésből ered, nem pedig a megvalósítási döntésekből. A közölt adatok tehát ígéretesek, de ideiglenesek.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktív koncepció ellenőrzése+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Mit nézzünk ezután

A következő fontos ellenőrzések a papír teljes kísérleti részlete: milyen feladatokat és benchmarkokat használtak, milyen hardver eredményezte a gyorsítást, hogyan mérték a teljesítményt, és hogy a módszer megbízható marad-e a különböző látásnyelvi modellekben és képtípusokban. A replikációnak azt is meg kell vizsgálnia, hogy az agresszív metszés nem okoz-e konkrét hibákat a finomszemcsés felismerésben, a vizuális földelésben vagy más olyan feladatokban, amelyek a kép apró részleteitől függenek.

A teljes cikknek tisztáznia kell a 95,9%-os teljesítménymegtartási érték kísérleti alapját. Az olvasóknak tudniuk kell, hogy milyen benchmarkokat és feladatokat használtak, mit jelent az „eredeti teljesítmény”, és hogy az összehasonlítást egy metszetlen LLaVA-1.5-7B rendszerrel azonos körülmények között végezték-e el. A dolgozatnak adott esetben több véletlenszerű magról vagy értékelési beállításról is be kell számolnia az eredményekről, mivel egyetlen feladat vagy adatkészlet jobb megjelenést kölcsönözhet a kompromisszumnak, mint a szélesebb körben.

A hardver és a kiszolgálási feltételek központi szerepet játszanak az 1,62-szeres gyorsulás értékelésében. A jövőbeni jelentéseknek meg kell vizsgálniuk a használt processzorokat vagy gyorsítókat, a kötegméreteket, a képfelbontásokat, a sorozathosszokat, valamint azt, hogy a mérés magában foglalja-e a hasonlóságok számításának és a figyelemfelkeltő fejek kiválasztásának többletköltségét. Egy metsző módszer csökkentheti az elméleti számítást anélkül, hogy ugyanazt a valós késleltetési javulást eredményezné, ha a kiválasztási lépései költségesek, vagy a kiszolgáló verem rosszul támogatja.

A kutatóknak meg kell vizsgálniuk, hogy az agresszív metszés megváltoztatja-e a VLM által elkövetett hibák típusát. A vizuális tokenek 88,9%-ának eltávolítása megőrizheti az összesített benchmark pontszámokat, miközben károsíthatja azokat a részleteket, amelyek fontosak a kis objektumok, a térbeli kapcsolatok, a képek szövege vagy a vizuális alapozás szempontjából. A forrás nem közöl ilyen hibamódokat. Az általános pontosságot és az elveszett vizuális információk példáit vizsgáló értékelések segíthetnek meghatározni, hogy a módszer alkalmas-e a biztonságra érzékeny vagy részletfüggő alkalmazásokra.

Az architektúrák és bemenetek közötti replikáció határozza meg, hogy a hasznos kiválasztási képesség állítólagos koncentrációja általános tulajdonság vagy modellspecifikus megfigyelés. A fontos tesztek magukban foglalják az egyéb VLM-gerinceket, a különböző képméreteket és -tartalmakat, valamint olyan feladatokat, amelyek vagy a jelenet átfogó megértését, vagy finom szemcsés vizuális bizonyítékokat igényelnek. A kód állapota, a megvalósítás elérhetősége és a szakértői értékelés sem ismert a forrásból. Amíg ezekre a kérdésekre nem válaszolunk, a ProViP-t biztató kezdeti eredménnyel járó kutatási javaslatnak kell tekinteni, nem pedig validált gyártási szabványnak.

Kapcsolódó útmutatók és vetélkedők

Az AI modellek magyarázataTranszformátorokTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?