Назад към Новини
ИновацияAI Understanding брифинг

GLANCE ускорява декодирането на визуално-езичния модел чрез изготвяне на токен блокове с едно преминаване

Нов документ на arXiv въвежда GLANCE, метод за спекулативно декодиране, който използва слятото състояние на визуално-езичен модел, за да изготви цели блокове токени наведнъж. Авторите докладват алчни резултати без загуби и до 2,93 пъти по-бързо декодиране при тествани натоварвания.

5 min readRead the primary source
Source-provided image accompanying GLANCE speeds up vision-language model decoding by drafting token blocks in one pass
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2609.00355
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Визуално-езиков модел (VLM)
Мултимодален модел, който съвместно обработва визуална и текстова информация.
Токен
Част от текст, обработен от езикови модели, като част от дума или символ.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Изследователите въведоха GLANCE, еднопроходен блоков проектант за спекулативно декодиране в модели на визуален език. Методът чете вече обединеното визуално и езиково представяне на целевия модел, генерира блок от кандидат токени с едно преминаване напред и кара целевия модел да проверява тези кандидати с едно преминаване. Авторите съобщават, че одитираните подкани възпроизвеждат алчно декодиране точно и че GLANCE достига до 2,93 пъти скоростта на авторегресивното декодиране при заявените от тях условия на тестване.

Документ, изпратен до arXiv на 31 август, въвежда GLANCE, който се описва като еднопроходен блоков проектант за спекулативно декодиране в модели на визуален език. Спекулативното декодиране обикновено използва по-малък проектант, за да предложи няколко токена и след това иска по-голям целеви модел да ги провери. Статията твърди, че този дизайн създава проблем за системите за визуален език: малък авторегресивен проектант може да не е в състояние да обработва изображението на всяка стъпка, въпреки че визуалната информация може да направи следващите текстови токени по-предвидими.

GLANCE променя ролята на съставителя. Според източника, блокова дифузионна глава чете вече слятото състояние на визуален език на целевия модел и запълва целия блок кандидат с едно преминаване напред. След това едно широко кандидат дърво се проверява с едно преминаване на целевия модел. Това е централната техническа претенция: визуалната информация вече присъства в състоянието, предоставено на съставителя, докато предложените токени се генерират като блок, а не последователно. Документът нарича подхода без загуба, тъй като е насочен към немодифициран модел на визуален език и съобщава, че всяка одитирана подкана възпроизвежда точно алчно декодиране.

Авторите докладват няколко сравнения при това, което те наричат ​​един двигател и един кръгъл бюджет. GLANCE декодира до 2,93 пъти по-бързо от авторегресивното декодиране, използва едно чернова на рунд, където производствената глава EAGLE3-VL използва осем, и приема блокове 2,7 пъти по-дълги от глава EAGLE-3, обучена на същия корпус. Документът също така съобщава за връзка между приетата дължина на блока и ентропията на следващия токен на целевия модел. Тази връзка стана по-стръмна, тъй като задачите разчитаха повече на заземяване, в рамките на пет задачи, и авторите казват, че се прехвърля между цели и модалности. Това са твърдения от предпечата, а не независимо установени резултати.

Детайли за източника: arxiv.org ↗

Защо има значение

Работата се занимава с практическо тясно място в мултимодалния AI: генерирането на текст един токен наведнъж може да направи базираните на изображения отговори скъпи и бавни. Ако отчетените резултати се обобщят, GLANCE може да намали забавянето на извода и да изчисли за задачи, които копират или следват отблизо визуално съдържание, като същевременно запазва изхода на целевия модел, вместо да разменя точността за скорост.

Непосредственото значение е изчислително. Визуално-езичните модели комбинират обработка на изображения с генериране на език, но етапът на генериране все още може да продължи маркер по маркер. За отговори, които повтарят текст, видим в изображение, или следват силно ограничена визуална подкана, този последователен процес може да изпълни много почти предвидими стъпки. Метод, който изготвя по-дълъг цикъл с едно преминаване, може да намали латентността и количеството изчисления на целевия модел, необходими за всеки отговор.

Разграничението на източника между обоснован и свободен текст е важно. GLANCE не се представя като универсален заместител на авторегресивното декодиране. Авторите казват, че предимството му е най-силно в „режим на дословно копиране“, където визуалното заземяване прави дългите последователности предсказуеми, докато свободно изпълняващият се текст все още предпочита верига. Тази граница придава на резултата практическо значение: изпълнението може да зависи по-малко от това дали моделът е мултимодален като цяло, отколкото от това доколко конкретната задача ограничава отговора чрез визуални доказателства.

Твърдената липса на загуби също може да има значение за решенията за внедряване. Ускоряванията често изискват приемане на възможна промяна в резултатите, но в тази статия се казва, че алчният резултат на целевия модел е бил възпроизведен при неговите одитирани подкани. Ако бъде потвърдено чрез по-широки тестове, това би направило техниката подходяща за приложения, които се нуждаят от поведението на декодиране на оригиналния модел, като същевременно търсят по-ниско време за реакция или разходи за извод. Източникът обаче не установява тези спестявания надолу по веригата и не отчита разгръщане на продукцията, наличност, обърната към потребителя, или ефекти върху качеството извън точното възпроизвеждане в одитираната оценка.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Хартията е наскоро изпратен предпечат, така че нейните твърдения все още се нуждаят от независимо репликиране. Резюмето не уточнява хардуера, целевите модели, наборите от данни, броя на подканите, абсолютното забавяне или петте оценени задачи. Следователно докладваното максимално ускоряване може да зависи силно от натоварването и избора на внедряване; самите автори казват, че свободният текст все още предпочита последователното писане.

Основният въпрос е възпроизводимостта. Източникът идентифицира статията, авторите, датата на подаване и наличността на кода, но нейното резюме не предоставя URL адреса за внедряване, хардуерна конфигурация, имена на модели, размери на набори от данни, брой подкани или подробни дефиниции на задачи. Тези подробности са необходими, за да се определи дали цифрата 2,93× отразява общо подобрение или най-добрия резултат при конкретно натоварване. Формулировката „до“ сигнализира, че максимумът не е непременно типичен.

Сравненията също изискват внимателно тълкуване. GLANCE се сравнява с авторегресивно декодиране и с базирани на EAGLE глави при обявен двигател и кръгъл бюджет, но резюмето не обяснява дали всички системи са използвали идентични ядра, пакетиране, настройки на паметта или политики за проверка. Твърдението, че GLANCE приема 2,7 пъти по-дълги блокове от главата на EAGLE-3, обучена на същия корпус, е информативно, но приетата дължина сама по себе си не определя латентността от край до край. Разходите за проверка, използването на паметта, използването на хардуера и степента на неуспех или отхвърляне ще имат значение.

По-нататъшната оценка трябва да тества метода върху повече целеви модели, модалности, езици, типове изображения и стилове на отговор, включително случаи, когато отговорът е отворен, а не копиран от визуалния вход. Връзката на ентропията е потенциално полезна, защото може да помогне да се предвиди кога изготвянето на блок ще се изплати, но източникът не дава интервал на несигурност или независимо валидиране за този предложен закон. Докато тези измервания не са налични, GLANCE се разбира най-добре като обещаващ резултат от изследване от предпечат, а не като доказан стандарт за ускоряване с общо предназначение.

Свързани ръководства и викторини

Обяснени модели на AIТрансформърсAI обучениеБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?