Назад към Новини
ИновацияAI Understanding брифинг

Проучването установява, че архитектурата на вниманието води до енергийните разходи на LLM изводите

Ново емпирично проучване съобщава, че архитектурата на вниманието силно влияе върху това как енергията на изводите на големия езиков модел нараства с дължината на контекста. Той открива по-стръмен ръст за вниманието на няколко глави, по-плосък ръст за вниманието при групирани запитвания и почти постоянна енергия за вниманието при групирани запитвания, комбинирани с...

5 min readRead the primary source
Primary-source image accompanying Study finds attention architecture drives the energy cost of LLM inference
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.25096
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Извод
Фазата на изпълнение, при която обучен модел генерира прогнози или резултати.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Предпринтът на arXiv представя систематично емпирично изследване на използването на енергия по време на фазата на декодиране на извода на голям езиков модел. Изследователите оцениха четири модела с отворен код, използвайки внимание на няколко глави, внимание на групирана заявка и внимание на групирана заявка с внимание на плъзгащ се прозорец в различни дължини на контекста, размери на партиди и натоварвания на генериране.

Статията изследва потреблението на енергия по време на фазата на декодиране на извода на голям езиков модел, етапът, в който моделът генерира изходни токени след обработка на своя входен контекст. Авторите описват работата като систематично емпирично изследване, мотивирано от опасения относно енергийните и екологични ефекти от нарастващото използване на LLM. Те сравняват четири представителни модела с отворен код, които използват различни дизайни на внимание: стандартно внимание с няколко глави, внимание с групирана заявка и внимание с групирана заявка, комбинирано с внимание с плъзгащ се прозорец. Сравнението е съсредоточено върху това как се държат тези дизайни, докато се генерират токени, като контекстът и условията на натоварване се променят, така че техните енергийни модели да могат да се наблюдават.

Изследователите променят няколко работни условия, които влияят на извода: дължина на контекста, размер на партидата и натоварване на генерирането. Те измерват GPU енергията с помощта на NVIDIA хардуерни броячи и отделно изследват ефектите от механизма за внимание, размера на модела, растежа на кеша Key-Value и групирането. Източникът не идентифицира четирите модела, техния брой параметри, точните хардуерни конфигурации, размерите на работното натоварване или протокола за измерване извън това описание на абстрактно ниво. Тези измервания са представени като сравнения в тестваните условия и наличното описание подчертава докладваните фактори, а не пълен отчет на заобикалящата система за обслужване.

Докладът съобщава, че механизмът на вниманието е основният фактор, управляващ как се променя енергията на декодирането с увеличаване на дължината на контекста. В сравнение, моделите, използващи вниманието на няколко глави, показват значително по-стръмен ръст на енергията от моделите, използващи вниманието на групирани запитвания. Вниманието при групирани запитвания, съчетано с внимание при плъзгащ се прозорец, поддържа почти постоянна консумация на енергия в докладваните експерименти. Авторите също така съобщават, че размерът на модела основно определя абсолютната консумация на енергия, докато пакетирането намалява както енергията на генериран токен, така и латентността на заявката с до 87 процента. Следователно резултатите правят разлика между количеството използвана енергия в абсолютно изражение и начина, по който това количество се променя с дължината на контекста.

Детайли за източника: arxiv.org ↗

Защо има значение

Проучването предполага, че дизайнът на механизма за внимание на AI модел може съществено да повлияе на енергията, необходима за генериране на жетони, особено с нарастването на контекстните прозорци. Резултатите от него могат да помогнат на разработчиците на модели и операторите да претеглят избора на архитектура и обслужване спрямо потреблението на енергия, латентността и мащаба.

Основното заключение е, че енергийната ефективност не се определя само от това колко голям е езиковият модел. Два модела, обслужващи по-дълги контексти, може да имат различно поведение при мащабиране на енергията, тъй като техните механизми за внимание взаимодействат по различен начин с нарастващия кеш ключ-стойност. Това прави архитектурата практическо съображение за организации, опериращи с голям обем услуги за извеждане или проектиране на модели, предназначени да обработват дълги входни данни. Разликата е от значение за планирането, тъй като нарастващият контекстен прозорец не се превръща в една фиксирана енергийна траектория в архитектурите в сравнението.

Докладваният резултат относно вниманието на групирана заявка с внимание на плъзгащ се прозорец е потенциално полезен, защото сочи към начин за ограничаване на растежа на енергията, свързан с по-дълги контексти. Източникът не твърди, че тази комбинация е универсално превъзходна: тя отчита емпиричен модел в четири модела с отворен код при тестваните условия. Всяко решение за внедряване също трябва да вземе предвид точността, запазването на контекста, качеството на дългите документи, ограниченията на внедряването и други разходи, които не са измерени в предоставения източник. Тези квалификации са важни, когато се тълкува резултатът като доказателство от тестваните случаи, а не като препоръка, независима от поведението на модела или изискванията за обслужване.

Резултатът от групирането свързва потреблението на енергия с оперативното планиране. Според документа обработката на заявки на партиди намалява енергията на генериран токен и забавянето на заявката с до 87 процента. Ако се възпроизведе в производствени настройки, това може да направи планирането и консолидирането на работното натоварване подходящи както за управлението на разходите, така и за околната среда. Източникът не казва дали най-голямото намаление е настъпило при всяко работно натоварване, дали пакетирането променя качеството на изхода или какви компромиси в отзивчивостта могат да възникнат за отделните потребители. Това прави отчетения процент релевантен за дизайна на системата, като оставя приложимостта му в зависимост от условията.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Констатациите трябва да бъдат тествани при повече модели, хардуерни платформи, работни натоварвания и пълни конвейери за изводи. Документът измерва енергията на GPU по време на декодиране, така че неговите резултати не установяват сами по себе си общата системна енергия, по-широко въздействие върху околната среда или производителност във всяка архитектура на модела.

Първият въпрос е възпроизводимостта. Източникът идентифицира документа като предпечат arXiv, изпратен на 25 август 2026 г., и предоставя резюме, но без статус на партньорска проверка. Последващият преглед трябва да проучи пълния списък с модели, размерите на параметрите, контекстните дължини, партидните конфигурации, дължините на генерирането, калибрирането на енергийния брояч и статистическата вариация между сериите. Тези подробности биха помогнали да се определи доколко отчетените сравнения могат да бъдат възпроизведени и колко несигурност заобикаля наблюдаваните разлики.

Обхватът на хардуерното измерване също има значение. Проучването измерва енергията на GPU с хардуерни броячи NVIDIA, но резюмето не отчита енергия от процесори, памет, мрежа, охлаждане, съхранение или друга инфраструктура. Следователно подкрепя заключения относно измерената енергия за декодиране на GPU, а не пълно отчитане на енергията или емисиите, свързани с работата на AI услуга. Броячите на графичния процесор осигуряват заявената граница на измерване на изследването, така че заключенията трябва да останат свързани с тази граница, докато не бъдат измерени други компоненти.

По-нататъшната работа трябва да тества дали докладваните модели на мащабиране се отнасят за по-нови и различно проектирани модели, допълнителни доставчици на ускорители, по-дълги контексти и интерактивни работни натоварвания. Той също така трябва да сравнява енергията спрямо качеството и производителността на модела. Механизъм, който използва по-малко енергия при една конфигурация, може да наложи компромис на възможностите или латентността на друго място, а доставеният източник не определя количествено тези компромиси. Такива сравнения биха изяснили дали по-ниската измерена енергия е придружена от промени в другите резултати, за които операторите се интересуват.

Отчетеното максимално намаление от 87 процента заслужава внимателно тълкуване. Резюмето го приписва на пакетиране и казва, че се прилага както за енергията на генериран токен, така и за латентността на заявката, но не уточнява базовата линия, работното натоварване или дали същият процент се прилага и за двете мерки. Читателите трябва да го третират като горния докладван резултат от проучването, а не като общо очакване за всички внедрявания на LLM. Без тези подробности процентът не може да се прехвърли директно от предпечата към произволно внедряване.

Свързани ръководства и викторини

Обяснени модели на AIТрансформърсAI обучениеБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?