Назад към Новини
ИновацияAI Understanding брифинг

Изследователите предлагат смесване на активиране, адаптивно към токени, за слоевете за предаване на трансформатор

Ревизиран предпечат на arXiv предлага Mixture of Activations, дизайн на преден слой, който позволява на езиковите модели да избират между функциите за активиране за всеки токен. Авторите съобщават за по-ниска загуба на терминално обучение в модели от 0,12B до 2B параметри, но не предоставят точни резултати в изходния запис.

5 min readRead the primary source
Source-page capture accompanying Researchers propose token-adaptive activation mixing for Transformer feedforward layers
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2605.26647
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Трансформатор
Невронна архитектура, която използва внимание, за да моделира паралелни връзки между последователности.
Токен
Част от текст, обработен от езикови модели, като част от дума или символ.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Документ, ревизиран на arXiv на 28 август, предлага смес от активации, или MoA, за базирани на езикови модели. Дизайнът използва леки, зависещи от входа порти за смесване на няколко функции за активиране за отделни токени, като същевременно споделя едни и същи линейни проекции. Авторите също така въвеждат обучаеми активации, които комбинират функции без зависещи от токени врати.

Доверителният източник е запис на arXiv за „По-изразителни слоеве за предварителна връзка: Част I. Адаптивно смесване на активации, адаптирано към токени“. В него се казва, че документът е подаден за първи път на 26 май 2026 г. и е ревизиран на 28 август, поставяйки съществената актуализация в текущия прозорец с новини. Авторите са Mingze Wang, Jinbo Wang, Yikuan Xia, Kai Shen и Shu Zhong. Източникът идентифицира работата като документ за машинно обучение и изкуствен интелект, с езикови модели като негова пряка тема.

Документът започва от ограничение, което авторите идентифицират в общите слоеве на трансформаторната мрежа с предварителна връзка или FFN. По-ранните дизайни използваха функции като ReLU и GELU, докато по-късните затворени дизайни включват SwiGLU, но източникът казва, че повечето FFN все още прилагат една фиксирана нелинейна трансформация към всеки токен. Предложената смес от активации вместо това използва речник на функциите за активиране и леки порти, чиито стойности зависят от входа. Същите линейни проекции се споделят, докато комбинацията от нелинейни функции може да варира от токен до токен.

Източникът също така описва обучаемите активации, съкратено LA, като независим от входа аналог. LA формира линейни комбинации от функции за активиране както в FFN тип ReLU, така и тип SwiGLU. Авторите заявяват, че тяхната теория за крайната ширина установява строги експресивни разделения: LA стриктно съдържа FFN с фиксирано активиране, докато MoA стриктно съдържа LA, защото добавя зависима от входа нелинейна хибридизация. Това са теоретични твърдения за изразителност относно функциите, които слоевете могат да представят, а не доказателство, че един разгърнат езиков модел като цяло е по-способен или надежден.

За емпирично тестване авторите казват, че са провели обширни експерименти за предварително обучение върху плътни и смесени от експертни езикови модели, вариращи от 0,12 милиарда до 2 милиарда параметъра. Те съобщават за тестване на различни бюджети за токени, оптимизатори и графици за скорост на обучение. Според резюмето, MoA постоянно постига по-ниски загуби на терминали и показва по-благоприятно поведение при мащабиране от добре настроените базови линии, с минимални параметри и изчислителни разходи. Записът на източника не предоставя числените разлики в загубите, имената на наборите от данни или базовите линии, подробности за хардуера или точното значение на „минимални“ режийни разходи.

Детайли за източника: arxiv.org ↗

Защо има значение

Feedforward слоевете съдържат голяма част от параметрите и нелинейното поведение в много езикови модели. Ако смесването на адаптивно активиране на токени подобрява обучението без съществено увеличаване на изчисленията или параметрите, то може да предложи относително малка архитектурна промяна с последици за мащабирането на модела. Доказателствата остават ограничени до докладваните от авторите експерименти за предварително обучение и не установяват по-добра производителност надолу по веригата или ефективност на производството.

Предложението е насочено към последваща част от настоящата архитектура на езиковия модел. Източникът казва, че FFN слоевете представляват голяма част от параметрите на трансформаторния модел и нелинейната изразителност. Това ги прави важно място за търсене на подобрения: промяна в нелинейната трансформация може да повлияе на това колко ефективно даден модел използва съществуващата си ширина и проекции, вместо да изисква изцяло различно семейство модели.

Дизайнът на MoA е потенциално практичен, защото запазва споделени линейни проекции и добавя олекотено стробиране, зависимо от входа. По принцип това може да позволи на различни токени да получат различно нелинейно третиране, като същевременно се запази голяма част от заобикалящата FFN структура. Източникът обаче не установява, че съществуващите модели могат да бъдат надградени без преквалификация, нито съобщава подробности за изпълнението, достатъчни, за да се определи дали добавените портове подобряват пропускателната способност в реалния свят, използването на паметта или консумацията на енергия.

Докладваната по-ниска терминална загуба е релевантна, тъй като загубата на обучение е централна мярка за това колко добре даден модел отговаря на своите данни преди обучението. Заявеното поведение при мащабиране също може да има значение, ако методът продължи да се подобрява с увеличаването на размера на модела или изчисленията за обучение. Но крайната загуба не е същата като полезност за хората. Източникът не дава резултати за фактология, разсъждения, кодиране, многоезична производителност, безопасност, калибриране, устойчивост или точност на задачите надолу по веригата, така че практическото значение на отчетените печалби от обучението остава несигурно.

Доказателствата също са предварителни. Той идва от ревизиран предпечат, а изходният запис представя теоретичните и емпирични заключения на авторите, а не независимо валидиране. Тестваният обхват завършва на 2 милиарда параметъра, което е значително по-малко от много широко разпространени езикови модели. Записът не посочва дали експериментите са използвали множество произволни семена, как са настроени базовите линии, дали методът променя латентността на извода или дали печалбите му продължават извън докладваните настройки за предварително обучение.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Следващото важно доказателство е размерът и последователността на отчетените печалби, особено извън тествания диапазон от 0,12B до 2B. Читателите трябва да търсят точни разходи за изчисления, памет, латентност и параметри; резултати при задачи надолу по веригата; независима репликация; и доказателства, че методът остава полезен при различни архитектури, набори от данни, оптимизатори и по-дълги тренировки.

Следващата полезна проверка е количественият детайл. Пълният документ или по-късна работа трябва да показва точни криви на загубите, увереност или вариации от цикъл до цикъл, брой параметри, брой операции, изисквания към паметта и разходи за обучение на стенен часовник за MoA, LA и базисни линии за фиксирано активиране. Тъй като в резюмето се казва, че сравненията са били спрямо добре настроени базови линии, процедурата за настройка и бюджетът за изчисления ще бъдат важни за преценката дали предимството идва от архитектурата, а не от нееднаквата оптимизация.

Мащабът е друг неразрешен проблем. Източникът съобщава за модели от 0,12B до 2B параметри, но не казва дали същият модел се прилага в значително по-големи плътни или смесени от експертни системи. Бъдещите експерименти трябва да тестват по-големи модели, по-дълги тренировки, допълнителни бюджети за токени и различни смеси от данни. Те трябва също така да изяснят дали заявеното благоприятно поведение при мащабиране се измерва чрез загуба при фиксиран изчислителен бюджет, чрез загуба при фиксиран брой параметри или чрез друго сравнение.

Оперативните разходи заслужават специално внимание. MoA въвежда зависим от токена порт и речник на функциите за активиране, дори ако добавеният параметър и изчислителната тежест са описани като минимални. Независимите измервания трябва да определят дали това води до значими промени в използването на ускорителя, трафика на паметта, пакетирането, латентността на извода, стабилността на обучението или потреблението на енергия. Малки теоретични разходи могат да имат по-големи системни разходи, ако нарушат ефективното изпълнение на хардуера.

И накрая, читателите трябва да търсят независимо възпроизвеждане и по-широка оценка. Резултатите от езика надолу по веригата, кодирането, разсъжденията и многоезичните задачи ще покажат дали по-ниските загуби преди обучение се прехвърлят към способностите, които потребителите забелязват. Оценките на надеждността и безопасността биха проверили дали нелинейното поведение, адаптирано към токени, въвежда нови модели на отказ. Докато тези резултати не са налични, документът се разбира най-добре като обещаващо архитектурно изследователско твърдение, а не като демонстрирано подобрение на производството или незабавно достъпен продукт.

Свързани ръководства и викторини

Обяснени модели на AIТрансформърсAI обучениеТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?