Какво стана
Документ, ревизиран на arXiv на 28 август, предлага смес от активации, или MoA, за базирани на езикови модели. Дизайнът използва леки, зависещи от входа порти за смесване на няколко функции за активиране за отделни токени, като същевременно споделя едни и същи линейни проекции. Авторите също така въвеждат обучаеми активации, които комбинират функции без зависещи от токени врати.
Доверителният източник е запис на arXiv за „По-изразителни слоеве за предварителна връзка: Част I. Адаптивно смесване на активации, адаптирано към токени“. В него се казва, че документът е подаден за първи път на 26 май 2026 г. и е ревизиран на 28 август, поставяйки съществената актуализация в текущия прозорец с новини. Авторите са Mingze Wang, Jinbo Wang, Yikuan Xia, Kai Shen и Shu Zhong. Източникът идентифицира работата като документ за машинно обучение и изкуствен интелект, с езикови модели като негова пряка тема.
Документът започва от ограничение, което авторите идентифицират в общите слоеве на трансформаторната мрежа с предварителна връзка или FFN. По-ранните дизайни използваха функции като ReLU и GELU, докато по-късните затворени дизайни включват SwiGLU, но източникът казва, че повечето FFN все още прилагат една фиксирана нелинейна трансформация към всеки токен. Предложената смес от активации вместо това използва речник на функциите за активиране и леки порти, чиито стойности зависят от входа. Същите линейни проекции се споделят, докато комбинацията от нелинейни функции може да варира от токен до токен.
Източникът също така описва обучаемите активации, съкратено LA, като независим от входа аналог. LA формира линейни комбинации от функции за активиране както в FFN тип ReLU, така и тип SwiGLU. Авторите заявяват, че тяхната теория за крайната ширина установява строги експресивни разделения: LA стриктно съдържа FFN с фиксирано активиране, докато MoA стриктно съдържа LA, защото добавя зависима от входа нелинейна хибридизация. Това са теоретични твърдения за изразителност относно функциите, които слоевете могат да представят, а не доказателство, че един разгърнат езиков модел като цяло е по-способен или надежден.
За емпирично тестване авторите казват, че са провели обширни експерименти за предварително обучение върху плътни и смесени от експертни езикови модели, вариращи от 0,12 милиарда до 2 милиарда параметъра. Те съобщават за тестване на различни бюджети за токени, оптимизатори и графици за скорост на обучение. Според резюмето, MoA постоянно постига по-ниски загуби на терминали и показва по-благоприятно поведение при мащабиране от добре настроените базови линии, с минимални параметри и изчислителни разходи. Записът на източника не предоставя числените разлики в загубите, имената на наборите от данни или базовите линии, подробности за хардуера или точното значение на „минимални“ режийни разходи.
Детайли за източника: arxiv.org ↗
Защо има значение
Feedforward слоевете съдържат голяма част от параметрите и нелинейното поведение в много езикови модели. Ако смесването на адаптивно активиране на токени подобрява обучението без съществено увеличаване на изчисленията или параметрите, то може да предложи относително малка архитектурна промяна с последици за мащабирането на модела. Доказателствата остават ограничени до докладваните от авторите експерименти за предварително обучение и не установяват по-добра производителност надолу по веригата или ефективност на производството.
Предложението е насочено към последваща част от настоящата архитектура на езиковия модел. Източникът казва, че FFN слоевете представляват голяма част от параметрите на трансформаторния модел и нелинейната изразителност. Това ги прави важно място за търсене на подобрения: промяна в нелинейната трансформация може да повлияе на това колко ефективно даден модел използва съществуващата си ширина и проекции, вместо да изисква изцяло различно семейство модели.
Дизайнът на MoA е потенциално практичен, защото запазва споделени линейни проекции и добавя олекотено стробиране, зависимо от входа. По принцип това може да позволи на различни токени да получат различно нелинейно третиране, като същевременно се запази голяма част от заобикалящата FFN структура. Източникът обаче не установява, че съществуващите модели могат да бъдат надградени без преквалификация, нито съобщава подробности за изпълнението, достатъчни, за да се определи дали добавените портове подобряват пропускателната способност в реалния свят, използването на паметта или консумацията на енергия.
Докладваната по-ниска терминална загуба е релевантна, тъй като загубата на обучение е централна мярка за това колко добре даден модел отговаря на своите данни преди обучението. Заявеното поведение при мащабиране също може да има значение, ако методът продължи да се подобрява с увеличаването на размера на модела или изчисленията за обучение. Но крайната загуба не е същата като полезност за хората. Източникът не дава резултати за фактология, разсъждения, кодиране, многоезична производителност, безопасност, калибриране, устойчивост или точност на задачите надолу по веригата, така че практическото значение на отчетените печалби от обучението остава несигурно.
Доказателствата също са предварителни. Той идва от ревизиран предпечат, а изходният запис представя теоретичните и емпирични заключения на авторите, а не независимо валидиране. Тестваният обхват завършва на 2 милиарда параметъра, което е значително по-малко от много широко разпространени езикови модели. Записът не посочва дали експериментите са използвали множество произволни семена, как са настроени базовите линии, дали методът променя латентността на извода или дали печалбите му продължават извън докладваните настройки за предварително обучение.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Следващото важно доказателство е размерът и последователността на отчетените печалби, особено извън тествания диапазон от 0,12B до 2B. Читателите трябва да търсят точни разходи за изчисления, памет, латентност и параметри; резултати при задачи надолу по веригата; независима репликация; и доказателства, че методът остава полезен при различни архитектури, набори от данни, оптимизатори и по-дълги тренировки.
Следващата полезна проверка е количественият детайл. Пълният документ или по-късна работа трябва да показва точни криви на загубите, увереност или вариации от цикъл до цикъл, брой параметри, брой операции, изисквания към паметта и разходи за обучение на стенен часовник за MoA, LA и базисни линии за фиксирано активиране. Тъй като в резюмето се казва, че сравненията са били спрямо добре настроени базови линии, процедурата за настройка и бюджетът за изчисления ще бъдат важни за преценката дали предимството идва от архитектурата, а не от нееднаквата оптимизация.
Мащабът е друг неразрешен проблем. Източникът съобщава за модели от 0,12B до 2B параметри, но не казва дали същият модел се прилага в значително по-големи плътни или смесени от експертни системи. Бъдещите експерименти трябва да тестват по-големи модели, по-дълги тренировки, допълнителни бюджети за токени и различни смеси от данни. Те трябва също така да изяснят дали заявеното благоприятно поведение при мащабиране се измерва чрез загуба при фиксиран изчислителен бюджет, чрез загуба при фиксиран брой параметри или чрез друго сравнение.
Оперативните разходи заслужават специално внимание. MoA въвежда зависим от токена порт и речник на функциите за активиране, дори ако добавеният параметър и изчислителната тежест са описани като минимални. Независимите измервания трябва да определят дали това води до значими промени в използването на ускорителя, трафика на паметта, пакетирането, латентността на извода, стабилността на обучението или потреблението на енергия. Малки теоретични разходи могат да имат по-големи системни разходи, ако нарушат ефективното изпълнение на хардуера.
И накрая, читателите трябва да търсят независимо възпроизвеждане и по-широка оценка. Резултатите от езика надолу по веригата, кодирането, разсъжденията и многоезичните задачи ще покажат дали по-ниските загуби преди обучение се прехвърлят към способностите, които потребителите забелязват. Оценките на надеждността и безопасността биха проверили дали нелинейното поведение, адаптирано към токени, въвежда нови модели на отказ. Докато тези резултати не са налични, документът се разбира най-добре като обещаващо архитектурно изследователско твърдение, а не като демонстрирано подобрение на производството или незабавно достъпен продукт.