Смес от дълбочини
Mixture of Depths (MoD) позволява на трансформатора да изразходва различни количества изчисления за различни токени, като насочва само „важните“ токени през тежките изчисления на всеки слой.
Преглед
It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.
Дълбоко гмуркане
Стандартните трансформатори прилагат всеки слой към всеки знак, дори тривиални като пунктуация. Mixture of Depths, въведен от Google DeepMind през 2024 г., добавя малък рутер към всеки блок, който избира фиксирана горна k част от токени, за да премине през пълното самовнимание и MLP изчисление; останалите пропускат блока чрез остатъчна връзка. Тъй като само k токена се обработват на слой, общото изчисление (FLOPs) е ограничено и известно предварително, за разлика от по-ранните методи с динамична дълбочина, които варираха непредсказуемо. Това прави пакетирането и използването на хардуера ефективно. Моделите, обучени от MoD, могат да съответстват на качеството на базовия трансформатор, използвайки по-малко FLOPs на преминаване напред, или да достигнат по-високо качество при едно и също изчисление, а идеята се комбинира естествено с Mixture-of-Experts, за да даде модели „MoDE“, които насочват както по дълбочина, така и по ширина.
Техническа информация
Във всеки блок на MoD, научен линеен рутер оценява всеки токен и запазва най-високото k по резултат; избраните токени преминават през внимание и MLP, докато неизбраните токени се пренасят напред непроменени от остатъчния път. Използването на фиксиран top-k (вместо праг за токен) прави изчислителната графика статична, а тензорните форми постоянни, което е удобно за хардуера. Рутерът се обучава с останалата част от мрежата и причинно-следственото генериране използва спомагателни предиктори, така че решенията за маршрутизиране да не надничат в бъдещи токени.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на смесица от дълбочини
Условното изчисление е основен лост за ефективност, тъй като моделите се мащабират, а MoD е ранен, чист пример. Очаквайте по-дълбока интеграция с Mixture-of-Experts (маршрутизиране както на дълбочина, така и на експерти), адаптивни бюджети, които се свиват за лесни входове, и научени рутери, които по-добре идентифицират кои токени наистина се нуждаят от дълбока обработка. Тъй като разходите за изводи доминират в икономиката на внедряването, техниките, които позволяват на моделите да „мислят по-усилено“ само когато е необходимо, като същевременно запазват предсказуема латентност, вероятно ще станат стандартни в широкомащабните архитектури.
Внедряване в реалния свят
Намаляване на FLOPs, необходими за обработка на дълги документи чрез пропускане на задълбочено изчисление на жетони за пълнене
Обучение на модел, който отговаря на базовото качество при по-ниски изчисления, намалявайки разходите за обслужване
Комбиниране с Mixture-of-Experts (MoDE) за маршрут както на дълбочина на слоя, така и на експертен избор
Поддържане на предвидима, фиксирана латентност за токен, тъй като бюджетът за изчисление на слой е фиксиран предварително
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Depths quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Агрегиране на смеси от агенти
Frequently asked questions
What is Mixture of Depths?
Mixture of Depths (MoD) позволява на трансформатора да изразходва различни количества изчисления за различни токени, като насочва само „важните“ токени през тежките изчисления на всеки слой. Той намалява разходите за обработка на лесни токени, като същевременно поддържа фиксиран, предвидим изчислителен бюджет.
Какво варира сместа от дълбочини в различните токени?
MoD маршрутизира само някои токени през тежките изчисления на всеки слой, така че различните токени ефективно получават различна дълбочина.
Как Министерството на отбраната поддържа своя изчислителен бюджет предвидим?
Избирането на фиксирано най-високо k от токени на блок ограничава FLOPs и поддържа формите на тензора постоянни, което е удобно за хардуера.
Какво се случва с токените, които рутерът НЕ избира в даден блок?
Неизбраните токени заобикалят изчислението на блока и се пренасят напред непроменени от остатъчния път.
Кой представи Mixture of Depths?
Mixture of Depths беше представено от Google DeepMind в документ от 2024 г. за изчисляване на динамичен трансформатор.
Какво произвежда комбинирането на MoD с Mixture-of-Experts?
Комбинирането на дълбочинно маршрутизиране с експертно маршрутизиране дава модели „MoDE“, които обуславят изчисленията както на слоеве, така и на експерти.