Техническо РЪКОВОДСТВО

RMSNorm и нормализиране на предварителния слой

RMSNorm е олекотен слой за нормализиране, който премащабира активациите по техния среден квадрат, а нормализирането на предслоя поставя тази стъпка преди всеки подслой, а не след него.

2 min readПоследна актуализация

Преглед

Together they make deep transformers train stably without warmup tricks.

Дълбоко гмуркане

Standard LayerNorm изважда средната стойност и дели на стандартното отклонение върху вектор на характеристика, след което прилага научен мащаб и отместване. RMSNorm, въведен от Zhang и Sennrich през 2019 г., премахва изцяло средното центриране и отклонението: той просто разделя всеки вектор на средния квадрат на неговите елементи и умножава по наученото усилване за всяка функция. Това премахва една статистика и няколко операции, намалявайки изчисленията с приблизително 10-50% в нормалния слой, като същевременно поддържа точност. Отделно, разположението „Pre-LN“ (норма преди внимание/MLP, с чист остатъчен път около него) поддържа величините на градиента ограничени при инициализация, така че модели като GPT-3, LLaMA и PaLM се обучават без хакове за загряване на скоростта на обучение, които оригиналният трансформатор Post-LN изискваше.

Техническа информация

За вектор x с измерение d, RMSNorm изчислява x_i * g_i / sqrt((1/d) * sum(x_j^2) + епсилон), където g е научен вектор на печалба. Няма средно изваждане и няма отклонение. Тъй като остатъчният поток в блок Pre-LN заобикаля нормализирането, пътят на идентичността остава недокоснат и градиентите текат директно от изход към вход, поради което много дълбоките стекове се събират.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на RMSNorm и нормализиране на предслой

RMSNorm вече е по подразбиране в повечето LLM с отворено тегло (LLaMA, Mistral, Qwen, Gemma), така че очаквайте да остане стандартен. Изследванията усъвършенстват рецептата: QK-нормата прилага RMSNorm към заявки за внимание и ключове, за да укроти растежа на logit, а някои лаборатории комбинират пред- и след-норма („сандвич“ или „пери-LN“) за допълнителна стабилност в мащаб от трилиони параметри. Хардуерните ядра продължават да сливат операцията за скорост.

Внедряване в реалния свят

LLaMA, Mistral и Qwen заменят LayerNorm с RMSNorm, за да намалят латентността на извода за всеки токен

Pre-LN позволява на моделите в стил GPT да тренират без загряване със скорост на обучение, от което се нуждае трансформаторът след LN 2017

QK-нормализирането използва RMSNorm при заявки за внимание и ключове, за да спре експлозията на логитите в големи модели

Мобилните и крайните трансформатори приемат RMSNorm, защото отпадането на средната стойност и отклонението намалява трафика на паметта

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RMSNorm and Pre-Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Нормализация на слоя

Frequently asked questions

What is RMSNorm and Pre-Layer Normalization?

RMSNorm е олекотен слой за нормализиране, който премащабира активациите по техния среден квадрат, а нормализирането на предслоя поставя тази стъпка преди всеки подслой, а не след него. Заедно те карат дълбоките трансформатори да тренират стабилно без трикове за загряване.

Какво пропуска RMSNorm в сравнение със стандартния LayerNorm?

RMSNorm пропуска изчисляването и изваждането на средната стойност, като нормализира само по средния квадрат на активациите.

На какво количество RMSNorm разделя всеки активиращ вектор?

RMSNorm разделя на sqrt средната стойност на квадратните елементи, т.е. средната квадратична стойност, след което прилага научено усилване.

Каква е основната полза от нормализацията преди слоя пред нормализацията след слоя?

Поставянето на нормата преди всеки подслой с чист остатъчен път ограничава величините на градиента, премахвайки необходимостта от загряване на скоростта на обучение.

В блок Pre-LN какъв път нормализиращият слой умишлено оставя недокоснат?

Pre-LN нормализира входа към подслой, но остатъчният пряк път го заобикаля, запазвайки чиста градиентна магистрала.

Кои съвременни фамилии модели с отворено тегло използват RMSNorm по подразбиране?

RMSNorm стана стандартна нормализация в LLaMA, Mistral, Qwen, Gemma и най-новите LLM.