Teknik KILAVUZ

RMSNorm ve Katman Öncesi Normalleştirme

RMSNorm, etkinleştirmeleri kök ortalama karelerine göre yeniden ölçeklendiren ve her alt katmandan sonra değil önce adım atan ön katman normalleştirme yerlerine göre yeniden ölçeklendiren hafif bir normalleştirme katmanıdır.

2 min readSon güncelleme

Genel Bakış

Together they make deep transformers train stably without warmup tricks.

Derin Dalış

Standart LayerNorm, ortalamayı çıkarır ve bir özellik vektörü boyunca standart sapmaya böler, ardından öğrenilen bir ölçek ve kaydırma uygular. Zhang ve Sennrich tarafından 2019'da tanıtılan RMSNorm, ortalama merkezlemeyi ve önyargıyı tamamen ortadan kaldırır: her vektörü basitçe öğelerinin ortalama kareköküne böler ve öğrenilmiş özellik başına kazançla çarpar. Bu, bir istatistiği ve birkaç işlemi ortadan kaldırır ve doğruluğu eşleştirirken norm katmanında hesaplamayı kabaca %10-50 oranında azaltır. Ayrı olarak, 'LN Öncesi' yerleşim (dikkatten önceki norm/MLP, çevresinde temiz bir artık yol ile) gradyan büyüklüklerini başlatma sırasında sınırlı tutar; böylece GPT-3, LLaMA ve PaLM gibi modeller, orijinal LN Sonrası transformatörün gerektirdiği öğrenme hızı ısınma hack'leri olmadan eğitilir.

Teknik Bilgi

d boyutlu bir x vektörü için RMSNorm, x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon) değerini hesaplar; burada g öğrenilmiş bir kazanç vektörüdür. Ortalama çıkarma ve önyargı yoktur. LN Öncesi bloktaki artık akış normalleştirmeyi atladığından, kimlik yoluna dokunulmaz ve degradeler doğrudan çıkıştan girişe akar, bu nedenle çok derin yığınlar birleşir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

RMSNorm'un Geleceği ve Katman Öncesi Normalleştirme

RMSNorm artık çoğu açık ağırlıklı LLM'de (LLaMA, Mistral, Qwen, Gemma) varsayılandır, bu nedenle standart kalmasını bekleyin. Araştırma, tarifi geliştiriyor: QK-norm, RMSNorm'u dikkat sorgularına ve logit büyümesinin kontrol altına alınmasına yönelik anahtarlara uyguluyor ve bazı laboratuvarlar, trilyon parametreli ölçekte ekstra stabilite için norm öncesi ve sonrası ("sandviç" veya "peri-LN") birleştiriyor. Donanım çekirdekleri hız için işlemi birleştirmeye devam ediyor.

Gerçek Dünya Uygulaması

LLaMA, Mistral ve Qwen, her jetonda çıkarım gecikmesini azaltmak için LayerNorm'u RMSNorm ile değiştirir

LN öncesi, GPT tarzı modellerin 2017 LN Sonrası transformatörün ihtiyaç duyduğu öğrenme hızı ısınması olmadan eğitilmesine olanak tanır

QK normalleştirmesi, logitlerin büyük modellerde patlamasını önlemek için dikkat sorgularında ve anahtarlarında RMSNorm'u kullanır

Mobil ve uç transformatörler RMSNorm'u benimser çünkü ortalama ve sapmanın düşürülmesi bellek trafiğini azaltır

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RMSNorm and Pre-Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Katman Normalleştirme

Sık sorulan sorular

What is RMSNorm and Pre-Layer Normalization?

RMSNorm, etkinleştirmeleri kök ortalama karelerine göre yeniden ölçeklendiren ve her alt katmandan sonra değil önce adım atan ön katman normalleştirme yerlerine göre yeniden ölçeklendiren hafif bir normalleştirme katmanıdır. Birlikte, derin transformatörlerin ısınma hileleri olmadan istikrarlı bir şekilde eğitilmesini sağlarlar.

RMSNorm, standart LayerNorm'a kıyasla neyi atlıyor?

RMSNorm, ortalamanın hesaplanmasını ve çıkarılmasını atlar ve yalnızca aktivasyonların ortalama kareköküyle normalleştirme yapar.

RMSNorm her aktivasyon vektörünü hangi miktara böler?

RMSNorm, kareli elemanların ortalamasının (yani ortalama karenin kökü) karesine böler ve ardından öğrenilen kazancı uygular.

Katman öncesi normalleştirmenin, katman sonrası normalleştirmeye göre temel faydası nedir?

Normu her alt katmanın önüne temiz bir artık yolla yerleştirmek, gradyan büyüklüklerini sınırlar ve öğrenme hızının ısınmasına olan ihtiyacı ortadan kaldırır.

LN Öncesi blokta, normalleştirme katmanı hangi yola bilinçli olarak dokunulmadan bırakılır?

LN öncesi, bir alt katmana giden girişi normalleştirir, ancak kalan kısayol bunu atlayarak temiz bir eğim otoyolunu korur.

Hangi modern açık ağırlıklı model aileleri varsayılan olarak RMSNorm'u kullanıyor?

RMSNorm, LLaMA, Mistral, Qwen, Gemma ve en yeni LLM'lerde standart normalleştirme haline geldi.