RMSNorm ve Katman Öncesi Normalleştirme
RMSNorm, etkinleştirmeleri kök ortalama karelerine göre yeniden ölçeklendiren ve her alt katmandan sonra değil önce adım atan ön katman normalleştirme yerlerine göre yeniden ölçeklendiren hafif bir normalleştirme katmanıdır.
Genel Bakış
Together they make deep transformers train stably without warmup tricks.
Derin Dalış
Standart LayerNorm, ortalamayı çıkarır ve bir özellik vektörü boyunca standart sapmaya böler, ardından öğrenilen bir ölçek ve kaydırma uygular. Zhang ve Sennrich tarafından 2019'da tanıtılan RMSNorm, ortalama merkezlemeyi ve önyargıyı tamamen ortadan kaldırır: her vektörü basitçe öğelerinin ortalama kareköküne böler ve öğrenilmiş özellik başına kazançla çarpar. Bu, bir istatistiği ve birkaç işlemi ortadan kaldırır ve doğruluğu eşleştirirken norm katmanında hesaplamayı kabaca %10-50 oranında azaltır. Ayrı olarak, 'LN Öncesi' yerleşim (dikkatten önceki norm/MLP, çevresinde temiz bir artık yol ile) gradyan büyüklüklerini başlatma sırasında sınırlı tutar; böylece GPT-3, LLaMA ve PaLM gibi modeller, orijinal LN Sonrası transformatörün gerektirdiği öğrenme hızı ısınma hack'leri olmadan eğitilir.
Teknik Bilgi
d boyutlu bir x vektörü için RMSNorm, x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon) değerini hesaplar; burada g öğrenilmiş bir kazanç vektörüdür. Ortalama çıkarma ve önyargı yoktur. LN Öncesi bloktaki artık akış normalleştirmeyi atladığından, kimlik yoluna dokunulmaz ve degradeler doğrudan çıkıştan girişe akar, bu nedenle çok derin yığınlar birleşir.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
RMSNorm'un Geleceği ve Katman Öncesi Normalleştirme
RMSNorm artık çoğu açık ağırlıklı LLM'de (LLaMA, Mistral, Qwen, Gemma) varsayılandır, bu nedenle standart kalmasını bekleyin. Araştırma, tarifi geliştiriyor: QK-norm, RMSNorm'u dikkat sorgularına ve logit büyümesinin kontrol altına alınmasına yönelik anahtarlara uyguluyor ve bazı laboratuvarlar, trilyon parametreli ölçekte ekstra stabilite için norm öncesi ve sonrası ("sandviç" veya "peri-LN") birleştiriyor. Donanım çekirdekleri hız için işlemi birleştirmeye devam ediyor.
Gerçek Dünya Uygulaması
LLaMA, Mistral ve Qwen, her jetonda çıkarım gecikmesini azaltmak için LayerNorm'u RMSNorm ile değiştirir
LN öncesi, GPT tarzı modellerin 2017 LN Sonrası transformatörün ihtiyaç duyduğu öğrenme hızı ısınması olmadan eğitilmesine olanak tanır
QK normalleştirmesi, logitlerin büyük modellerde patlamasını önlemek için dikkat sorgularında ve anahtarlarında RMSNorm'u kullanır
Mobil ve uç transformatörler RMSNorm'u benimser çünkü ortalama ve sapmanın düşürülmesi bellek trafiğini azaltır
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the RMSNorm and Pre-Layer Normalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Katman Normalleştirme
Sık sorulan sorular
What is RMSNorm and Pre-Layer Normalization?
RMSNorm, etkinleştirmeleri kök ortalama karelerine göre yeniden ölçeklendiren ve her alt katmandan sonra değil önce adım atan ön katman normalleştirme yerlerine göre yeniden ölçeklendiren hafif bir normalleştirme katmanıdır. Birlikte, derin transformatörlerin ısınma hileleri olmadan istikrarlı bir şekilde eğitilmesini sağlarlar.
RMSNorm, standart LayerNorm'a kıyasla neyi atlıyor?
RMSNorm, ortalamanın hesaplanmasını ve çıkarılmasını atlar ve yalnızca aktivasyonların ortalama kareköküyle normalleştirme yapar.
RMSNorm her aktivasyon vektörünü hangi miktara böler?
RMSNorm, kareli elemanların ortalamasının (yani ortalama karenin kökü) karesine böler ve ardından öğrenilen kazancı uygular.
Katman öncesi normalleştirmenin, katman sonrası normalleştirmeye göre temel faydası nedir?
Normu her alt katmanın önüne temiz bir artık yolla yerleştirmek, gradyan büyüklüklerini sınırlar ve öğrenme hızının ısınmasına olan ihtiyacı ortadan kaldırır.
LN Öncesi blokta, normalleştirme katmanı hangi yola bilinçli olarak dokunulmadan bırakılır?
LN öncesi, bir alt katmana giden girişi normalleştirir, ancak kalan kısayol bunu atlayarak temiz bir eğim otoyolunu korur.
Hangi modern açık ağırlıklı model aileleri varsayılan olarak RMSNorm'u kullanıyor?
RMSNorm, LLaMA, Mistral, Qwen, Gemma ve en yeni LLM'lerde standart normalleştirme haline geldi.