RMSNorm と前層正規化
RMSNorm は、アクティベーションを二乗平均平方根によって再スケーリングする軽量の正規化レイヤーであり、レイヤー前の正規化により、各サブレイヤーの後ではなく前にステップが配置されます。
概要
Together they make deep transformers train stably without warmup tricks.
ディープダイブ
Standard LayerNorm は、特徴ベクトル全体で平均を減算し、標準偏差で除算し、学習されたスケールとシフトを適用します。 2019 年に Zhang と Sennrich によって導入された RMSNorm は、平均中心化とバイアスを完全に削除します。各ベクトルをその要素の二乗平均平方根で除算し、学習された特徴ごとのゲインを乗算するだけです。これにより、1 つの統計といくつかの操作が削除され、精度を照合しながら標準層の計算量が約 10 ~ 50% 削減されます。これとは別に、「Pre-LN」配置 (周囲にクリーンな残差パスを持つアテンション/MLP の前のノルム) により、初期化時に勾配の大きさが制限されるため、GPT-3、LLaMA、PaLM などのモデルは、元の Post-LN トランスフォーマーが必要とした学習率のウォームアップ ハックなしでトレーニングできます。
技術的な洞察
次元 d のベクトル x の場合、RMSNorm は x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon) を計算します。ここで、g は学習されたゲイン ベクトルです。平均値の減算や偏りはありません。 Pre-LN ブロックの残差ストリームは正規化をバイパスするため、恒等パスは変更されず、勾配は出力から入力に直接流れます。これが、非常に深いスタックが収束する理由です。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
RMSNorm とプレレイヤー正規化の将来
RMSNorm は現在、ほとんどのオープンウェイト LLM (LLaMA、Mistral、Qwen、Gemma) のデフォルトとなっているため、今後も標準のままになることが予想されます。研究はレシピを改良しています。QK ノルムは、ロジットの成長を抑えるためのアテンション クエリとキーに RMSNorm を適用しており、一部の研究室では、兆パラメータ スケールでの安定性を高めるために、プレノームとポストノーム (「サンドイッチ」または「ペリ LN」) を組み合わせています。ハードウェア カーネルは、速度を高めるために操作を融合し続けます。
現実世界の実装
LLaMA、Mistral、Qwen はすべて、LayerNorm を RMSNorm に置き換えて、すべてのトークンの推論遅延を削減します。
Pre-LN により、2017 Post-LN トランスフォーマーで必要だった学習率のウォームアップなしで GPT スタイルのモデルをトレーニングできるようになります
QK 正規化では、アテンション クエリとキーに対して RMSNorm を使用して、大規模なモデルでのロジットの爆発を防ぎます。
平均値とバイアスの削除によりメモリ トラフィックが削減されるため、モバイルおよびエッジ トランスフォーマーは RMSNorm を採用します。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the RMSNorm and Pre-Layer Normalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
レイヤーの正規化
よくある質問
What is RMSNorm and Pre-Layer Normalization?
RMSNorm は、アクティベーションを二乗平均平方根によって再スケーリングする軽量の正規化レイヤーであり、レイヤー前の正規化により、各サブレイヤーの後ではなく前にステップが配置されます。これらを組み合わせることで、ウォームアップのトリックなしでディープトランスフォーマーを安定してトレーニングできます。
標準の LayerNorm と比較して、RMSNorm では何が省略されますか?
RMSNorm は平均の計算と減算をスキップし、アクティベーションの二乗平均平方根によってのみ正規化します。
RMSNorm は各活性化ベクトルをどの量で分割しますか?
RMSNorm は、二乗要素の平均の sqrt、つまり二乗平均平方根で除算し、学習されたゲインを適用します。
ポストレイヤ正規化と比較したプレレイヤ正規化の主な利点は何ですか?
クリーンな残差パスを持つ各サブレイヤーの前にノルムを配置すると、勾配の大きさが制限され、学習率のウォームアップが不要になります。
Pre-LN ブロックでは、正規化層が意図的に手つかずのままにしているパスは何ですか?
Pre-LN はサブレイヤーへの入力を正規化しますが、残りのショートカットはそれをバイパスし、きれいな勾配ハイウェイを維持します。
デフォルトで RMSNorm を使用する最新のオープンウェイト モデル ファミリはどれですか?
RMSNorm は、LLaMA、Mistral、Qwen、Gemma、および最新の LLM の標準正規化になりました。