テクニカルガイド

レイヤーの正規化

レイヤー正規化は、平均と単位分散がゼロになるように、個々の例内のアクティベーションを再スケーリングすることでトレーニングを安定させます。

2分の読書最終更新日

概要

これは静かでありながら重要な要素であり、ディープトランスを訓練可能にしています。

ディープダイブ

2016 年に Ba、Kiros、Hinton によって導入されたレイヤー正規化 (LayerNorm) は、信号が多くのレイヤーを通過するときに深いネットワーク内のアクティベーションが大幅に異なるスケールにドリフトし、学習が遅くなったり不安定になったりする可能性があるという問題に対処します。ミニバッチ内のサンプル全体で各特徴を正規化するバッチ正規化とは異なり、LayerNorm は 1 つのサンプルの特徴全体を正規化します。これにより、バッチ サイズに依存せず、トレーニングと推論で同様に使用できるようになり、可変長シーケンスでも自然に動作するため、現代の言語モデルを強化するトランスフォーマーの標準となったのです。正規化後、学習可能なスケール (ガンマ) とシフト (ベータ) が適用されるため、ネットワークは必要な表現を復元できます。

技術的な洞察

特徴ベクトル x の場合、LayerNorm はそのベクトルの要素の平均と分散を計算し、ガンマ * (x - 平均) / sqrt(分散 + イプシロン) + ベータを出力します。統計は単一のサンプルから取得されるため、バッチのサンプルが 1 つであっても 1000 個であっても、動作は同じです。より単純なバリアントである RMSNorm は、平均減算をスキップし、二乗平均平方根でのみ除算するため、計算量が節約されます。 Llama などのモデルで使用されます。配置も重要です。「プレノーム」(各サブレイヤーの前に正規化する) では、「ポストノーム」よりもディープ トランスフォーマーのトレーニングがはるかに簡単になります。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

レイヤー正規化の将来

大規模な効率化のために正規化が合理化されています。 RMSNorm は、より安価で同様に機能するため、新しい大規模言語モデルの LayerNorm に大幅に置き換えられ、プレノルム配置が非常に深いスタックのデフォルトになっています。研究者は、正規化によって提供されるトレーニングの安定性を維持しながらオーバーヘッドを削減することを目的として、代わりに慎重な初期化またはスケーリング手法を使用する正規化不要のアーキテクチャの探索を続けています。

現実世界の実装

GPT や BERT などの言語モデルのすべての変換ブロックを安定化します。

Llama ファミリ モデル内の軽量な正規化の選択肢として RMSNorm を有効にします。

バッチサイズが異なる音声および翻訳モデルの可変長シーケンス データを正規化します。

一部の強化学習セットアップなどで、バッチ サイズ 1 で信頼性の高いトレーニングを可能にします。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

RMSNorm と前層正規化

よくある質問

レイヤー正規化とは何ですか?

レイヤー正規化は、平均と単位分散がゼロになるように、個々の例内のアクティベーションを再スケーリングすることでトレーニングを安定させます。それは静かですが、ディープトランスフォーマーを訓練可能にする重要な成分です。

レイヤーの正規化では、何を対象として平均と分散が計算されますか?

LayerNorm は、1 つの個々のサンプルのフィーチャ次元を正規化して、バッチ内の他のサンプルから独立させます。

トランスフォーマーではバッチ正規化よりもレイヤー正規化が優先されるのはなぜですか?

LayerNorm の統計は単一の例に基づいているため、バッチ サイズに関係なく一貫して動作し、可変長のテキスト シーケンスに適しています。

学習可能なパラメータ gamma と beta は LayerNorm に何をさせるのでしょうか?

ゼロ平均と単位分散に正規化した後、モデルが固定分布に強制されないように、結果をガンマ スケーリングとベータ シフトします。

RMSNorm は標準の LayerNorm とどのように異なりますか?

RMSNorm は平均中心化ステップを省略し、アクティベーションの二乗平均平方根によってスケーリングします。これは安価で、Llama などのモデルで使用されます。

層の正規化は主にディープ ネットワークで解決に役立つ問題は何ですか?

信号が多くの層を通過するにつれて、そのスケールは拡大または縮小する可能性があります。正規化によりアクティベーションが安定した範囲に保たれるため、勾配が適切に動作します。