基本ガイド

体重減少と L2 正則化

重み減衰は、トレーニング中にモデルの重みをゼロに向けて微調整し、単一の機能に過度に依存するのを防ぐ、シンプルで強力な手法です。

2分の読書最終更新日

概要

It reduces overfitting and is one of the most widely used regularizers in deep learning.

ディープダイブ

モデルがトレーニングされるとき、トレーニング セットに完全に適合するものの一般化が不十分な、細かく調整された重みを大きくすることで、データ内のノイズを捕らえることができます。 L2 正則化は、損失関数の重みの 2 乗の合計に比例するペナルティを追加することで、これに対抗します。オプティマイザーには 2 つの目標があります。それは、データを適合させることと、重みを小さく保つことで、よりスムーズで堅牢なソリューションを決定することです。重みの減衰は、更新ステップごとにすべての重みを少しずつ縮小するという密接に関連した概念です。単純な勾配降下法では、この 2 つは数学的に同等ですが、Adam のような適応オプティマイザーでは異なります。そのため、勾配ベースの更新から減衰を分離し、正しく動作させるために AdamW が導入されました。

技術的な洞察

L2 正則化では、重みの 2 乗和のラムダ倍が損失に追加されるため、その勾配によって各重みに比例する項が追加され、重みが 0 に近づくようになります。分離された重み減衰では、代わりに、各重みに (1 から learning_rate を掛けてラムダを引いたもの) のような係数を直接乗算します。適応型手法では、L2 を損失に結合することで、パラメーターごとのスケーリングによってペナルティが歪むため、AdamW は収縮を個別に適用し、より小さい重みに向けて意図した均一なプルを復元します。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

体重減少と L2 正則化の未来

重み減衰は、依然として大規模な言語モデルとビジョン トランスフォーマーのトレーニング レシピのデフォルトの要素であり、AdamW は現在、それらの標準オプティマイザーです。モデルが成長するにつれて減衰の実効強度が変化するため、減衰が学習率スケジュール、正規化層、モデルのスケールとどのように相互作用するかについて研究が続けられています。自動化されたハイパーパラメータ検索とスケーリング則の研究が成熟するにつれ、より原則に基づいた、おそらくレイヤごとまたはスケジュールを意識した減衰調整が期待されます。

現実世界の実装

過学習を抑制するために画像分類器をトレーニングするときに PyTorch の AdamW または SGD オプティマイザーに Weight_decay を追加する

古典的な L2 ペナルティのある線形モデルであるリッジ回帰のラムダ係数を調整して、相関のある特徴の予測を安定化します。

学習率スケジュールに沿って小さな重み減衰 (多くの場合約 0.1) を設定する大規模な言語モデルの事前トレーニング レシピ

重みの減衰とデータの増強およびドロップアウトを組み合わせて、小規模な医用画像モデルが限られたトレーニング スキャンを記憶しないようにする

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

Weight Decay と L2 正則化が役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Weight Decay and L2 Regularization?

重み減衰は、トレーニング中にモデルの重みをゼロに向けて微調整し、単一の機能に過度に依存するのを防ぐ、シンプルで強力な手法です。これは過学習を軽減し、深層学習で最も広く使用されている正則化子の 1 つです。

L2 正則化は損失関数に何を追加しますか?

L2 正則化では、重みの二乗和のラムダ倍が加算され、大きな重みにペナルティが課され、より小さく滑らかなソリューションが促進されます。

体重減少が予防に役立つ主な問題は何ですか?

重みを小さく保つことで、重みの減衰によってモデルがノイズに適合することが妨げられ、新しいデータへの一般化が向上します。

重みの減衰はモデルの重みをどの方向に押しますか?

重みの減衰では、更新のたびに重みが 0 に向かって縮小するため、重みを「減衰する」と表現されることもあります。

AdamW が導入された理由は何ですか?

Adam では、L2 を損失に折り畳むことは、パラメーターごとのスケーリングと悪影響を及ぼします。 AdamW は、意図した均一な収縮を復元するために減衰を個別に適用します。

単純な確率的勾配降下法の場合、L2 正則化と重み減衰はどのように関係しますか?

単純な SGD では、損失に L2 ペナルティを追加すると、重みを直接縮小するのと同じ更新が生成されるため、この 2 つは同等です。