基本ガイド

ドロップアウトと確率的正則化

ドロップアウトは、各トレーニング ステップ中にニューロンの一部をランダムにオフにし、ネットワークに冗長で堅牢な表現を構築させる正則化トリックです。

2分の読書最終更新日

概要

It became one of the most influential techniques for fighting overfitting in deep learning.

ディープダイブ

ヒントン氏のグループによって 2012 年頃に導入されたドロップアウトは、大規模ネットワークの主要な弱点に対処します。ニューロンは協調適応することができ、トレーニング データに対してのみ機能する方法で互いの間違いを修正することを学習します。トレーニング中のすべての順方向パスで、ドロップアウトは各ニューロンの出力をある確率 p (密な層では 0.5 の場合が多い) でランダムに 0 に設定します。どのニューロンも消滅する可能性があるため、ネットワークは脆弱なパートナーシップに頼ることはできず、多くのユニットに有用な情報を分散させる必要があります。これは、重みを共有する間引きされたネットワークの巨大なアンサンブルをトレーニングするように機能します。テスト時にはドロップアウトがオフになり、ネットワーク全体が使用され、予想される出力がトレーニングと一致するようにアクティベーションがスケールされます。その結果、通常はトレーニングが若干長くなりますが、一般化が向上します。

技術的な洞察

トレーニング中、各ユニットはランダムなバイナリ マスクを介して確率 (1 マイナス p) で維持されるため、バッチごとに異なるサブネットワークがサンプリングされます。最新のフレームワークは反転ドロップアウトを使用します。つまり、生き残ったアクティベーションはトレーニング時に (1 マイナス p) で除算されるため、推論時にスケーリングは必要ありません。このランダム性により、共適応を妨げるノイズが注入され、安価なアンサンブル形式である共有重みサブネットワークの指数関数的な平均を近似します。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

ドロップアウトと確率的正則化の未来

畳み込みビジョン ネットワークでは、バッチ正規化によって標準的なドロップアウトが大幅に置き換えられましたが、別の場所ではバリアントが繁栄しています。トランスフォーマーはドロップアウトをアテンション層とフィードフォワード層に適用し、DropPath (確率的深さ) は残差ブロック全体をドロップします。推論時にドロップアウトをアクティブに保つモンテカルロ ドロップアウトは、モデルの不確実性を推定するために使用されます。確率的正則化は、単一の固定レシピではなく、アーキテクチャごとに適応された柔軟なツールキットであり続けることが期待されます。

現実世界の実装

PyTorch または Keras の画像またはテキスト分類子の密なレイヤー間に p が約 0.5 のドロップアウト レイヤーを追加する

事前トレーニング中にドロップアウトをアテンションウェイトとフィードフォワードアクティベーションに適用するトランスフォーマーモデル

モンテカルロ ドロップアウト。ドロップアウトが推論時に留まり、医療または安全性が重要な予測の不確実性の推定値を生成します。

確率的深度 (DropPath) は残差ブロックをランダムにスキップして、ResNet やビジョン トランスフォーマーなどの非常に深いネットワークを正規化します

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

ドロップアウトと確率的正則化が役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

勢いのある確率的勾配降下法

よくある質問

What is Dropout and Stochastic Regularization?

ドロップアウトは、各トレーニング ステップ中にニューロンの一部をランダムにオフにし、ネットワークに冗長で堅牢な表現を構築させる正則化トリックです。これは、深層学習における過学習と戦うための最も影響力のある手法の 1 つになりました。

ドロップアウト者はトレーニング中に何をしますか?

ドロップアウトは、トレーニング中に確率 p で各ニューロンをランダムにゼロにするため、ステップごとに異なる間引かれたサブネットワークが使用されます。

なぜドロップアウトによって一般化が改善されるのでしょうか?

ドロップアウトは、ユニットをランダムに削除することで、ニューロンがトレーニング データに対してのみ機能する脆弱なパートナーシップを形成するのを防ぎ、堅牢性を向上させます。

テスト(推論)時のドロップアウトはどうなりますか?

推論では、ネットワーク全体がドロップアウトを無効にして実行され、アクティブ化は、期待される出力がトレーニング分布と一致するようにスケーリングされます。

層内のドロップアウト率 p = 0.5 は、トレーニング中におおよそ何を意味しますか?

p = 0.5 の場合、各ニューロンは 50% の確率でゼロになるため、平均すると、前方パスごとに約半分がドロップされます。

ドロップアウトが近似的であるとよく言われるのは何ですか?

各ステップで異なるサブネットワークをサンプリングすると、指数関数的な数の共有重みネットワークの平均が近似され、安価なアンサンブルの形式になります。