アクティベーション関数
活性化関数は各ニューロン内の小さな非線形ゲートであり、ニューラル ネットワークが単なる直線ではなく複雑な曲線パターンを学習できるようにします。
概要
Without them, a deep network would collapse into a single linear equation.
ディープダイブ
各ニューロンは入力の重み付き合計を計算しますが、その合計だけでは線形です。多くの線形層を積み重ねても、数学的には、どれほど深くても、大きな線形関数は 1 つだけになります。活性化関数は、各ニューロンの出力に非線形変換を適用することでこれを打破し、ネットワークにほぼすべての関数を近似する能力を与えます。最も人気のあるのは ReLU で、正の場合は入力を単純に出力し、それ以外の場合はゼロを出力します。これは高速であり、古い関数のトレーニングの問題を回避します。シグモイドとタンは値を境界のある範囲に押し込み、歴史的には一般的でしたが、深いネットワークでは勾配が消えるという問題が発生する可能性があります。出力で使用されるソフトマックス関数は、生のスコアをクラス全体の確率分布に変換します。
技術的な洞察
ReLU の魅力の一部はその勾配です。正の入力の場合はちょうど 1 であるため、バックプロパゲーション中に誤差信号が縮小せず、深いネットワークのトレーニングに役立ちます。対照的に、シグモイドとタン関数は、勾配がゼロに近づく極端なところで平坦になり、深いスタックでの学習を遅らせる勾配消失問題を引き起こします。 ReLU の欠点は、負の入力に固定されたニューロンの出力が永久に 0 になる、瀕死の ReLU 問題です。 Leaky ReLU や GELU などの亜種は、小さいまたは滑らかな非ゼロ応答を許可することでこの問題に対処します。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
アクティベーション関数の未来
ReLU とそのスムーズないとこである GELU が現在主流となっており、トランスフォーマーでは GELU が好まれています。これは、その滑らかな曲線がトレーニング ダイナミクスとよく調和しているためです。研究では、現在大規模な言語モデルで一般的となっている SwiGLU のような、乗算ゲートを使用して表現力を高める学習型およびゲート型アクティベーションを調査しています。大規模な傾向としては、グラジエント フローとモデルの品質を大規模に向上させる、スムーズなゲート関数が求められています。エキゾチックなアクティベーションは定期的に論文に登場しますが、実際には単純で適切に動作する関数が勝つ傾向があります。これは、巨大なモデルにわたって確実にトレーニングされるためです。
現実世界の実装
畳み込みネットワークの隠れ層で ReLU を使用して、画像認識の曲線決定境界を学習できるようにする
最終層でソフトマックスを適用して、分類子の生のスコアを合計が 1 になるクラス確率に変換します。
よりスムーズなグラデーション フローを実現するためにトランスフォーマー言語モデル内で GELU アクティベーションを選択する
ネットワーク内のニューロンが多すぎて停止し、応答を停止した場合に Leaky ReLU に切り替える
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
アクティベーション関数が役立つ場合と、より単純な方法の方が優れている場合を文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Activation Functions quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
損失関数
よくある質問
What is Activation Functions?
活性化関数は各ニューロン内の小さな非線形ゲートであり、ニューラル ネットワークが単なる直線ではなく複雑な曲線パターンを学習できるようにします。これらがなければ、深いネットワークは単一の線形方程式に崩壊してしまいます。
活性化関数のないディープネットワークでは何が起こるでしょうか?
非線形性のない線形レイヤーを積み重ねると、数学的には 1 つの線形変換に崩壊するため、ネットワークは複雑なパターンを学習できません。
ReLU 活性化関数は負の入力に対して何を出力しますか?
ReLU は、正の場合は入力を出力し、負の場合はゼロを出力するため、計算が簡単かつ高速になります。
シグモイドとタン関数に関連する勾配消失問題とは何ですか?
シグモイドとタン関数は両端で平坦になるため、その勾配はゼロに向かって縮小し、深いネットワークでのエラー信号が弱まります。
マルチクラス分類器の出力層で通常使用される活性化関数はどれですか?
Softmax は、生のスコアを、分類出力に最適な、合計が 1 になるクラス全体の確率分布に変換します。
「瀕死のReLU」問題とは何ですか?
ReLU ニューロンが常に負の入力を受け取る場合、ゼロ勾配でゼロを出力し、実質的に更新を停止するため、「死滅」します。