空間変換ネットワーク
Spatial Transformer Network (STN) は、ニューラル ネットワークが入力をアクティブにワープ、回転、クロップ、または再スケールして重要なことに焦点を当てることができる学習可能なモジュールです。
概要
They give CNNs a built-in sense of spatial attention and invariance.
ディープダイブ
標準的な畳み込みネットワークは、位置、スケール、回転の変化に対してわずかに不変であり、わずかな許容誤差をプールに依存しています。 Jaderberg らによって導入された Spatial Transformer Networks 2015 年には、特徴マップに対して明示的な幾何学的変換を実行する微分可能モジュールを挿入することでこの問題を修正しました。このモジュールには、変換パラメータを予測するローカリゼーション ネットワーク、それらのパラメータからサンプリング グリッドを構築するグリッド ジェネレータ、およびグリッド ポイントで入力を補間するサンプラーの 3 つの部分があります。すべてのステップが微分可能であるため、トランスフォーマー全体は追加の監視なしでバックプロパゲーションによってエンドツーエンドでトレーニングされます。ネットワークは、たとえば、傾いた数字をまっすぐにしたり、関連する領域を拡大したりすることを学習して、精度と堅牢性を高めます。
技術的な洞察
ローカリゼーション ネットワークは、平行移動、スケール、回転、およびせん断のパラメーター (多くの場合 2x3 アフィン行列) を出力します。グリッド ジェネレーターは、そのマトリックスを介して各出力ピクセルをソース座標にマッピングし直します。次に、サンプラーは双線形補間を使用して入力を読み取ります。これは微分可能であるため、勾配が位置特定ネットワークに流れます。これにより、モジュールは純粋にタスク損失から変換を学習し、関連する領域に注目して正規化することができます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
空間変換ネットワークの将来
STN は、ネットワークがジオメトリと注意を処理する方法に影響を与え、変形可能な畳み込みと学習されたワーピング モジュールにフィードします。現在ではセルフ アテンション トランスフォーマーが主流となっていますが、テキスト認識、きめ細かい分類、ポーズの正規化など、明示的な幾何学的位置合わせが必要なタスクでは STN スタイルの微分可能サンプリングが引き続き使用されています。微分可能なワープは、3D ビジョン、ニューラル レンダリング、医療画像レジストレーションに引き続き表示され、多くの場合、注意に取って代わられるのではなく、注意と組み合わされることが予想されます。
現実世界の実装
シーンテキスト OCR システムで認識する前に、湾曲または回転したテキストをまっすぐにして位置合わせする
識別領域(鳥のくちばしや翼など)にズームインして、きめの細かい画像分類を行う
顔認識パイプラインの前処理ステップとしての顔のポーズと位置合わせの正規化
医療画像レジストレーションにおける歪みの修正とスキャンの位置合わせ
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Spatial Transformer Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
DETR 変圧器の検出
よくある質問
What is Spatial Transformer Networks?
Spatial Transformer Network (STN) は、ニューラル ネットワークが入力をアクティブにワープ、回転、クロップ、または再スケールして重要なことに焦点を当てることができる学習可能なモジュールです。これらは CNN に空間的注意と不変性の組み込み感覚を与えます。
Spatial Transformer Network はニューラル ネットワークにどのような機能を追加しますか?
STN は、関連するコンテンツに焦点を当てるために、特徴マップを変換、回転、拡大縮小、またはワープできる学習可能なモジュールを挿入します。
空間変換モジュールを構成する 3 つのコンポーネントはどれですか?
STN は、ローカリゼーション ネットワーク (パラメーターを予測)、グリッド ジェネレーター (サンプリング座標を構築)、およびサンプラー (入力を補間) で構成されます。
Spatial Transformer Network を通常の逆伝播でトレーニングできるのはなぜですか?
サンプラーの双線形補間は微分可能であるため、勾配はグリッド ジェネレーターを介してローカリゼーション ネットワークに戻り、エンドツーエンドのトレーニングが可能になります。
ローカリゼーション ネットワークは通常、アフィン変換に対して何を出力しますか?
アフィン変換の場合、ローカリゼーション ネットワークは、平行移動、スケール、回転、およびせん断をエンコードする 2x3 行列として配置された 6 つの値を予測します。
標準 CNN はなぜ空間変化に対して弱い不変性しか持たず、STN の動機となるのでしょうか?
CNN はプーリングを通じて適度な空間的不変性のみを達成します。 STN は、位置、スケール、回転を処理するための明示的で学習可能な方法を追加します。