ビジュアルAIガイド

変形可能な畳み込み

変形可能な畳み込みにより、ニューラル ネットワークは、硬い正方形のウィンドウを強制的に通過させるのではなく、オブジェクトの実際の形状に従うようにサンプリング グリッドを曲げることができます。

2分の読書最終更新日

概要

This makes models far better at handling odd shapes, scale changes, and geometric distortion.

ディープダイブ

通常の畳み込みでは、固定オフセット (各位置を中心とした整然とした 3x3 グリッド) でピクセルがサンプリングされます。これはテクスチャにはうまく機能しますが、オブジェクトが傾いたり、伸びたり、奇妙な形状になったりすると困難になります。 2017 年の Microsoft Research で Dai 氏らによって導入された変形可能な畳み込みは、これらの各サンプリング ポイントに学習された小さなオフセットを追加します。ネットワークは入力を調べて、すべてのグリッド位置の 2D シフトを予測するため、受容野は湾曲したエッジに沿って変形したり、斜めの手足に沿ったりすることができます。変形可能な RoI プーリングは、同じ考え方を領域特徴に適用します。バージョン 2 (2018) では、ポイントごとの変調ウェイトが追加され、レイヤーが各サンプルを減衰または増幅できるようになり、COCO などのベンチマークでのオブジェクト検出の精度が向上しました。

技術的な洞察

オフセットは、並列実行される追加の畳み込み層によって生成され、N ポイント カーネルの 2N 値 (ポイントごとに 1 つの dx、1 つの dy) を出力します。予測されたオフセットは分数であるため、サンプリングされたピクセル値は双一次補間で計算され、演算全体を微分可能に保ちます。オフセットは通常のバックプロパゲーションを通じてエンドツーエンドで学習されます。ネットワークにどこを見るべきかを指示する個別の監視はありません。オフセット ブランチはメインの特徴マップに比べて軽量であるため、追加コストは控えめです。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

変形可能な畳み込みの未来

変形可能な注意は現代の検出のバックボーンとなっています。変形可能な DETR は学習されたサンプリング オフセットを使用して、トランスフォーマーの注意をまばらかつ高速にし、元の DETR と比較してトレーニング時間を大幅に短縮します。変形可能な原理は、ビデオ、3D 点群、および視覚言語モデルに広がり続けることが予想されます。適応サンプリングは、モーション、オクルージョン、および不規則なジオメトリの処理に役立ちます。不規則なメモリ アクセスに対するハードウェア サポートが向上するにつれて、変形可能なオペレータもより安価になり、エッジ デバイスにさらに広く導入されるはずです。

現実世界の実装

COCO でのオブジェクト検出。変形可能なレイヤーにより、電車やキリンなどの細長いオブジェクトや回転したオブジェクトの精度が向上します。

街路シーンのセマンティック セグメンテーションにより、モデルが曲線の車線境界線や不規則な建物の輪郭をトレースできるようにします

エンドツーエンド検出のための変形可能な DETR、学習されたオフセットを使用して変圧器の注意を効率的にする

医療画像処理。腫瘍や臓器の形状が固定グリッドでは十分に捕捉できない非剛体形状をしている場合

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deformable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

深さ方向に分離可能な畳み込み

よくある質問

What is Deformable Convolutions?

変形可能な畳み込みにより、ニューラル ネットワークは、硬い正方形のウィンドウを強制的に通過させるのではなく、オブジェクトの実際の形状に従うようにサンプリング グリッドを曲げることができます。これにより、モデルは奇妙な形状、スケールの変更、幾何学的歪みをより適切に処理できるようになります。

変形可能な畳み込みは、標準の畳み込みと比較して何を追加しますか?

変形可能な畳み込みは、各サンプリング位置の学習されたオフセット (dx、dy) を予測し、オブジェクトの形状に一致するようにグリッドをワープさせます。

変形可能な畳み込みのサンプリング オフセットはどのように生成されますか?

並列畳み込みブランチはオフセットを出力します。オフセットはバックプロパゲーションを通じてエンドツーエンドで学習されます。

予測されたオフセットは通常小数であるため、それらの位置でピクセル値はどのようにサンプリングされるのでしょうか?

分数オフセットには双一次補間が必要であり、これによりトレーニング用に演算を微分可能に保つことができます。

Deformable ConvNets v2 (2018) はオリジナルに何を追加しましたか?

v2 では、変調、つまり影響を増幅または抑制できるサンプリング ポイントごとに学習された重みが導入され、精度が向上しました。

変形可能な畳み込みが不規則な形状のオブジェクトに特に役立つのはなぜですか?

サンプリング グリッドを曲げることにより、有効受容野は硬い正方形ではなく、物体の幾何学形状と一致します。