ビジュアルAIガイド

機能ピラミッド ネットワーク

特徴ピラミッド ネットワーク (FPN) を使用すると、検出器は特徴のマルチスケール「ピラミッド」を安価に構築することで、大きく異なるサイズのオブジェクトを検出できます。

2分の読書最終更新日

概要

They are the reason modern detectors find both a tiny faraway pedestrian and a huge nearby truck in the same image.

ディープダイブ

画像内のオブジェクトはさまざまなスケールで表示され、単一の特徴マップでそれらすべてを処理するのは困難です。以前のアプローチでは、写真のサイズを何度も変更し、コピーごとにネットワークを実行することで画像ピラミッドを構築していましたが、これには時間がかかりました。 FPN、Lin らによって導入されました。 2017 年には、代わりに、すでに畳み込みネットワーク内にある自然なピラミッドを再利用します。 ResNet のようなバックボーンは、ネットワークの深部になるほど小さくなり、よりセマンティックになる特徴マップを生成します。 FPN はトップダウンの経路を追加します。つまり、深くて意味的に豊富な特徴をアップサンプリングし、横方向の接続を介して浅い、高解像度の特徴とマージします。その結果、意味的に強力でありながら細かい空間的詳細を保持する一連の特徴マップが得られ、追加コストをほとんどかけずに小さなオブジェクトの検出が劇的に向上します。

技術的な洞察

FPN には、ボトムアップの経路 (バックボーン) とトップダウンの経路があります。トップダウンの各レベルは 2x (最近傍) でアップサンプリングされ、一致する解像度の 1x1 畳み込み横方向特徴マップに要素ごとに追加されます。次に、3x3 の畳み込みにより、マージされた各マップが平滑化され、エイリアシングが削減されます。これにより、固定チャンネル数 (多くの場合 256) でレベル P2 ~ P5 が生成され、それぞれが特定のスケール範囲のオブジェクトを検出する役割を果たします。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

機能ピラミッド ネットワークの将来

FPN のトップダウン設計は多くの後継製品を生み出しました。PANet はボトムアップ パスを追加し、BiFPN (EfficientDet で使用) は重み付けされた接続により融合を学習可能かつ双方向にし、NAS-FPN は融合トポロジを自動的に検索します。 DETR のような変圧器検出器は明示的なピラミッドを回避しますが、マルチスケール融合は引き続き中心的です。 FPN スタイルのアイデアは、固定接続ではなく学習された適応スケール重み付けを使用して、ビジョン トランスフォーマーや効率的なオンデバイス検出器内に存続すると予想されます。

現実世界の実装

自動運転車の認識スタックで遠くの小型歩行者と近くの大型車両を同時に検出

Mask R-CNN でインスタンス セグメンテーションを強化し、FPN がマルチスケール フィーチャを領域提案とマスク ヘッドに供給します。

医療画像検出パイプラインで大きな臓器の横にある小さな腫瘍を発見

小型ボートから大きな建物まで、衛星画像や航空写真からさまざまなサイズのオブジェクトを検索

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Feature Pyramid Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

空間変換ネットワーク

よくある質問

What is Feature Pyramid Networks?

特徴ピラミッド ネットワーク (FPN) を使用すると、検出器は特徴のマルチスケール「ピラミッド」を安価に構築することで、大きく異なるサイズのオブジェクトを検出できます。最新の検出器が、遠くにある小さな歩行者と近くにある巨大なトラックの両方を同じ画像内で検出するのはこれらの理由によるものです。

フィーチャー ピラミッド ネットワークは主にどのような中心的な問題を解決しますか?

FPN はマルチスケールの特徴表現を構築するため、検出器は小さなものから非常に大きなものまでのオブジェクトを 1 回のパスで処理できます。

FPN におけるトップダウン経路の役割は何ですか?

トップダウン パスウェイは、深い意味論的な特徴をアップサンプリングし、浅い高解像度のマップとマージするため、すべてのレベルが詳細で意味論的に強力になります。

通常、横方向の接続はアップサンプリングされたトップダウン機能とどのように組み合わされるのでしょうか?

1x1 畳み込みは、横方向特徴マップのチャネル数を調整し、要素ごとに 2 倍アップサンプリングされたトップダウン特徴に追加します。

FPN でマージされた各特徴マップに 3x3 畳み込みが適用されるのはなぜですか?

要素ごとに加算した後、3x3 畳み込みにより、アップサンプリングによって発生するエイリアシング アーティファクトが低減され、よりきれいなピラミッド レベルが生成されます。

学習可能な重み付き双方向融合を使用して FPN を拡張した後のアーキテクチャはどれですか?

EfficientDet とともに導入された BiFPN は、特徴融合を双方向にし、各入力がどの程度強く寄与するかの重みを学習します。