ビジュアルAIガイド

DETR 変圧器の検出

DETR (DEtection TRansformer) は、オブジェクト検出をトランスフォーマーで解決される直接のセット予測問題として再構成し、アンカー ボックスや非最大抑制などの手作業で設計されたステップを削除します。

2分の読書最終更新日

概要

It matters because it gave detection a clean, end-to-end pipeline that inspired a wave of transformer-based vision models.

ディープダイブ

2020 年に Facebook AI によって導入された DETR は、CNN バックボーンとトランスフォーマー エンコーダー/デコーダーを組み合わせたものです。 CNN は画像の特徴を抽出します。エンコーダは画像全体にわたってグローバル コンテキストを混合します。デコーダは学習された「オブジェクト クエリ」の固定セットを取得し、それぞれを検出されたオブジェクト (クラスとバウンディング ボックス) または「オブジェクトなし」の結果に変換します。重要な新しさは二部マッチングです。トレーニング中にハンガリーのアルゴリズムが予測とグラウンドトゥルース オブジェクト間の 1 対 1 の割り当てを見つけるため、モデルはオブジェクトごとに一意のボックスを直接出力することを学習します。これにより、最大以外の抑制やアンカー調整が不要になります。トレードオフは、収束が遅く、小さなオブジェクトの精度が低いことでしたが、これは変形可能な DETR などのフォローアップで解決されました。

技術的な洞察

DETR の定義メカニズムは、ハンガリアン マッチングによるセットベースの損失です。数千のアンカー ボックスをスコアリングする代わりに、固定数の予測 (多くの場合 100 個のオブジェクト クエリ) を発行し、それらを真のオブジェクトと 1 対 1 で照合し、一致したペアの分類エラーとボックス エラーの両方にペナルティを課し、一致しないクエリを「オブジェクトなし」に近づけます。照合は 1 対 1 であるため、重複検出は別個の後処理ステップではなく設計によって抑制されます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

DETR 変圧器検出の将来

DETR は検出変圧器のファミリー全体を発売しました。 Deformable DETR、DAB-DETR、DN-DETR、DINO などのバリアントにより、トレーニングが劇的に高速化され、精度が向上し、DINO スタイルのモデルは検出ベンチマークのトップに達しました。クエリベースのエンドツーエンドのパラダイムは現在、セグメンテーション、トラッキング、3D 検出まで拡張されており、オープン語彙検出器はこれに基づいて構築されています。 DETR は手作りのヒューリスティックを排除する極めて重要なステップとして記憶されており、検出、セグメンテーション、および言語基盤が統合トランスフォーマー アーキテクチャに継続的に収束することが期待されます。

現実世界の実装

自動運転研究データセットにおける歩行者と車両の検出とボックス化

ピクセルごとのマスク予測に拡張した場合のパノプティック セグメンテーションの強化

オープンボキャブラリーとグラウンディング検出器のバックボーンアーキテクチャとして機能

データセットごとにアンカー サイズを調整せずに、小売店の棚画像内のオブジェクトを特定する

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DETR Transformer Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

SwinIRトランスの修復

よくある質問

What is DETR Transformer Detection?

DETR (DEtection TRansformer) は、オブジェクト検出をトランスフォーマーで解決される直接のセット予測問題として再構成し、アンカー ボックスや非最大抑制などの手作業で設計されたステップを削除します。これが重要なのは、トランスベースのビジョン モデルの波に影響を与えた、クリーンなエンドツーエンドの検出パイプラインを提供するためです。

Faster R-CNN などの従来の検出器と比較して、DETR は何を除去しますか?

DETR はエンドツーエンドで、一連のボックスを直接予測し、アンカーと非最大抑制の後処理ステップを排除します。

DETR は、トレーニング中に予測をグラウンドトゥルース オブジェクトと照合するためにどのアルゴリズムを使用しますか?

DETR は、ハンガリーのアルゴリズムを使用して、設定された損失に対する予測とグラウンドトゥルース オブジェクトの間の 1 対 1 の割り当てを形成します。

DETR の「オブジェクト クエリ」とは何ですか?

オブジェクト クエリは、固定数の学習されたベクトルです。デコーダはそれぞれをオブジェクト予測または「オブジェクトなし」結果に変換します。

DETR は全体的にどのようなアーキテクチャを組み合わせていますか?

DETR は、セット予測のために、特徴の畳み込みバックボーンとトランスフォーマー エンコーダー/デコーダーを組み合わせます。

DETR には非最大抑制が必要ないのはなぜですか?

1 対 1 のマッチング損失により、モデルはオブジェクトごとに 1 つの予測を出力するようになるため、重複除去の後処理は不要になります。