ビジュアルAIガイド

複数のオブジェクトの追跡

マルチオブジェクト トラッキング (MOT) は、ビデオのフレーム全体で多くのオブジェクト (歩行者、車、プレーヤー) を追跡し、時間の経過とともにそれぞれに一貫したアイデンティティを与えます。

2分の読書最終更新日

概要

It's the backbone of autonomous driving perception, sports analytics, and smart-city traffic monitoring.

ディープダイブ

マルチオブジェクト追跡は、「各フレームに何があるか」だけでなく、「フレーム 2 で検出されたどのオブジェクトがフレーム 1 と同じオブジェクトであるか」にも答えます。主流のパラダイムは、検出による追跡です。オブジェクト検出器 (YOLO など) がフレームごとに境界ボックスを見つけ、その後、トラッカーがそれらを時間の経過とともに軌跡にリンクします。 SORT は、各オブジェクトがどこに移動するかを予測するカルマン フィルターとハンガリーのアルゴリズムを組み合わせて、最適なボックス マッチングを実現します。 DeepSORT は学習された外観の埋め込みを追加するため、オクルージョン後にオブジェクトを再識別できます。 ByteTrack は、信頼性の低い検出も破棄するのではなく関連付けることで精度を向上させました。主な問題は、オクルージョン、アイデンティティ スイッチ (オブジェクトが交差するときに ID を交換する)、混雑したシーン、フレームに出入りするオブジェクトです。

技術的な洞察

トラッカーは、モーション モデルを使用して各オブジェクトの「トラック」を維持します。カルマン フィルターは、各トラックの次の位置を予測します。新しい検出は、コスト (オーバーラップ/IoU と外観の類似性) を計算し、ハンガリーのアルゴリズムで割り当てを解決することによって、予測と照合されます。外観の埋め込み (再識別ネットワークからのコンパクトな特徴ベクトル) により、オブジェクトが一時的に隠された後、システムが正しいアイデンティティを回復できるようになり、混雑したシーンで純粋なモーション モデルが被る ID の切り替えが防止されます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

複数オブジェクト追跡の未来

トラッキングは、1 つのネットワーク内でオブジェクトを共同で検出して関連付ける、エンドツーエンドのトランスフォーマー モデル (TrackFormer や MOTR など) に移行しており、脆弱な手動調整のマッチング ステージが廃止されています。自動運転車や大規模会場向けの強力なマルチカメラと 3D 追跡に加え、固定カテゴリではなく任意のオープンボキャブラリーのオブジェクトの追跡が期待されます。長期的な再識別の向上と、重度のオクルージョンや群衆に対する堅牢性は依然として積極的な目標であり、豊富な視覚機能を提供する基礎モデルによってますます支援されています。

現実世界の実装

周囲の車、自転車、歩行者を追跡して進路を予測し、衝突を回避する自律型車両認識

すべてのプレーヤーとボールを追跡して、移動距離、フォーメーション、ポゼッション統計を計算するスポーツ分析

車両をカウントして追跡し、流れを測定し、渋滞を検出し、信号を知らせるスマートシティ交通システム

店舗内での買い物客の動きや交通ハブでの人々の動きを追跡する小売およびセキュリティ分析

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Object Tracking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Multi-Object Tracking?

マルチオブジェクト トラッキング (MOT) は、ビデオのフレーム全体で多くのオブジェクト (歩行者、車、プレーヤー) を追跡し、時間の経過とともにそれぞれに一貫したアイデンティティを与えます。これは、自動運転の認識、スポーツ分析、スマートシティの交通監視のバックボーンです。

複数のオブジェクト追跡の中心的な目標は何ですか?

MOT は、ビデオ内を移動するオブジェクトごとに一貫した ID を割り当てて維持し、時間の経過とともに検出を軌跡に結び付けます。

「検出による追跡」パラダイムには何が含まれますか?

検出による追跡では、フレームごとにオブジェクト検出器が実行され、結果として得られるボックスが時間の経過とともに連続したトラックに関連付けられます。

SORT のようなトラッカーではカルマン フィルターはどのような役割を果たしますか?

カルマン フィルターは各オブジェクトの動きをモデル化し、その次の位置を予測し、それが新しい検出と照合されます。

DeepSORT は SORT に何を追加しましたか?

DeepSORT では、オブジェクトが一時的に隠された後に再識別できるように外観特徴ベクトルを導入し、ID の切り替えを減らしました。

マルチオブジェクトトラッキングにおける「アイデンティティスイッチ」とは何ですか?

ID スイッチは、トラッカーがオブジェクト間で ID を誤って再割り当てするときに発生します。一般に、混雑したシーンでオブジェクトが重なったり交差したりする場合に発生します。