オープンボキャブラリーオブジェクトの検出
オープン語彙オブジェクト検出により、モデルはトレーニング中にラベル付けされたことのないカテゴリを含む、任意のテキストで記述されたオブジェクトを見つけてボックスに入れることができます。
概要
It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.
ディープダイブ
従来の検出器は、閉じたカテゴリのセット、たとえば COCO の 80 クラスに基づいてトレーニングされており、そのリストの外にある「もの」を認識できません。オープン語彙検出は、視覚領域の特徴を、通常は大規模な画像とテキストのペア (CLIP など) から学習される共有視覚言語埋め込み空間と整合させることで、この制限を打ち破ります。推論時にテキスト ラベルを指定すると、モデルがそれらのラベルを埋め込み、検出された領域をテキストの埋め込みに最も近いものと照合するため、記述できる限り新しいカテゴリが機能します。 ViLD、GLIP、OWL-ViT、Detic、Grounding DINO などのシステムは、検出バックボーンと言語グラウンディングを組み合わせ、大規模で弱くラベル付けされたデータセットまたはグラウンディング データセットでトレーニングすることにより、このアプローチを普及させました。
技術的な洞察
秘訣は、固定分類子レイヤーをテキスト埋め込みに置き換えることです。既知のクラスごとに 1 つの重みベクトルを学習する代わりに、検出器は各領域を言語エンコーダーと同じ空間に投影します。分類は、領域の特徴と、ユーザーが指定したカテゴリ名または語句の埋め込みとの間の類似性の比較になります。テキスト エンコーダーは目に見えない単語に一般化するため、テスト時に新しいラベル文字列を交換することで、バウンディング ボックスのトレーニング データに存在しないカテゴリの検出が可能になります。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
オープンボキャブラリーオブジェクト検出の未来
オープン語彙の検出は、グラウンディングとセグメンテーションと収束しつつあり、自由形式のフレーズ (単一の単語ではなく) によってオブジェクトの位置が特定され、マスク用の SAM などのモデルと組み合わせたプロンプト可能なシステムが使用されます。より強力なゼロショット精度、より長く、より構成的なテキスト クエリ (「ラップトップの後ろの赤いマグカップ」)、およびオンデマンドで検出するマルチモーダル アシスタントとの緊密な連携が期待されます。 Web スケールの画像とテキストのトレーニングが改善されるにつれて、検出、検索、言語理解の間の境界線は、一般的な視覚的基礎に向けて曖昧になり続けます。
現実世界の実装
再トレーニングせずに名前を入力して、珍しいオブジェクトやカスタム オブジェクトの画像を検索する
ユーザーが物を掴む前に自然言語で名前を付けた物品の位置を特定するロボット システム
テキスト リストから多くの新しいカテゴリを検出することによるデータセットの自動ラベル付け
元のトレーニング ラベルに存在しない記述されたオブジェクトにフラグを立てるコンテンツ モデレーション
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Open-Vocabulary Object Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
物体検出
よくある質問
What is Open-Vocabulary Object Detection?
オープン語彙オブジェクト検出により、モデルはトレーニング中にラベル付けされたことのないカテゴリを含む、任意のテキストで記述されたオブジェクトを見つけてボックスに入れることができます。これが重要なのは、従来の検出器がクラスの固定リストにロックされているのに対し、オープン語彙モデルは名前の付けられるほぼすべてのものを検出できるためです。
オープン語彙オブジェクト検出の特徴的な機能は何ですか?
オープン語彙検出は、境界ボックスでラベル付けされたことがないものであっても、テスト時にテキストで指定されたカテゴリをローカライズできます。
これらのモデルは検出された領域をどのように分類するのでしょうか?
これらは領域をビジョン言語埋め込み空間に投影し、各領域を最も近いテキスト ラベル埋め込みと照合します。
オープン語彙の検出を最も可能にする事前トレーニング リソースは何ですか?
大量の画像テキスト データ (CLIP スタイル モデルで使用されるもの) は、テキストを新しいカテゴリに一般化できる共有埋め込みスペースを構築します。
クローズドセット検出器と比較してどのコンポーネントが置き換えられますか?
固定クラス重みベクトルの代わりに、テキスト埋め込みとの類似性を使用して分類が行われるため、テスト時に新しいラベル文字列を追加できます。
オープンボキャブラリーまたはグラウンディング検出モデルの例は次のうちどれですか?
グラウンディング DINO は、GLIP、OWL-ViT、ViLD、および Detic とともに、オープンボキャブラリーまたはグラウンディング検出器としてよく知られています。