地域ベースの CNN
領域ベースの CNN (R-CNN) は、最初に画像内の候補領域を提案し、次に CNN を使用して各オブジェクトを分類し、正確にボックス化するオブジェクト検出器のファミリーです。
概要
They turned image classification into full object detection, locating and labeling many objects at once.
ディープダイブ
画像分類は、「この写真には何が写っているのか?」という質問に答えます。しかし、検出では「どこで、いくつ?」にも答える必要があります。オリジナルの R-CNN (2014) は、外部アルゴリズム (選択的検索) を使用して約 2,000 の領域を提案し、それぞれを固定サイズにワープし、すべての領域に対して CNN を実行しました。これは正確でしたが、非常に遅かったです。 Fast R-CNN は、画像全体に対して CNN を 1 回実行し、領域ごとに特徴をプールする (RoI プーリング) ことで、これを高速化しました。その後、より高速な R-CNN によって選択検索が学習された領域提案ネットワーク (RPN) に置き換えられ、パイプライン全体がエンドツーエンドでほぼリアルタイムになりました。マスク R-CNN は、検出されたオブジェクトごとにピクセル レベルのマスクを出力するようにそれをさらに拡張しました。
技術的な洞察
重要な効率の飛躍は RoI プーリングです。提案されたすべてのボックスで CNN を再実行するのではなく、ネットワークが画像の 1 つの共有特徴マップを計算し、各関心領域内の特徴を固定グリッドに切り取ってサイズ変更します。より高速な R-CNN の RPN は、その特徴マップ上をスライドして、さまざまなサイズとアスペクト比のプリセット アンカー ボックスの「オブジェクトネス」スコアとボックス調整を予測し、ほぼ無料で提案を生成します。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
地域ベースの CNN の将来
2 段階の R-CNN 検出器は、精度が最も重要な場合には引き続き強力ですが、手動で設計されたアンカーや提案を完全に省略する 1 段階の検出器 (YOLO、SSD) や DETR のようなトランスフォーマーベースの検出器は、速度とシンプルさの点で人気が高まっています。トレンドは、エンドツーエンド、アンカーフリー、クエリベースの検出に向かっています。それでも、R-CNN 系統の中核となるアイデア、共有機能、領域レベルの推論は、セグメンテーション、ビデオ、および 3D 検出システムに影響を与え続けています。
現実世界の実装
在庫管理のために小売店の棚にある商品を検出して数えます
Mask R-CNN を使用した医療スキャンにおける細胞または臓器のインスタンス セグメンテーション
工場の生産ライン上の欠陥とその位置を特定する
自動運転カメラのフィードで複数の車両と歩行者の位置を特定する
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Region-Based CNNs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
スコアベースの生成モデル
よくある質問
What is Region-Based CNNs?
領域ベースの CNN (R-CNN) は、最初に画像内の候補領域を提案し、次に CNN を使用して各オブジェクトを分類し、正確にボックス化するオブジェクト検出器のファミリーです。彼らは画像分類を完全な物体検出に変え、一度に多くの物体の位置を特定してラベルを付けました。
地域ベースの CNN の中心となるアイデアは何ですか?
R-CNN は、オブジェクトが含まれる可能性のある領域を提案し、CNN を実行して各領域を分類し、その境界ボックスを調整します。
元の R-CNN (2014) はなぜ遅かったのですか?
オリジナルの R-CNN は、画像ごとに約 2,000 の領域提案に基づいて CNN を独立して実行していましたが、これは非常に計算コストがかかりました。
Faster R-CNN は選択的検索に代わるものとして何を導入しましたか?
より高速な R-CNN では、学習された領域提案ネットワークが導入され、提案生成がトレーニング可能なネットワークの一部となり、はるかに高速になりました。
RoI プーリングは何を実現しますか?
RoI プーリングは、領域ごとに単一の共有特徴マップから固定サイズの特徴グリッドを抽出し、再計算を回避し、検出を高速化します。
Mask R-CNN はどのような追加機能を追加しますか?
マスク R-CNN は、各オブジェクトの正確なピクセル レベルのマスクを予測することで Faster R-CNN を拡張し、インスタンスのセグメンテーションを可能にします。