英語からの翻訳

R-CNNは、物体検出と位置特定のための深層学習モデルのファミリーであり、領域提案と畳み込みニューラルネットワークを用いて画像内の物体を識別する。

領域ベース畳み込みニューラルネットワーク(R-CNN)は、コンピュータビジョン、特に物体検出と位置特定のための機械学習モデルの一群である。R-CNNの当初の目標は、入力画像を受け取り、各境界ボックスが物体とそのカテゴリ(例:車や歩行者)を含む境界ボックスの集合を出力として生成することであった。一般に、R-CNNアーキテクチャは、CNNによって出力された特徴マップ上で選択的探索を実行する。

R-CNNは、ドローン搭載カメラからの物体追跡、画像内のテキスト位置特定、Googleレンズでの物体検出の有効化など、他のコンピュータビジョンタスクを実行するように拡張されている。Mask R-CNNはまた、ニューラルネットワークのトレーニングを高速化する競争であるMLPerfトレーニングベンチマークの7つのタスクの1つでもある。

歴史

R-CNNの開発には、いくつかの重要なバージョンがある。元のR-CNNは2013年11月に導入され、その後、2015年4月にFast R-CNN、2015年6月にFaster R-CNNが続いた。Mask R-CNNは2017年3月に登場し、フレームワークをインスタンスセグメンテーションに拡張した。2017年12月にはCascade R-CNNが提案され、交差結合(IoU、ジャッカード指数とも呼ばれる)の閾値を増加させながらトレーニングし、各段階で近くの誤検出に対してより選択的になるようにした。2019年6月には、Mesh R-CNNが2D画像から3Dメッシュを生成する機能を追加した。

アーキテクチャ

R-CNNファミリーは、領域提案と畳み込み特徴抽出に基づく共通のアーキテクチャを共有している。中核となるアイデアは、候補物体領域を生成し、CNNを使用して特徴を抽出し、各領域を分類することである。

選択的探索

画像(または画像のような特徴マップ)が与えられると、選択的探索(階層的グループ化とも呼ばれる)は、まずFelzenszwalbとHuttenlocher(2004)のアルゴリズムを使用して画像をセグメント化する。次に、色、テクスチャ、サイズ、形状の互換性に基づいて類似した隣接領域を反復的にマージし、物体位置の仮説の集合を生成する。アルゴリズムは次のように進行する:

  1. 画像を初期領域R = {r1, ..., rn}にセグメント化する。
  2. 類似度集合S = ∅を初期化する。
  3. 各隣接領域ペア(ri, rj)について、類似度s(ri, rj)を計算し、Sに追加する。
  4. Sが空でない間:
    • 最高類似度s(ri, rj)= max(S)を取得する。
    • 対応する領域rt = ri ∪ rjをマージする。
    • riとrjを含む類似度をSから削除する。
    • rtとその隣接領域との類似度を計算し、Sに追加する。
    • rtをRに追加する。
  5. R内のすべての領域から物体位置ボックスLを抽出する。

R-CNN

元のR-CNNでは、予測は2段階のプロセスに従う。前処理の選択的探索ステップが、関心領域(ROI)として知られる多数の候補物体(通常最大2000個)を生成する。これらはCNNに転送され、各ROIに対して独立に物体クラススコアと境界ボックス推定を予測する。重要なことに、ROIは過剰な候補を除去するために大幅にフィルタリングされる。フィルタリングは、他のカテゴリとともにCNNによってスコアリングされる専門カテゴリである背景カテゴリに割り当てられたROIを除去することから始まる。残りのROIは、同じ物体をカバーする複数のROIがすべて非背景カテゴリに割り当てられるため、重複が多くなる問題がしばしば発生する。これは、ヒューリスティックな非最大抑制(NMS)ステップによって解決される。

Fast R-CNN

元のR-CNNが最大2000の関心領域のそれぞれに対してニューラルネットワーク特徴を独立に計算したのに対し、Fast R-CNNはニューラルネットワークを画像全体に対して一度だけ実行する。ネットワークの終端にはROIPoolingモジュールがあり、ネットワークの出力テンソルから各ROIを切り出し、再形成して分類する。元のR-CNNと同様に、Fast R-CNNは領域提案を生成するために選択的探索を使用する。

Faster R-CNN

Faster R-CNNはROI生成をニューラルネットワーク自体に統合し、外部の選択的探索の必要性を排除する。これにより、モデルは完全にエンドツーエンドでトレーニング可能になり、大幅に高速化される。

Mask R-CNN

以前のバージョンが物体検出に焦点を当てていたのに対し、Mask R-CNNはインスタンスセグメンテーションを追加し、検出された各物体に対してセグメンテーションマスクを生成する。Mask R-CNNはまた、ROIPoolingをROIAlignと呼ばれる新しい方法に置き換え、ピクセルの小数部分を表現できるようにし、位置特定精度を向上させた。

応用と影響

R-CNNモデルは、自動運転、監視、画像検索などのコンピュータビジョンアプリケーションで広く採用されている。このアーキテクチャはその後の物体検出モデルに影響を与え、視覚のための深層学習における基礎的な概念であり続けている。MLPerfベンチマークには、トレーニング性能を評価するための標準タスクとしてMask R-CNNが含まれており、その実用的な重要性を強調している。

関連項目

参考文献

  • Girshick, R., Donahue, J., Darrell, T., & Malik, J. (2014). Rich feature hierarchies for accurate object detection and semantic segmentation. CVPR.
  • Girshick, R. (2015). Fast R-CNN. ICCV.
  • Ren, S., He, K., Girshick, R., & Sun, J. (2015). Faster R-CNN: Towards real-time object detection with region proposal networks. NeurIPS.
  • He, K., Gkioxari, G., Dollár, P., & Girshick, R. (2017). Mask R-CNN. ICCV.

参考文献

  • Parthasarathy, Dhruv (2017-04-27). "A Brief History of CNNs in Image Segmentation: From R-CNN to Mask R-CNN". Medium. Retrieved 2024-09-11.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·object-detection·deep-learning·convolutional-neural-network
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴