Faster R-CNNは、Deep learningとComputer visionの分野における物体検出アーキテクチャであり、領域提案の生成と物体分類を単一の学習可能なNeural networkに統合するものである。これは2015年にShaoqing Ren、Kaiming He、Ross Girshick、Jian Sunによって導入され、それ以前のR-CNNおよびFast R-CNNモデルを基盤としている。主要な革新は、検出器と全画像の畳み込み特徴を共有する領域提案ネットワーク(RPN)であり、候補領域を生成する計算コストを大幅に削減する。この設計により、高い検出精度を維持しながらほぼリアルタイムの推論速度を実現し、現代の物体検出システムの基礎となるモデルとして確立された。
Faster R-CNNは二段階検出器として動作する。第一段階ではRPNを使用して一連の矩形物体領域を提案する。第二段階の検出ネットワークは、これらの領域を特定の物体カテゴリに分類し、バウンディングボックスを精緻化する。この分離は、YOLOやSSDなどの一段階検出器とは対照的であり、それらは特徴グリッドから直接バウンディングボックスとクラス確率を回帰する。二段階アプローチは通常、特に小さな物体や遮蔽された物体に対して優れた位置特定精度をもたらし、Faster R-CNNはMachine learning研究における標準的なベンチマークとなっている。
アーキテクチャ
このアーキテクチャは、バックボーン畳み込みネットワーク、RPN、および関心領域(RoI)分類器の3つの主要コンポーネントで構成される。バックボーンは、多くの場合VGG-16やResNetなどの事前学習済みネットワークであり、入力画像から特徴マップを抽出する。RPNはこれらの特徴マップ上で動作し、小さなスライディングウィンドウを使用して、複数のスケールとアスペクト比にわたる一連のアンカーボックスに対する物体性スコアとボックス回帰オフセットを予測する。アンカーにより、ネットワークはマルチスケール画像ピラミッドなしで様々な形状の物体を処理できる。得られた提案はRoIプーリングを使用して固定サイズにプールされ、分類器を通過してクラス確率と精緻化されたバウンディングボックスが出力される。
トレーニング
トレーニングは、RPNと検出器の両方の分類損失と回帰損失を組み合わせたマルチタスク損失関数を使用してエンドツーエンドで実行される。元の実装では交互最適化スケジュールを使用していたが、後のバージョンでは全層を通じたバックプロパゲーションによるジョイントトレーニングを採用した。RPNはアンカーが物体を含むかどうかを示すバイナリラベルでトレーニングされ、検出器は細かいクラスラベルを使用する。多数のアンカーボックスを処理するために、トレーニング中にバランスの取れたバッチを選択するサンプリング戦略が採用される。この統合トレーニングアプローチは、Selective Searchなどの領域提案アルゴリズムの個別トレーニングを必要とした初期のR-CNN手法からの大きな逸脱である。
性能と影響
PASCAL VOC 2007および2012ベンチマークでは、Faster R-CNNはそれぞれ73.2%および70.4%のmAPスコアを達成し、GPU上で毎秒5フレームで動作した。これは、画像あたり数秒を要したFast R-CNNからの大幅な改善であった。RPNの導入により、外部領域提案手法のボトルネックが排除され、検出パイプライン全体がエンドツーエンドで学習可能になった。この研究は、インスタンスセグメンテーション用のMask R-CNNや様々な領域ベースのフレームワークなど、その後のモデルに影響を与えた。その原理は、WaymoやTeslaなどの企業における自動運転認識スタックを含む商用システムで広く採用されている。
変種と拡張
Faster R-CNNの特定の側面を改善するために、多数の拡張が提案されている。特徴ピラミッドネットワーク(FPN)は、マルチスケール特徴マップを統合して小さな物体の検出を強化する。Cascade R-CNNは、増加するIoU閾値を持つ一連の検出器を使用して提案を反復的に精緻化する。他の研究では、Arm Holdingsベースのエッジデバイスなど、モバイル展開用の軽量バックボーンを探求している。Generative AIの文脈では、Faster R-CNNは視覚言語モデルのコンポーネントとしても使用されているが、大規模システムではトランスフォーマーベースの検出器が好まれることが多い。効率化のための研究は続いており、IntelやQualcommなどのハードウェアベンダーによって量子化やプルーニング技術が適用されている。
関連手法
Faster R-CNNは、R-CNNやFast R-CNNも含む領域ベースの畳み込みネットワークのより広いファミリーに属する。これは、より高速だが通常は精度が低いYOLOやSSDなどの一段階検出器としばしば比較される。RetinaNetなどのその後のハイブリッドアーキテクチャは、焦点損失でこのギャップを埋めようと試みている。現代の深層学習環境では、Transformer (architecture)アーキテクチャを使用した注意ベースの検出器が台頭しているが、Faster R-CNNは広く使用されるベースラインであり、アンサンブル手法の一般的なコンポーネントであり続けている。