Faster R-CNNは、2015年6月に導入された物体検出および位置特定のための深層学習モデルであり、R-CNNファミリーの進化形である。これは、外部の選択的探索を必要とせずに、ニューラルネットワークアーキテクチャ内で直接領域提案を生成し、エンドツーエンドのトレーニングを可能にする。この設計により、速度と精度の両方が大幅に向上し、コンピュータビジョンにおける基礎的な手法となっている。
Ross GirshickやKaiming Heなどの研究者によって開発されたR-CNNファミリーは、画像内の物体を識別し、バウンディングボックスとクラスラベルを生成するタスクに対処する。Faster R-CNNは、その前身であるR-CNN(2013年11月)とFast R-CNN(2015年4月)を基盤とし、提案ステップをネットワークに統合することで、計算オーバーヘッドを削減し、リアルタイム性能を向上させる重要な革新を実現した。
アーキテクチャ
Faster R-CNNは、主に2つのコンポーネントで構成される。入力画像から特徴マップを抽出する畳み込みバックボーン(例:VGGやResNet)と、これらの特徴マップ上で動作して候補物体領域を生成する領域提案ネットワーク(RPN)である。RPNは、さまざまなスケールとアスペクト比のアンカーボックスセットを使用して、物体らしさスコアとバウンディングボックス調整を予測する。提案された領域は、その後、ROIプーリングと全結合層を含む検出ヘッドによって処理され、分類とバウンディングボックス回帰が行われる。
領域の関心領域を生成するために選択的探索(階層的グループ化アルゴリズム)に依存していた初期バージョンとは異なり、Faster R-CNNは特徴マップから直接領域を提案することを学習し、パイプライン全体を微分可能でエンドツーエンドでトレーニング可能にしている。
R-CNNの進化
R-CNNファミリーは、それぞれが前身の限界に対処しながら、いくつかのバージョンを経て進化してきた。
- R-CNN(2013年11月):選択的探索を使用して最大2000個の候補領域を生成し、各領域に対してCNNを個別に実行した。冗長な計算のため、計算コストが高かった。
- Fast R-CNN(2015年4月):画像全体に対してCNNを1回実行し、ROIプーリングを導入して各領域の特徴を抽出することで、速度を大幅に向上させた。依然として提案には選択的探索に依存していた。
- Faster R-CNN(2015年6月):選択的探索を学習された領域提案ネットワークに置き換え、システムを完全にニューラル化し、高速化した。
- Mask R-CNN(2017年3月):Faster R-CNNをインスタンスセグメンテーションに拡張し、ピクセル単位のマスク用のブランチを追加し、ROIプーリングをROIAlignに置き換えて、小数ピクセルの位置合わせを処理した。
- Cascade R-CNN(2017年12月):交わり結合(IoU)しきい値を段階的に増加させてトレーニングし、位置特定精度を向上させた。
- Mesh R-CNN(2019年6月):2D画像から3Dメッシュを生成する機能を追加した。
これらの開発により、R-CNNの適用範囲は、ドローンカメラからの物体追跡、テキスト位置特定、Google Lensなどの製品への統合といったタスクに拡大された。
トレーニングとパフォーマンス
Faster R-CNNは、分類損失(例:クロスエントロピー)とバウンディングボックス調整のための回帰損失(例:平滑L1)を組み合わせたマルチタスク損失を使用してトレーニングされる。RPNと検出ヘッドは、交互最適化または統合損失を用いたエンドツーエンドのトレーニングによって、共同でトレーニングできる。このモデルは、ImageNetなどの大規模データセットで事前トレーニングされたバックボーンの恩恵を受け、その後、COCOやPASCAL VOCなどのターゲットデータセットで微調整される。
パフォーマンスの面では、Faster R-CNNはベンチマークデータセットで最先端の結果を達成し、前身よりも大幅な速度向上を実現している。例えば、PASCAL VOC 2007では、GPU上で毎秒5フレームで動作しながら、平均適合率(mAP)約73.2%に達し、Fast R-CNNを大幅に上回った。
応用と影響
Faster R-CNNは物体検出の基礎となり、その後の多くのアーキテクチャに影響を与えている。その領域提案メカニズムは、自動運転(例:WaymoやTesla)、医用画像、ロボティクスなど、さまざまな分野で採用されている。このモデルのリアルタイム物体検出能力により、ビデオ監視、拡張現実、画像検索などのアプリケーションが可能になった。
さらに、R-CNNファミリーは、インスタンスセグメンテーション(Mask R-CNN)や3D再構成(Mesh R-CNN)などの他のタスクにも拡張されている。Mask R-CNNは、ニューラルネットワークトレーニングを高速化する競技会であるMLPerfトレーニングベンチマークの7つのタスクの1つでもあり、その実用的な重要性が強調されている。