Fast R-CNNは、物体検出モデルであり、その前身であるR-CNN(領域ベースの畳み込みニューラルネットワーク)の速度と精度を大幅に向上させたモデルである。Microsoft ResearchのRoss Girshickによって開発され、2015年に発表された。このモデルは、深層畳み込みニューラルネットワークを用いて画像内の物体を識別するという概念に基づいている。Fast R-CNNの主な革新点は、画像全体を単一の畳み込みネットワークで処理し、その後、提案された各領域の特徴を抽出することで、以前の方法を悩ませていた冗長な計算を回避できる点にある。
R-CNNが数千もの領域提案ごとに個別の畳み込みネットワークのパスを実行していたのに対し、Fast R-CNNは画像内のすべての領域で畳み込み計算を共有する。これは、まず画像全体を畳み込みネットワークに通して特徴マップを生成し、その後、各領域提案に対して、興味領域(RoI)プーリング層が特徴マップから固定サイズの特徴ベクトルを抽出することで実現される。この設計により、トレーニング時間と推論時間の両方が劇的に短縮され、実世界のアプリケーションで実用的なものとなった。
アーキテクチャとRoIプーリング
Fast R-CNNの核となるアーキテクチャ上の構成要素は、RoIプーリング層である。この層は、畳み込みネットワークによって生成された特徴マップと、一連の領域提案(通常、選択的検索などの外部アルゴリズムによって生成される)を受け取る。各提案について、特徴マップの対応する領域を固定グリッド(例:7x7)に分割し、各グリッドセル内で最大プーリングを適用する。これにより、元の領域のサイズやアスペクト比に関係なく固定サイズの出力が生成され、その後の全結合層が一定の入力次元を持つことができる。
ネットワークは、特徴抽出器として機能する畳み込み層(多くの場合、VGG-16などの事前トレーニング済みモデルに基づく)、その後のRoIプーリング層、そして一連の全結合層で構成される。最終層は2つの出力に分岐する。1つは領域内の物体を分類するためのもの(物体クラスと背景クラスにわたるソフトマックス分類器を使用)、もう1つはバウンディングボックスの座標を調整するためのもの(回帰ヘッドを使用)である。
トレーニングとマルチタスク損失
Fast R-CNNは、分類損失とバウンディングボックス回帰損失を組み合わせたマルチタスク損失関数を使用して、エンドツーエンドでトレーニングされる。分類損失は通常、物体クラスに対する対数損失であり、回帰損失は、予測されたバウンディングボックスとグラウンドトゥルースの差を測定する滑らかなL1損失である。この共同トレーニングにより、ネットワークは物体認識能力と位置特定精度を同時に向上させることができる。
トレーニングは、慎重に設計されたサンプリング戦略を用いた確率的勾配降下法によって行われる。各ミニバッチ中に、少数の画像が選択され、各画像から固定数の領域提案がサンプリングされ、正例(物体を含む)と負例(背景)のバランスが確保される。このアプローチは、共有計算と組み合わせることで、分類器と回帰器を個別にトレーニングするマルチステージパイプラインを必要としたR-CNNよりも、トレーニングを大幅に高速化する。
性能と影響
PASCAL VOC 2012データセットにおいて、Fast R-CNNは平均適合率(mAP)66%を達成し、これはR-CNNの62%やSPPnetの59%と比較して大幅な改善であった。さらに重要なことに、トレーニング中はR-CNNの約9倍、テスト時には213倍高速であり、画像1枚を約0.3秒で処理した(領域提案生成を除く)。この高速化により、インタラクティブシステムや大規模アプリケーションへの物体検出モデルの導入が現実的となった。
このモデルの成功は、物体検出における計算共有とエンドツーエンドトレーニングの重要性を浮き彫りにした。また、その後の発展、特に領域提案ネットワークを導入して外部提案アルゴリズムを排除し、速度と精度をさらに向上させたFaster R-CNNへの道筋をつけた。Fast R-CNNは、Deep learningベースの物体検出分野における基礎的な参照点として今もなお重要である。
他のモデルとの関係
Fast R-CNNは、元のR-CNNから進化した物体検出モデルの系統の一部である。R-CNNとの主な違いは、特徴計算の共有とRoIプーリングの使用である。計算を共有しながらも空間ピラミッドプーリングアプローチを使用したSPPnetと比較すると、Fast R-CNNはRoIプーリング層を通じて勾配を流すことを可能にし、すべての層のエンドツーエンドの微調整を実現することで、トレーニングプロセスを簡素化した。これは重要な利点であり、SPPnetはピラミッドプーリング前の畳み込み層を微調整できなかった。
Fast R-CNNのアイデアは、Residual Network (ResNet)ベースの検出器やU-Netに触発されたセグメンテーションモデルなど、その後の多くのアーキテクチャに影響を与えたが、直接の後継はR-CNNファミリーに属する。また、マルチタスク学習の有効性を示し、この概念は現在、Artificial intelligenceシステムで広く使用されている。外部領域提案への依存は、後にFaster R-CNNによって対処され、提案生成をネットワークに統合し、パイプライン全体を完全にトレーニング可能にした。
限界と遺産
改善にもかかわらず、Fast R-CNNにはまだ限界があった。領域提案ステップ(例:選択的検索)は計算コストが高く、トレーニング不可能であり、ボトルネックを生み出していた。さらに、提案生成が別個であるため、モデルは完全にエンドツーエンドではなかった。これらの問題はFaster R-CNNで解決されたが、特徴共有とマルチタスク損失へのFast R-CNNの貢献は、現代の検出器に不可欠な要素として残っている。
Fast R-CNNは学術文献で広く引用され、新しい検出方法を比較するためのベンチマークとして機能している。その設計原則、すなわち共有畳み込み特徴、RoIプーリング、共同最適化は、現在多くの物体検出フレームワークで標準となっている。このモデルはまた、Machine learningやコンピュータビジョンのコースにおける一般的な教育例であり、アーキテクチャの選択が計算効率と精度にどのように劇的な影響を与えるかを示している。