Feature Pyramid Network(FPN)は、物体検出やその他のコンピュータビジョンタスク向けに多スケールの特徴マップを抽出するために設計されたニューラルネットワークアーキテクチャです。Tsung-Yi Lin、Piotr Dollár、Ross Girshick、Kaiming He、Bharath Hariharan、Serge Belongieによって2017年の論文「Feature Pyramid Networks for Object Detection」で紹介され、FPNは各レベルで豊かな意味情報を持つ特徴マップのピラミッドを構築することで、様々なスケールの物体を検出する課題に対処しています。これはFaster R-CNNやMask R-CNNなど多くの現代的な検出器の基盤となる構成要素となり、Machine learningやDeep learningアプリケーションで広く使用されています。
FPNの中核的なアイデアは、畳み込みNeural network(通常はResNetなどのバックボーン)の固有の多スケールで階層的な特徴表現を活用し、高レベルのセマンティック特徴を低解像度に伝播するトップダウンパスでそれを強化することです。これは、ボトムアップパスから対応する特徴マップをマージする横方向接続を通じて達成され、ネットワークが各スケールで強い特徴を生成できるようにします。その結果、FPNは特に小さな物体の検出性能を向上させ、計算コストを大幅に増加させません。
アーキテクチャ
FPNは、ボトムアップパスとトップダウンパスの2つの主要なパスで構成されています。ボトムアップパスは標準のフィードフォワード畳み込みネットワーク(例:ResNet)で、入力画像に対して通常4、8、16、32ピクセルのストライドで複数のスケールの特徴マップを計算します。これらの特徴マップは、各ステージの最後の残差ブロック出力に対応し、C2、C3、C4、C5と表されます。
トップダウンパスは、空間的に粗いがセマンティックに強い高層特徴をアップサンプリングして高解像度の特徴マップを生成します。各アップサンプリングされた特徴マップは、チャネル次元を減らすための1x1畳み込み層を介して、対応するボトムアプ特徴マップと要素単位加算でマージされます。マージされた結果は3x3畳み込みを通過して、P2、P3、P4、P5と表される最終的な特徴マップを生成します。これらの特徴マップは物体検出に使用され、各レベルが特定のサイズ範囲の物体を検出する役割を担います。
応用
FPNは物体検出フレームワークで広く採用されています。Faster R-CNNでは、FPNがリージョンプロポーザルネットワーク(RPN)とその後のROIベースの分類器の特徴抽出器として使用され、モデルが様々なサイズの物体を効果的に処理できるようにします。Mask R-CNNは、FPNをインスタンスセグメンテーションに拡張し、多スケールの特徴をマスク生成に利用します。FPNはまた、多スケールのコンテキストが重要であるセマンティックセグメンテーションやキーポイント検出など他のタスクにも利益をもたらします。
検出以外にも、FPNは類似のアーキテクチャを他の領域に刺激し、例えば生物医学画像セグメンテーションのU-Netなど、スキップ接続を持つ対称なエンコーダ-デコーダを採用しています。ただし、FPNの側方向接続とトップダウン融合の特定の設計は、検出タスクに特に効果的であることが証明されています。
バリエーションと改善
FPNの効率と精度を向上させるために、いくつかのバリアントが提案されています。例えば、EfficientDetで使用されるBiFPNは、重み付き双方向特徴融合を導入し、ネットワークが異なる入力特徴の重要度を学習できるようにします。別のバリアントであるPANetは、情報パスを短縮するために、追加のボトムアップパス拡張を追加します。これらの改善により、COCOなどのベンチマークでの物体検出の最先端を推進しています。
影響と遺産
FPNはコンピュータビジョンの分野に永続的な影響を与えています。その導入により、単一スケールの特徴から多スケール特徴ピラミッドへのパラダイムが見られ、これは現在の検出アーキテクチャで標準的な慣行となっています。この論文は数千回引用され、Residual Network (ResNet)設計や特徴融合のその後の研究にも影響を与えています。FPNの原則は、トレーニング中のスケール変動をシミュレートするData Augmentation戦略など、他の領域にも適用されています。
要約すると、Feature Pyramid Networkは堅牢な多スケール物体検出を可能にする重要なアーキテクチャ上の革新であり、その影響は多くの現代のビジョンシステムに広がっています。