英語からの翻訳

Mask R-CNNは、インスタンスセグメンテーションのための深層学習モデルであり、Faster R-CNNを拡張して、バウンディングボックスとクラスラベルに加えて、ピクセルレベルのセグメンテーションマスクを予測するマスクブランチを追加したものです。

Mask R-CNNは、画像内の各オブジェクトインスタンスをピクセルレベルで識別し輪郭を描くコンピュータビジョンタスクであるインスタンスセグメンテーションのために設計された深層学習モデルである。これは、Faster R-CNNオブジェクト検出フレームワークを拡張し、セグメンテーションマスクを予測する並列ブランチを追加することで、オブジェクト検出と精密な空間的位置特定を同時に可能にする。2017年にFacebook AI Research(現在はMetaの一部)の研究者らによって発表され、COCOデータセットで最先端の結果を達成し、その後の多くのセグメンテーションモデルの基盤となるアーキテクチャとなった。

セマンティックセグメンテーションが個々のオブジェクトを区別せずにすべてのピクセルをカテゴリに分類するのに対し、インスタンスセグメンテーションでは、同じクラスの重なり合うオブジェクトや隣接するオブジェクトを分離する必要がある。Mask R-CNNは、領域提案ネットワーク(RPN)とマスク予測ヘッドを組み合わせることでこれを解決する。RPNは候補となるオブジェクトのバウンディングボックスを生成し、マスクブランチはRoIAlignと呼ばれる手法を用いて空間的整合性を保ちながら、各関心領域(RoI)に対してバイナリマスクを出力する。

アーキテクチャ

このアーキテクチャは、ニューラルネットワーク系のオブジェクト検出器を拡張したFaster R-CNNに基づいている。Faster R-CNNは、畳み込みバックボーン(ResNetなど)を使用して特徴マップを抽出し、RPNで領域を提案し、分類器でオブジェクトのクラスを予測してバウンディングボックスを調整する。Mask R-CNNは、分類およびボックス回帰ヘッドと並行して動作する3番目のブランチを追加する。このマスクブランチは完全畳み込みネットワークであり、各RoIに対してバイナリマスクを予測する。通常は28×28ピクセルの解像度で、その後元の画像サイズにアップサンプリングされる。

重要な革新はRoIAlignであり、Faster R-CNNで使用されていたRoIPool操作を置き換える。RoIPoolはRoIの境界を量子化するため、抽出された特徴と元の画像との間に位置ずれが生じる。RoIAlignはバイリニア補間を使用して量子化を回避し、精密な空間情報を保持する。この改善は、わずかな位置ずれでもセグメンテーション品質を低下させるため、ピクセル精度のマスク予測にとって重要である。

トレーニングと損失

このモデルは、分類損失(クロスエントロピー)、バウンディングボックス回帰損失(スムーズL1)、マスク損失(ピクセルごとのバイナリクロスエントロピー)の3つの要素を組み合わせたマルチタスク損失関数を用いてエンドツーエンドでトレーニングされる。マスクブランチは正のRoI(オブジェクトを含むもの)のみでトレーニングされ、各RoIは特定のグラウンドトゥルースクラスに割り当てられるため、マスク予測はクラス固有となる。推論時には、マスクブランチが検出された各オブジェクトに対して実行され、最終出力にはクラスラベル、バウンディングボックス、マスクが含まれる。

トレーニングは通常、ImageNetで事前トレーニングされた重みで初期化し、モメンタム付き確率的勾配降下法を使用する。COCOデータセットでは、Mask R-CNNはResNet-101バックボーンでマスク平均精度(AP)35.7%を達成し、より複雑な後処理に依存していたFCISやMask R-CNNの前身などの従来手法を上回った。また、Cityscapesや医療画像におけるインスタンスレベルのセグメンテーションタスクなど、他のベンチマークでも優れた性能を示した。

応用

インスタンスセグメンテーションは、さまざまな分野で幅広く応用されている。自動運転では、Mask R-CNNは歩行者、車両、道路障害物を識別して分離するのに役立ち、WaymoTesla Autopilotなどの企業の認識システムを改善する。医療画像では、スキャンから腫瘍、細胞、臓器をセグメンテーションし、診断や手術計画を支援する。ロボティクスでは、ピクセルレベルのオブジェクト境界を提供することで精密なオブジェクト操作を可能にする。その他の用途には、衛星画像解析、農業モニタリング、拡張現実があり、正確なオブジェクト輪郭がシーン理解を向上させる。

このモデルの柔軟性は、時間的一貫性が追加されるビデオインスタンスセグメンテーションや、インスタンスセグメンテーションとセマンティックセグメンテーションを統合した出力に組み合わせるパノプティックセグメンテーションにも及ぶ。特徴ピラミッドネットワーク(FPN)を備えたMask R-CNNなどの変種は小物体の精度を向上させ、MobileNetなどの軽量バックボーンはエッジデバイスへの展開を可能にする。

影響と遺産

Mask R-CNNはインスタンスセグメンテーションの新たな標準を確立し、Cascade Mask R-CNN、Hybrid Task Cascade、TransformerベースのDETRやMask2Formerなどの後続アーキテクチャに影響を与えた。Meta AIが2019年にリリースしたDetectron2フレームワークでのオープンソース実装は、研究と産業での採用を加速させた。このモデルの設計原則、すなわちマルチタスク学習、RoIAlign、並列予測ヘッドは、キーポイント検出やパノプティックセグメンテーションなど、他のビジョンタスクでも広く再利用されている。

エンドツーエンドのTransformerモデルの台頭にもかかわらず、Mask R-CNNはその効率性と精度により堅牢なベースラインであり続けている。2024年時点でも、計算リソースが限られている本番システムで使用されており、その概念は標準的なコンピュータビジョンコースで教えられている。Kaiming He、Georgia Gkioxari、Piotr Dollár、Ross Girshickによる論文「Mask R-CNN」は、ICCV 2017で発表され、数千回引用されており、この分野への永続的な影響を反映している。

制限

Mask R-CNNには既知の制限がある。2段階アーキテクチャのため、より単純な検出器よりも遅く、ハードウェアアクセラレーションなしではリアルタイムアプリケーションが困難である。マスク解像度は28×28に固定されており、大きなオブジェクトの細かい詳細が失われる可能性がある。また、RPNが提案を統合する可能性があるため、高度に重なり合うインスタンスでは苦戦する。トレーニングには、ピクセルレベルのマスクを備えた大規模な注釈付きデータセットが必要であり、その作成にはコストがかかる。さらに、このモデルはドメインシフトに敏感であり、トレーニング分布外の画像では性能が低下する。これは機械学習システムに共通する問題である。

研究では、高解像度マスクやアテンションメカニズムの使用など、これらの問題の一部に対処してきたが、速度と精度のトレードオフは依然として存在する。多くの実用的なシナリオでは、Mask R-CNNは精度と中程度の計算コストのバランスをとった信頼性の高い選択肢であり続けている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·instance-segmentation·deep-learning·object-detection
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴