英語からの翻訳

Mask R-CNNは、インスタンスセグメンテーションのための深層学習アーキテクチャであり、Faster R-CNNを拡張してマスクブランチを追加したものです。物体を検出すると同時に、ピクセルレベルのセグメンテーションマスクを生成します。

Mask R-CNNは、深層学習によるインスタンスセグメンテーションのためのアーキテクチャであり、物体検出とピクセルレベルのセグメンテーションを組み合わせたコンピュータビジョンタスクです。これはFaster R-CNNの物体検出フレームワークを拡張し、セグメンテーションマスクを予測するための並列ブランチを追加することで、モデルが境界ボックスで物体を位置特定しつつ、その正確なピクセル境界を描出できるようにします。Facebook AI Research(現在はMetaの一部)の研究者らによって開発されたMask R-CNNは、2017年に発表され、自動運転、医用画像、ロボティクスにおける数多くの下流アプリケーションの基盤モデルとなりました。

このアーキテクチャは、それ自体が初期の領域ベースの畳み込みニューラルネットワークから進化したFaster R-CNNを直接基盤としています。Faster R-CNNは、領域提案ネットワーク(RPN)を使用して候補物体領域を生成し、その後、領域関心(RoI)プーリング層を使用して、分類と境界ボックス回帰のための固定サイズの特徴マップを抽出します。Mask R-CNNはRoIプーリングをRoIAlignに置き換えます。これは、RoIプーリングによって導入される空間量子化誤差を排除する重要な修正です。RoIAlignは双線形補間を使用してサンプリングポイントの正確な値を計算し、正確なマスク予測に不可欠な細かい空間詳細を保持します。この変更により、マスクブランチが整列された特徴マップで動作できるようになり、セグメンテーション品質が大幅に向上します。

マスクブランチ自体は、各RoIに適用される小さな完全畳み込みネットワークであり、各クラスに対してバイナリマスクを生成します。トレーニング中、損失関数は分類損失、境界ボックス回帰損失、およびマスク予測に対する平均バイナリ交差エントロピー損失を組み合わせます。このマルチタスク学習設定により、モデルは検出とセグメンテーションを共同で最適化でき、COCOデータセットなどのベンチマークで強力なパフォーマンスを発揮します。COCO test-devでは、Mask R-CNNはリリース時にマスク平均精度35.7%、境界ボックス平均精度39.8%を達成し、以前の最先端手法を上回りました。

アーキテクチャと構成要素

Mask R-CNNは、いくつかの統合された構成要素で構成されています。バックボーンネットワーク(通常はResNetまたはResNeXt)は、入力画像から階層的な特徴マップを抽出します。特徴ピラミッドネットワーク(FPN)をバックボーンに接続して、低解像度で意味的に強い特徴と高解像度で空間的に正確な特徴を組み合わせることで、スケール間の検出を改善できます。次にRPNが候補領域を提案し、RoIAlignによって処理されて整列された特徴マップが生成されます。これらの特徴は、分類および境界ボックス回帰ヘッドとマスク予測ヘッドの2つのヘッドに供給されます。マスクヘッドは各RoIに独立して適用され、クラスごとに28x28ピクセルのマスクを出力し、最終予測のために元のRoIサイズにアップサンプリングされます。

トレーニングと推論

Mask R-CNNのトレーニングは、多段階の手順に従います。モデルは通常、バックボーン用にImageNetで事前学習された重みで初期化されます。トレーニング中、正のRoI(グラウンドトゥルースボックスとの交差オーバーユニオンが高いもの)がマスク損失計算のためにサンプリングされます。マスクブランチは正のRoIのみでトレーニングされ、分類および回帰ヘッドは正と負の両方のサンプルを使用します。全体の損失は個々の損失の合計であり、デフォルトでは等しい重み付けがされます。推論では、RPNの実行、RoIAlignの適用、そして予測マスクを0.5で閾値処理してバイナリセグメンテーションを生成します。非最大抑制が境界ボックス予測に適用され、重複検出を除去します。

影響と応用

Mask R-CNNはコンピュータビジョンの分野に大きな影響を与えました。これはインスタンスセグメンテーションのためのシンプルで柔軟かつ正確なフレームワークを提供し、その後の研究の標準的なベースラインとなりました。その設計は、Cascade Mask R-CNNやトランスフォーマーと畳み込みバックボーンを組み合わせたハイブリッドアプローチなどの後のモデルに影響を与えました。実際には、Mask R-CNNは腫瘍セグメンテーションのための医用画像解析、歩行者や車両を識別するための自動運転知覚、植物を数えるための農業モニタリングに応用されています。このアーキテクチャはまた、生成AIパイプラインのコンポーネントとしても機能し、正確な物体マスクが制御された画像編集と生成を可能にします。

制限と拡張

その成功にもかかわらず、Mask R-CNNには既知の制限があります。これは計算集約的であり、トレーニングと推論にかなりのGPUリソースを必要とするため、リアルタイムアプリケーションには障壁となる可能性があります。このモデルはまた、重度に遮蔽された物体や小さなインスタンスに苦労し、マスク予測がノイズを含むことがあります。拡張はこれらの問題に対処しています:Mask Scoring R-CNNはマスク品質を改善するためにマスクIoU予測ヘッドを追加し、PointRendは反復的なポイントベースのアプローチを使用してマスクエッジを精緻化します。トランスフォーマーデコーダーに基づくものなど、より最近のアーキテクチャは一部のベンチマークでMask R-CNNを上回っていますが、このモデルはその成熟度と事前学習済み重みおよびライブラリの広範なエコシステムにより、広く使用され続けています。

他の手法との関係

Mask R-CNNは、R-CNNやFast R-CNNなどの初期モデルも含む、コンピュータビジョンにおける領域ベースの手法のより広いファミリーに属します。これは、速度を精度よりも優先するYOLOやSSDなどのシングルステージ検出器とは対照的です。人工知能機械学習の文脈では、Mask R-CNNは、単一のニューラルネットワークが複数の関連出力を処理するマルチタスク学習への傾向を例示しています。その開発は、大規模言語モデル研究の進歩と並行して、2010年代半ばの深層学習の進歩の波の一部でしたが、2つの分野は応用において分岐しました。コードと事前学習済みモデルはオープンソースライセンスでリリースされ、学界と産業界の両方での採用を加速させ、Amazon Web ServicesGoogle Cloudなどの企業がそのようなモデルを実行するためのマネージドサービスを提供しています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·instance-segmentation·deep-learning·object-detection
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴