Aus dem Englischen übersetzt

Mask R-CNN ist eine Deep-Learning-Architektur für die Instanzsegmentierung, die Faster R-CNN erweitert, indem sie einen Maskenzweig hinzufügt. Sie erkennt Objekte und erzeugt gleichzeitig pixelgenaue Segmentierungsmasken.

Mask R-CNN ist eine Deep-Learning-Architektur für die Instanzsegmentierung, eine Aufgabe der Computer Vision, die Objekterkennung mit Pixel-genauer Segmentierung kombiniert. Sie erweitert das Faster-R-CNN-Objekt Erkennungsframework um einen parallelen Zweig zur Vorhersage von Segmentierungsmasken, wodurch das Modell Objekte sowohl mit Begrenzungsrahmen lokalisieren als auch ihre exakten Pixelgrenzen abgrenzen kann. Entwickelt von Forschern bei Facebook AI Research (jetzt Teil von Meta), wurde Mask R-CNN 2017 eingeführt und wurde zu einem grundlegenden Modell für zahlreiche nachgelagerte Anwendungen im autonomen Fahren, in der medizinischen Bildgebung und in der Robotik.

Die Architektur baut direkt auf Faster R-CNN auf, das selbst aus früheren regionenbasierten Convolutional Neural Networks hervorging. Faster R-CNN verwendet ein Region Proposal Network (RPN), um Kandidatenobjektregionen zu generieren, gefolgt von einer Region-of-Interest (RoI)-Pooling-Schicht, um Merkmalskarten fester Größe für Klassifikation und Begrenzungsrahmen-Regression zu extrahieren. Mask R-CNN ersetzt RoI-Pooling durch RoIAlign, eine entscheidende Modifikation, die die räumlichen Quantisierungsfehler beseitigt, die durch RoI-Pooling eingeführt werden. RoIAlign verwendet bilineare Interpolation, um exakte Werte an abgetasteten Punkten zu berechnen, wodurch feine räumliche Details erhalten bleiben, die für eine genaue Maskenvorhersage wesentlich sind. Diese Änderung ermöglicht es dem Maskenzweig, auf ausgerichteten Merkmalskarten zu arbeiten, was die Segmentierungsqualität erheblich verbessert.

Der Maskenzweig selbst ist ein kleines vollständig convolutionales Netzwerk, das auf jedes RoI angewendet wird und eine binäre Maske für jede Klasse erzeugt. Während des Trainings kombiniert die Verlustfunktion den Klassifikationsverlust, den Begrenzungsrahmen-Regressionsverlust und den durchschnittlichen binären Kreuzentropieverlust über die Maskenvorhersagen. Dieses Multi-Task-Learning-Setup ermöglicht es dem Modell, Erkennung und Segmentierung gemeinsam zu optimieren, was zu einer starken Leistung auf Benchmarks wie dem COCO-Datensatz führt. Auf COCO test-dev erreichte Mask R-CNN zum Zeitpunkt seiner Veröffentlichung eine durchschnittliche Maskenpräzision von 35,7 % und eine durchschnittliche Begrenzungsrahmenpräzision von 39,8 %, womit es frühere State-of-the-Art-Methoden übertraf.

Architektur und Komponenten

Mask R-CNN besteht aus mehreren integrierten Komponenten. Das Backbone-Netzwerk, typischerweise ein ResNet oder ResNeXt, extrahiert hierarchische Merkmalskarten aus dem Eingabebild. Ein Feature Pyramid Network (FPN) kann am Backbone angebracht werden, um die Erkennung über Skalen hinweg zu verbessern, indem niedrig aufgelöste, semantisch starke Merkmale mit hoch aufgelösten, räumlich präzisen Merkmalen kombiniert werden. Das RPN schlägt dann Kandidatenregionen vor, die von RoIAlign verarbeitet werden, um ausgerichtete Merkmalskarten zu erzeugen. Diese Merkmale speisen zwei Köpfe: einen Klassifikations- und Begrenzungsrahmen-Regressionskopf sowie den Maskenvorhersagekopf. Der Maskenkopf wird unabhängig auf jedes RoI angewendet und gibt eine Maske der Größe 28x28 Pixel pro Klasse aus, die dann auf die ursprüngliche RoI-Größe für die endgültige Vorhersage hochskaliert wird.

Training und Inferenz

Das Training von Mask R-CNN folgt einem mehrstufigen Verfahren. Das Modell wird typischerweise mit Gewichten initialisiert, die auf ImageNet für das Backbone vortrainiert wurden. Während des Trainings werden positive RoIs (solche mit hoher Intersection-over-Union mit Ground-Truth-Boxen) für die Berechnung des Maskenverlusts abgetastet. Der Maskenzweig wird nur auf positiven RoIs trainiert, während die Klassifikations- und Regressionsköpfe sowohl positive als auch negative Stichproben verwenden. Der Gesamtverlust ist die Summe der einzelnen Verluste, standardmäßig mit gleicher Gewichtung. Die Inferenz umfasst das Ausführen des RPN, das Anwenden von RoIAlign und das anschließende Schwellen der vorhergesagten Masken bei 0,5, um binäre Segmentierungen zu erzeugen. Nicht-maximale Unterdrückung wird auf Begrenzungsrahmenvorhersagen angewendet, um doppelte Erkennungen zu entfernen.

Auswirkungen und Anwendungen

Mask R-CNN hatte einen erheblichen Einfluss auf das Gebiet der Computer Vision. Es bot ein einfaches, flexibles und genaues Framework für die Instanzsegmentierung und wurde zu einer Standard-Baseline für nachfolgende Forschung. Sein Design beeinflusste spätere Modelle wie Cascade Mask R-CNN und hybride Ansätze, die Transformatoren mit convolutional Backbones kombinieren. In der Praxis wurde Mask R-CNN auf medizinische Bildanalyse zur Tumorsegmentierung, auf die Wahrnehmung autonomer Fahrzeuge zur Identifizierung von Fußgängern und Fahrzeugen sowie auf landwirtschaftliche Überwachung zur Zählung von Pflanzen angewendet. Die Architektur diente auch als Komponente in generativen KI-Pipelines, wo präzise Objektmasken kontrollierte Bildbearbeitung und -generierung ermöglichen.

Einschränkungen und Erweiterungen

Trotz seines Erfolgs hat Mask R-CNN bekannte Einschränkungen. Es ist rechenintensiv und erfordert erhebliche GPU-Ressourcen für Training und Inferenz, was für Echtzeitanwendungen prohibitiv sein kann. Das Modell hat auch Probleme mit stark verdeckten Objekten und kleinen Instanzen, bei denen Maskenvorhersagen verrauscht sein können. Erweiterungen haben diese Probleme angegangen: Mask Scoring R-CNN fügt einen Masken-IoU-Vorhersagekopf hinzu, um die Maskenqualität zu verbessern, und PointRend verfeinert Maskenkanten mit einem iterativen punktbasierten Ansatz. Neuere Architekturen, wie solche, die auf Transformer-Decodern basieren, haben Mask R-CNN auf einigen Benchmarks inzwischen übertroffen, aber das Modell bleibt aufgrund seiner Reife und des umfangreichen Ökosystems an vortrainierten Gewichten und Bibliotheken weit verbreitet.

Beziehung zu anderen Methoden

Mask R-CNN gehört zur breiteren Familie regionenbasierter Methoden in der Computer Vision, zu der auch frühere Modelle wie R-CNN und Fast R-CNN gehören. Es steht im Gegensatz zu einstufigen Detektoren wie YOLO und SSD, die Geschwindigkeit über Genauigkeit priorisieren. Im Kontext von künstlicher Intelligenz und maschinellem Lernen veranschaulicht Mask R-CNN den Trend zum Multi-Task-Learning, bei dem ein einzelnes neuronales Netzwerk mehrere verwandte Ausgaben verarbeitet. Seine Entwicklung war Teil einer Welle von Fortschritten im Deep Learning Mitte der 2010er Jahre, neben Durchbrüchen in der Large-Language-Model-Forschung, obwohl sich die beiden Felder in der Anwendung unterschieden. Der Code und die vortrainierten Modelle wurden unter einer Open-Source-Lizenz veröffentlicht, was die Übernahme sowohl in der Wissenschaft als auch in der Industrie beschleunigte, einschließlich bei Unternehmen wie Amazon Web Services und Google Cloud, die verwaltete Dienste für die Ausführung solcher Modelle anbieten.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·instance-segmentation·deep-learning·object-detection
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte