영어에서 번역됨

Mask R-CNN은 인스턴스 세그멘테이션을 위한 딥러닝 아키텍처로, Faster R-CNN을 확장하여 마스크 분기를 추가한 것이다. 객체를 감지하면서 동시에 픽셀 수준의 세그멘테이션 마스크를 생성한다.

Mask R-CNN은 객체 검출과 픽셀 단위 분할을 결합한 컴퓨터 비전 작업인 인스턴스 분할을 위한 딥러닝 아키텍처이다. 이는 Faster R-CNN 객체 검출 프레임워크를 확장하여 경계 상자로 객체를 국소화하고 픽셀 경계를 정밀하게 delineate하는 분할 마스크 예측을 위한 병렬 분기를 추가한다. Facebook AI Research(현재 Meta)의 연구자들이 개발한 Mask R-CNN은 2017년에 소개되었으며 자율 주행, 의료 영상, 로봇 공학 등 다양한 하위 응용 분야의 기초 모델이 되었다.

아키텍처 및 구성 요소

Mask R-CNN은 Faster R-CNN을 직접 기반으로 구축되었으며, Faster R-CNN은 이전의 지역 기반 합성곱 신경망에서 발전한 것이다. Faster R-CNN은 후보 객체 영역을 생성하는 지역 제안 네트워크(RPN)를 사용하고, 이후 관심 영역(RoI) 풀링 계층을 통해 분류 및 경계 상자 회귀를 위한 고정 크기 특징 맵을 추출한다. Mask R-CNN은 RoI 풀링을 RoIAlign으로 대체하는데, 이는 RoI 풀링에서 발생하는 공간 양자화 오류를 제거하는 핵심 수정 사항이다. RoIAlign은 이중 선형 보간법을 사용하여 샘플링된 지점에서 정확한 값을 계산함으로써 정밀한 마스크 예측에 필수적인 미세한 공간 세부 정보를 보존한다. 이 변경을 통해 마스크 분기가 정렬된 특징 맵에서 작동할 수 있어 분할 품질이 크게 향상된다.

마스크 분기 자체는 각 RoI에 적용되는 작은 완전 합성곱 네트워크로, 각 클래스에 대해 이진 마스크를 생성한다. 훈련 중 손실 함수는 분류 손실, 경계 상자 회귀 손실, 마스크 예측에 대한 평균 이진 교차 엔트로피 손실을 결합한다. 이 다중 작업 학습 설정을 통해 모델은 검출과 분할을 동시에 최적화할 수 있으며, COCO 데이터 세트와 같은 벤치마크에서 강력한 성능을 달성한다. 출시 당시 Mask R-CNN은 COCO test-dev에서 마스크 평균 정밀도 35.7%, 경계 상자 평균 정밀도 39.8%를 기록하며 기존 최첨단 방법을 능가했다.

아키텍처 및 구성 요소

Mask R-CNN은 여러 통합 구성 요소로 구성된다. 백본 네트워크는 일반적으로 ResNet 또는 ResNeXt로, 입력 이미지에서 계층적 특징 맵을 추출한다. 특징 피라미드 네트워크(FPN)를 백본에 연결하여 저해상도의 의미론적으로 강력한 특징과 고해상도의 공간적으로 정밀한 특징을 결합함으로써 다양한 규모의 검출 성능을 향상시킬 수 있다. RPN은 후보 영역을 제안하고, RoIAlign은 이러한 영역을 처리하여 정렬된 특징 맵을 생성한다. 이러한 특징은 분류 및 경계 상자 회귀 헤드와 마스크 예측 헤드라는 두 개의 헤드로 공급된다. 마스크 헤드는 각 RoI에 독립적으로 적용되어 클래스당 28x28 픽셀 크기의 마스크를 출력하며, 이후 원래 RoI 크기로 업샘플링되어 최종 예측을 생성한다.

훈련 및 추론

Mask R-CNN의 훈련은 다단계 절차를 따른다. 모델은 일반적으로 백본에 대해 ImageNet에서 사전 훈련된 가중치로 초기화된다. 훈련 중에는 경계 상자와의 높은 교차 결합(IoU)을 가진 양성 RoI가 마스크 손실 계산을 위해 샘플링된다. 마스크 분기는 양성 RoI에서만 훈련되는 반면, 분류 및 회귀 헤드는 양성 및 음성 샘플을 모두 사용한다. 전체 손실은 개별 손실의 합으로, 기본적으로 동일한 가중치를 적용한다. 추론 중에는 RPN을 실행하고 RoIAlign을 적용한 다음 예측 마스크를 0.5 임계값으로 이진화하여 이진 분할을 생성한다. 비최대 억제(NMS)를 경계 상자 예측에 적용하여 중복 검출을 제거한다.

영향 및 응용 분야

Mask R-CNN은 컴퓨터 비전 분야에 큰 영향을 미쳤다. 이는 인스턴스 분할을 위한 간단하고 유연하며 정확한 프레임워크를 제공하여 이후 연구의 표준 기준이 되었다. 그 설계는 Cascade Mask R-CNN과 같은 후속 모델과 합성곱 백본을 트랜스포머로 대체한 하이브리드 접근 방식에 영향을 주었다. 실제로 Mask R-CNN은 종양 분할을 위한 의료 영상 분석, 보행자 및 차량 식별을 위한 자율 주행, 식물 계수를 위한 농업 모니터링 등에 널리 적용되었다. 또한 생성형 AI 파이프라인의 구성 요소로 사용되어 정밀한 객체 마스크를 통해 제어된 이미지 편집 및 생성을 가능하게 한다.

한계 및 확장

성공에도 불구하고 Mask R-CNN은 알려진 한계가 있다. 계산 집약적이어서 실시간 응용에는 상당한 GPU 리소스가 필요하며, 심하게 가려진 객체나 작은 인스턴스에서는 마스크 예측이 노이즈가 될 수 있다. 이러한 문제를 해결하기 위한 확장이 제안되었다. Mask Scoring R-CNN은 마스크 IoU 예측 헤드를 추가하여 마스크 품질을 개선하고, PointRend는 반복적인 포인트 기반 접근 방식으로 마스크 가장자리를 정제한다. 트랜스포머 디코더를 기반으로 한 최신 아키텍처는 일부 벤치마크에서 Mask R-CNN을 능가했지만, 이 모델은 성숙도와 사전 훈련된 가중치 및 라이브러리의 광범위한 생태계 덕분에 여전히 널리 사용된다.

다른 방법과의 관계

Mask R-CNN은 R-CNN 및 Fast R-CNN과 같은 초기 모델을 포함하는 지역 기반 컴퓨터 비전 방법의 더 넓은 계열에 속한다. YOLO 및 SSD와 같은 단일 단계 검출기와 대조되며, 이러한 검출기는 속도를 우선시하는 반면 Mask R-CNN은 정확도를 우선시한다. 인공지능머신러닝의 맥락에서 Mask R-CNN은 단일 신경망이 여러 관련 출력을 처리하는 다중 작업 학습의 추세를 예시한다. 그 개발은 2010년대 중반 딥러닝의 발전 물결의 일부였으며, 대규모 언어 모델 연구의 돌파구와 병행했지만 응용 분야는 달랐다. 코드와 사전 훈련된 모델은 오픈 소스 라이선스로 공개되어 학계와 산업계 모두에서 채택을 가속화했으며, 아마존 웹 서비스구글 클라우드와 같은 클라우드 플랫폼에서 관리형 서비스로 제공된다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·instance-segmentation·deep-learning·object-detection
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사