영어에서 번역됨

R-CNN은 객체 탐지 및 위치 파악을 위한 딥러닝 모델 계열로, 영역 제안(region proposals)과 합성곱 신경망을 사용하여 이미지에서 객체를 식별합니다.

지역 기반 합성곱 신경망(R-CNN)은 컴퓨터 비전, 특히 객체 탐지 및 위치 파악을 위한 기계 학습 모델의 한 계열이다. R-CNN의 원래 목표는 입력 이미지를 받아 각 경계 상자에 객체와 해당 객체의 범주(예: 자동차 또는 보행자)가 포함된 일련의 경계 상자를 출력으로 생성하는 것이었다. 일반적으로 R-CNN 아키텍처는 CNN이 출력한 특징 맵에 대해 선택적 검색을 수행한다.

R-CNN은 드론 장착 카메라에서 객체 추적, 이미지에서 텍스트 위치 파악, Google Lens에서 객체 탐지 활성화 등 다른 컴퓨터 비전 작업을 수행하도록 확장되었다. Mask R-CNN은 또한 신경망 훈련 속도를 높이기 위한 경쟁인 MLPerf 훈련 벤치마크의 7가지 작업 중 하나이다.

역사

R-CNN의 개발에는 여러 주요 버전이 있었다. 원래 R-CNN은 2013년 11월에 도입되었고, Fast R-CNN은 2015년 4월, Faster R-CNN은 2015년 6월에 이어졌다. Mask R-CNN은 2017년 3월에 등장하여 프레임워크를 인스턴스 분할로 확장했다. 2017년 12월에는 Cascade R-CNN이 제안되었으며, 이는 교차 결합 비율(IoU, 자카드 지수라고도 함) 임계값을 증가시키면서 훈련하여 각 단계가 인접한 오탐지에 대해 더 선택적으로 만들었다. 2019년 6월에는 Mesh R-CNN이 2D 이미지에서 3D 메시를 생성하는 기능을 추가했다.

아키텍처

R-CNN 계열은 지역 제안과 합성곱 특징 추출에 기반한 공통 아키텍처를 공유한다. 핵심 아이디어는 후보 객체 영역을 생성하고, CNN을 사용하여 특징을 추출하며, 각 영역을 분류하는 것이다.

선택적 검색

이미지(또는 이미지와 유사한 특징 맵)가 주어지면 선택적 검색(계층적 그룹화라고도 함)은 먼저 Felzenszwalb와 Huttenlocher(2004)의 알고리즘을 사용하여 이미지를 분할한다. 그런 다음 색상, 질감, 크기 및 모양 호환성을 기반으로 유사한 인접 영역을 반복적으로 병합하여 객체 위치 가설 집합을 생성한다. 알고리즘은 다음과 같이 진행된다:

  1. 이미지를 초기 영역 R = {r1, ..., rn}으로 분할한다.
  2. 유사도 집합 S = ∅을 초기화한다.
  3. 각 인접 영역 쌍 (ri, rj)에 대해 유사도 s(ri, rj)를 계산하고 S에 추가한다.
  4. S가 비어 있지 않은 동안:
    • 가장 높은 유사도 s(ri, rj) = max(S)를 얻는다.
    • 해당 영역을 rt = ri ∪ rj로 병합한다.
    • ri와 rj와 관련된 유사도를 S에서 제거한다.
    • rt와 이웃 간의 유사도를 계산하고 S에 추가한다.
    • rt를 R에 추가한다.
  5. R의 모든 영역에서 객체 위치 상자 L을 추출한다.

R-CNN

원래 R-CNN에서는 예측이 2단계 프로세스를 따른다. 전처리 선택적 검색 단계는 관심 영역(ROI)으로 알려진 대규모 후보 객체 집합(일반적으로 최대 2000개)을 생성한다. 이들은 CNN으로 전달되며, CNN은 각 ROI에 대해 독립적으로 객체 클래스 점수와 경계 상자 추정치를 예측한다. 중요하게도 ROI는 과도한 후보를 제거하기 위해 크게 필터링된다. 필터링은 배경 범주에 할당된 ROI를 제거하는 것으로 시작되며, 배경 범주는 CNN이 다른 범주와 함께 점수를 매기는 특수 범주이다. 남은 ROI는 동일한 객체를 덮는 여러 ROI가 모두 비배경 범주로 할당되므로 심한 중복을 겪는 경우가 많다. 이는 휴리스틱 비최대 억제(NMS) 단계로 해결된다.

Fast R-CNN

원래 R-CNN이 최대 2천 개의 관심 영역 각각에 대해 신경망 특징을 독립적으로 계산한 반면, Fast R-CNN은 전체 이미지에 대해 신경망을 한 번 실행한다. 네트워크 끝에는 ROIPooling 모듈이 있으며, 이 모듈은 네트워크의 출력 텐서에서 각 ROI를 잘라내어 모양을 바꾸고 분류한다. 원래 R-CNN과 마찬가지로 Fast R-CNN은 선택적 검색을 사용하여 지역 제안을 생성한다.

Faster R-CNN

Faster R-CNN은 ROI 생성을 신경망 자체에 통합하여 외부 선택적 검색의 필요성을 제거한다. 이로 인해 모델이 완전히 종단 간 훈련 가능해지고 훨씬 빨라진다.

Mask R-CNN

이전 버전이 객체 탐지에 초점을 맞춘 반면, Mask R-CNN은 인스턴스 분할을 추가하여 감지된 각 객체에 대한 분할 마스크를 생성한다. Mask R-CNN은 또한 ROIPooling을 ROIAlign이라는 새로운 방법으로 대체했으며, 이 방법은 픽셀의 일부를 표현할 수 있어 위치 파악 정확도를 향상시킨다.

응용 및 영향

R-CNN 모델은 자율 주행, 감시 및 이미지 검색을 포함한 컴퓨터 비전 응용 분야에서 널리 채택되었다. 이 아키텍처는 이후 객체 탐지 모델에 영향을 미쳤으며 비전을 위한 딥 러닝의 기초 개념으로 남아 있다. MLPerf 벤치마크는 훈련 성능을 평가하기 위한 표준 작업으로 Mask R-CNN을 포함하여 그 실용적 중요성을 강조한다.

같이 보기

참고 문헌

  • Girshick, R., Donahue, J., Darrell, T., & Malik, J. (2014). Rich feature hierarchies for accurate object detection and semantic segmentation. CVPR.
  • Girshick, R. (2015). Fast R-CNN. ICCV.
  • Ren, S., He, K., Girshick, R., & Sun, J. (2015). Faster R-CNN: Towards real-time object detection with region proposal networks. NeurIPS.
  • He, K., Gkioxari, G., Dollár, P., & Girshick, R. (2017). Mask R-CNN. ICCV.

추가 자료

  • Parthasarathy, Dhruv (2017-04-27). "A Brief History of CNNs in Image Segmentation: From R-CNN to Mask R-CNN". Medium. Retrieved 2024-09-11.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·object-detection·deep-learning·convolutional-neural-network
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사