Faster R-CNN은 Deep learning 및 Computer vision 분야에서 영역 제안 생성과 객체 분류를 단일의 학습 가능한 Neural network로 통합한 객체 감지 아키텍처이다. 이는 2015년 Shaoqing Ren, Kaiming He, Ross Girshick, Jian Sun이 이전의 R-CNN 및 Fast R-CNN 모델을 기반으로 도입했다. 핵심 혁신은 Region Proposal Network(RPN)로, 검출기와 전체 이미지 컨볼루션 특징을 공유하여 후보 영역 생성의 계산 비용을 크게 줄인다. 이 설계는 높은 감지 정확도를 유지하면서 거의 실시간 추론 속도를 가능하게 하여 현대 객체 감지 시스템의 기초 모델로 자리 잡았다.
Faster R-CNN은 2단계 검출기로 작동한다. 첫 번째 단계에서는 RPN을 사용하여 직사각형 객체 영역 집합을 제안한다. 두 번째 단계인 검출 네트워크는 이러한 영역을 특정 객체 범주로 분류하고 경계 상자를 정제한다. 이러한 분리는 YOLO 또는 SSD와 같은 단일 단계 검출기와 대조되며, 이들은 특징 그리드에서 경계 상자와 클래스 확률을 직접 회귀한다. 2단계 접근 방식은 일반적으로 특히 작거나 가려진 객체에 대해 우수한 위치 정확도를 제공하며, 이로 인해 Faster R-CNN은 Machine learning 연구의 표준 벤치마크가 되었다.
Architecture
아키텍처는 백본 컨볼루션 네트워크, RPN, 그리고 관심 영역(RoI) 분류기의 세 가지 주요 구성 요소로 이루어져 있다. 백본은 종종 VGG-16 또는 ResNet과 같은 사전 학습된 네트워크로, 입력 이미지에서 특징 맵을 추출한다. RPN은 이러한 특징 맵에서 작동하며, 작은 슬라이딩 창을 사용하여 여러 스케일과 종횡비의 앵커 박스 집합에 대해 객체 점수와 박스 회귀 오프셋을 예측한다. 앵커를 통해 네트워크는 다중 스케일 이미지 피라미드 없이 다양한 모양의 객체를 처리할 수 있다. 생성된 제안은 RoI 풀링을 통해 고정 크기로 풀링된 후 분류기를 통과하여 클래스 확률과 정제된 경계 상자를 출력한다.
Training
훈련은 RPN과 검출기 모두에 대한 분류 및 회귀 손실을 결합한 다중 작업 손실 함수를 사용하여 종단 간으로 수행된다. 원래 구현은 교대 최적화 일정을 사용했지만, 이후 버전은 모든 레이어를 통한 역전파를 이용한 공동 훈련을 채택했다. RPN은 앵커에 객체가 포함되어 있는지 여부를 나타내는 이진 레이블로 훈련되며, 검출기는 세분화된 클래스 레이블을 사용한다. 많은 수의 앵커 박스를 처리하기 위해 샘플링 전략이 훈련 중 균형 잡힌 배치를 선택한다. 이러한 통합 훈련 접근 방식은 Selective Search와 같은 외부 영역 제안 알고리즘의 별도 훈련이 필요했던 이전 R-CNN 방법과 크게 다른 점이다.
Performance and Impact
PASCAL VOC 2007 및 2012 벤치마크에서 Faster R-CNN은 각각 73.2% 및 70.4%의 최첨단 mAP 점수를 달성했으며, GPU에서 초당 5프레임으로 실행되었다. 이는 이미지당 수 초가 걸렸던 Fast R-CNN에 비해 상당한 개선이었다. RPN의 도입은 외부 영역 제안 방법의 병목 현상을 제거하여 전체 감지 파이프라인을 종단 간 학습 가능하게 만들었다. 이 작업은 인스턴스 분할을 위한 Mask R-CNN 및 다양한 영역 기반 프레임워크와 같은 후속 모델에 영향을 미쳤다. 그 원리는 자율 주행 인식 스택을 포함한 상용 시스템, 예를 들어 Waymo 및 Tesla과 같은 회사에서 널리 채택되었다.
Variants and Extensions
Faster R-CNN의 특정 측면을 개선하기 위해 수많은 확장이 제안되었다. Feature Pyramid Networks(FPN)는 다중 스케일 특징 맵을 통합하여 작은 객체 감지를 향상시킨다. Cascade R-CNN은 증가하는 IoU 임계값을 가진 일련의 검출기를 사용하여 제안을 반복적으로 정제한다. 다른 연구는 Arm Holdings 기반 엣지 디바이스와 같은 경량 백본을 탐구했다. Generative AI 맥락에서 Faster R-CNN은 비전-언어 모델의 구성 요소로도 사용되었지만, 대규모 시스템은 종종 트랜스포머 기반 검출기를 선호한다. 효율성 향상을 위한 연구는 계속되고 있으며, Intel 및 Qualcomm과 같은 하드웨어 공급업체가 양자화 및 가지치기 기법을 적용하고 있다.
Related Methods
Faster R-CNN은 R-CNN 및 Fast R-CNN을 포함하는 지역 기반 컨볼루션 네트워크의 더 넓은 계열에 속한다. 이는 종종 YOLO 및 SSD와 같은 단일 단계 검출기와 비교되며, 이들은 더 높은 속도를 제공하지만 일반적으로 낮은 정확도를 제공한다. RetinaNet과 같은 후속 하이브리드 아키텍처는 focal loss를 사용하여 이 격차를 메우려고 시도한다. 현대 딥 러닝 환경에서 Transformer (architecture) 아키텍처를 사용하는 주의 기반 검출기가 부상했지만, Faster R-CNN은 여전히 널리 사용되는 기준선이자 앙상블 방법의 일반적인 구성 요소로 남아 있다.
Variants and Extensions
Faster R-CNN의 특정 측면을 개선하기 위해 수많은 확장이 제안되었다. Feature Pyramid Networks(FPN)는 다중 스케일 특징 맵을 통합하여 작은 객체 감지를 향상시킨다. Cascade R-CNN은 증가하는 IoU 임계값을 가진 일련의 검출기를 사용하여 제안을 반복적으로 정제한다. 다른 연구에서는 Arm Holdings 기반 엣지 장치와 같은 배포 가능한 경량 백본을 탐구했다. Generative AI 맥락에서 Faster R-CNN은 비전-언어 모델의 구성 요소로도 사용되었지만, 대규모 시스템은 일반적으로 트랜스포머 기반 검출기를 선호한다. 연구는 계속해서 효율성 향상에 초점을 맞추고 있으며, Intel 및 Qualcomm과 같은 하드웨어 공급업체가 양자화 및 가지치기 기법을 적용하고 있다.
Related Methods
Faster R-CNN은 R-CNN 및 Fast R-CNN을 포함하는 더 넓은 영역 기반 컨볼루션 네트워크 계열에 속한다. 이는 일반적으로 더 낮은 정확도를 제공하지만 더 빠른 속도를 제공하는 YOLO 및 SSD와 같은 단일 단계 검출기와 자주 비교된다. RetinaNet과 같은 후속 하이브리드 아키텍처는 focal loss로 이러한 격차를 메우려 시도한다. 현대 딥러닝 환경에서는 Transformer (architecture) 기반 검출기의 중요성이 부각되었지만, Faster R-CNN은 여전히 널리 사용되는 기준 모델이자 앙상블 방법의 공통 구성 요소로 남아 있다.