RetinaNet은 2017년 논문 "Focal Loss for Dense Object Detection"에서 Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He, Piotr Dollár이 소개한 객체 검출을 위한 단일 단계 머신 러닝 신경망 아키텍처입니다. Facebook AI Research(현재 Meta AI의 일부)에서 개발되었습니다. 이 모델은 일반적으로 더 빠르지만 덜 정확한 단일 단계 검출기와 더 느리지만 더 정밀한 Faster R-CNN과 같은 2단계 검출기 사이의 정확도 격차를 해소하기 위해 설계되었습니다. RetinaNet은 훈련 중 쉬운 음성 예제의 기여도를 낮추어 모델이 어려운 예제와 희귀 객체 클래스에 집중할 수 있게 하는 새로운 손실 함수인 focal loss를 도입하여 높은 정확도를 달성합니다.
RetinaNet은 완전 컨볼루션 네트워크로, 객체 분류를 위한 하위 네트워크와 경계 상자 회귀를 위한 하위 네트워크라는 두 가지 작업별 하위 네트워크가 뒤따르는 Feature Pyramid Network(FPN) 백본을 사용하여 다중 스케일 특징을 추출합니다. 분류 하위 네트워크는 focal loss를 적용하는 반면, 회귀 하위 네트워크는 표준 smooth L1 손실을 사용합니다. 이 아키텍처는 별도의 영역 제안 단계 없이 여러 스케일에 걸쳐 모든 공간 위치에서 객체를 예측하는 조밀한 검출을 위해 설계되었습니다.
아키텍처 및 Focal Loss
RetinaNet의 핵심 혁신은 분류를 위한 표준 교차 엔트로피 손실을 수정한 focal loss입니다. Focal loss는 교차 엔트로피 항에 변조 인자 \((1 - p_t)^\gamma\)를 추가합니다. 여기서 \(p_t\)는 실제 클래스에 대한 모델의 추정 확률이고 \(\gamma\)는 초점 매개변수(일반적으로 2로 설정)입니다. 이 인자는 잘 분류된 예제(\(p_t\)가 높은 경우)의 손실 기여도를 줄여 훈련 신호를 압도하는 수많은 쉬운 배경 예제를 방지합니다. 이 논문은 아키텍처 변경 없이 focal loss만으로도 2단계 검출기의 성능에 필적하거나 능가할 수 있음을 보여주었습니다.
이 네트워크는 ResNet(ResNet-50 또는 ResNet-101) 백본과 Feature Pyramid Network를 결합하여 고해상도의 저수준 특징부터 저해상도의 고수준 특징까지 여러 스케일의 특징 맵을 생성합니다. 피라미드의 각 레벨은 모든 스케일에서 공유되는 분류 및 회귀 하위 네트워크로 연결됩니다. 이 설계는 단일 순방향 패스로 작은 객체부터 큰 객체까지 다양한 크기의 객체를 감지할 수 있게 합니다.
성능 및 벤치마크 결과
원래 논문에서 RetinaNet은 ResNet-101-FPN 백본을 사용하여 COCO test-dev 벤치마크에서 최첨단 평균 정밀도(AP) 39.1을 달성하여 SSD 및 YOLOv2와 같은 이전 단일 단계 검출기를 능가하고 Faster R-CNN과 같은 2단계 검출기의 성능에 필적하거나 능가했습니다. 더 큰 백본(ResNeXt-101-FPN)을 사용하면 AP 40.8에 도달했습니다. 이 모델은 또한 ResNet-50 백본을 사용하여 NVIDIA M40 GPU에서 초당 최대 5.4프레임으로 실행되는 강력한 추론 속도를 보여주어 실시간 애플리케이션에 적합합니다.
저자들은 focal loss가 극심한 클래스 불균형을 처리하는 데 특히 효과적이라고 언급했습니다. COCO 데이터 세트에는 이미지당 약 100,000개의 후보 위치가 있지만 객체는 소수에 불과하여 배경 예제가 전경 예제보다 훨씬 많습니다. 쉬운 음성 예제의 가중치를 낮춤으로써 RetinaNet은 이전의 조밀한 검출기보다 더 빠른 수렴과 더 나은 최종 정확도를 달성했습니다.
영향 및 유산
RetinaNet은 컴퓨터 비전 연구의 표준 기준선이 되었으며 자율 주행, 감시, 의료 영상과 같은 애플리케이션을 위해 산업계에서 널리 채택되었습니다. 그 설계 원칙은 EfficientDet 및 최신 단일 단계 모델을 포함한 후속 객체 검출기에 영향을 미쳤습니다. Focal loss는 클래스 불균형 문제가 발생하는 의미론적 분할 및 자연어 처리와 같은 다른 작업에도 적용되었습니다.
딥 러닝 프레임워크에서 RetinaNet은 Detectron2, PyTorch의 torchvision, TensorFlow Object Detection API와 같은 인기 있는 라이브러리에 구현되어 연구자와 실무자가 쉽게 사용할 수 있습니다. 이는 테슬라 오토파일럿의 차량 및 보행자 감지와 웨이모의 자율 주행 기술을 포함한 인공 지능 시스템의 구성 요소로 사용되었지만, 이러한 회사들은 이후 맞춤형 아키텍처로 전환했습니다.
변형 및 확장
RetinaNet의 여러 확장이 제안되었습니다. 주목할 만한 변형 중 하나는 마스크 예측 분기를 추가하여 인스턴스 분할로 확장한 RetinaMask입니다. 또 다른 하나는 앵커 박스 없이 중심 기반 예측을 사용하지만 유사한 원칙을 기반으로 하는 FCOS(Fully Convolutional One-Stage)입니다. 연구자들은 또한 트랜스포머 아키텍처를 사용하지만 동일한 조밀한 검출 문제를 해결하는 DETR(DEtection TRansformer)과 같은 주의 메커니즘을 통합하는 방안을 탐구했습니다.
원래 RetinaNet 논문은 2024년 기준으로 10,000회 이상 인용되며 객체 검출 분야에 큰 영향을 미쳤습니다. 손실 함수 설계에 대한 기여는 조밀한 예측 네트워크 훈련의 표준 기술로 남아 있습니다.