객체 검출은 컴퓨터 비전의 기본적인 작업으로, 디지털 이미지 내에서 객체의 인스턴스를 식별하고 그 위치를 결정하는 것을 포함한다. 이미지 전체에 단일 라벨을 할당하는 이미지 분류와 달리, 객체 검출은 각각 클래스 라벨과 신뢰도 점수가 연결된 하나 이상의 경계 상자를 출력한다. 이러한 능력은 자율 주행, 감시, 의료 영상, 소매 분석에 이르는 다양한 응용 분야의 기반이 된다.
이 분야는 고전적인 수작업 특징 방법에서 현대의 딥러닝 접근 방식으로 진화해 왔다. 비올라-존스 검출기(2001)와 서포트 벡터 머신을 사용한 방향 그래디언트 히스토그램(HOG, 2006)과 같은 초기 기법은 수동으로 설계된 특징에 의존했다. 딥러닝, 특히 합성곱 신경망(CNN)의 출현은 이 분야에 혁명을 일으켰다. 2012년, 이미지 분류에서 AlexNet의 성공은 CNN 기반 검출기의 개발을 촉진했다. 주요 이정표로는 2014년 지역 제안을 위한 선택적 검색을 도입한 지역 기반 CNN(R-CNN), 속도와 정확도를 개선한 Fast R-CNN(2015)과 지역 제안 네트워크를 통합한 Faster R-CNN(2015)이 있다. 동시에 2016년 YOLO(You Only Look Once)와 SSD(Single Shot MultiBox Detector)와 같은 단일 샷 검출기는 특징 맵에서 직접 경계 상자와 클래스를 예측하여 실시간 성능을 제공했다.
핵심 개념 및 아키텍처
객체 검출 모델은 크게 2단계 검출기와 1단계 검출기로 분류할 수 있다. Faster R-CNN과 같은 2단계 검출기는 먼저 지역 제안을 생성한 다음 각 제안을 분류하여 높은 정확도를 달성하지만 계산 비용이 발생한다. YOLO와 SSD와 같은 1단계 검출기는 단일 패스로 검출을 수행하여 일부 정확도를 속도와 맞바꾼다. 최근 발전에는 2020년 DETR(Detection Transformer)과 같은 트랜스포머 기반 검출기가 포함되며, 이는 검출을 집합 예측 문제로 취급하여 앵커 박스와 비최대 억제와 같은 수작업 구성 요소의 필요성을 제거한다.
현대 아키텍처는 종종 특징 피라미드 네트워크(FPN)를 사용하여 여러 규모에서 객체를 검출한다. ResNet, EfficientNet 또는 Vision Transformer(ViT)와 같은 백본 네트워크는 계층적 특징을 추출한다. 백본과 검출 헤드의 선택은 성능과 효율성에 큰 영향을 미친다. 예를 들어, YOLOv8(2023)은 CSPDarknet 백본, PANet 넥, 분리형 헤드를 통합하여 최첨단 속도-정확도 절충을 달성한다.
훈련 및 평가
객체 검출기를 훈련하려면 경계 상자 라벨이 있는 대규모 주석 데이터셋이 필요하다. 주요 데이터셋으로는 PASCAL VOC(2005-2012), MS COCO(2015), Open Images(2016)가 있다. 이러한 데이터셋은 다양한 카테고리에 걸쳐 수천에서 수백만 개의 이미지와 객체 인스턴스를 제공한다. 손실 함수는 일반적으로 분류 손실(예: 교차 엔트로피)과 위치 손실(예: smooth L1 또는 IoU 기반 손실)을 결합한다. 무작위 잘라내기, 스케일링, 색상 지터와 같은 데이터 증강 기법은 일반화에 중요하다.
평가 지표에는 클래스 및 IoU 임계값 전반에 걸쳐 정밀도-재현율 곡선 아래 면적을 계산하는 평균 정밀도(mAP)가 포함된다. MS COCO의 mAP@[.5:.95]는 표준 벤치마크이다. 추론 속도는 초당 프레임 수(FPS) 또는 지연 시간으로 측정되며, 종종 정확도와 절충된다.
응용 분야 및 영향
객체 검출은 수많은 실세계 시스템에 필수적이다. 자율 주행 차량에서는 Waymo 및 Tesla Autopilot과 같은 기업이 시연한 바와 같이 보행자, 차량, 교통 표지판을 식별한다. 감시에서는 사람 수 세기와 이상 탐지를 가능하게 한다. 소매에서는 재고 관리와 무계산 매장을 지원한다. 의료에서는 방사선 영상에서 종양 검출을 돕는다. 이 기술은 또한 증강 현실, 로봇 공학, 이미지 검색을 가능하게 한다.
과제 및 향후 방향
진전에도 불구하고 객체 검출은 작은 객체 검출, 폐색 처리, 도메인 이동 적응, 경계 사례에서의 견고성 보장과 같은 과제에 직면한다. 효율성은 임베디드 장치 배포에 여전히 중요하며, 모델 압축 및 양자화에 대한 연구를 주도한다. 대규모 언어 모델과 트랜스포머의 통합은 텍스트 설명을 사용하여 훈련 카테고리 너머의 객체를 검출할 수 있는 개방 어휘 검출과 같은 새로운 경로를 열었다. 주석 비용을 줄이기 위한 자기 지도 및 퓨샷 학습에 대한 연구가 계속되고 있다.
주요 연구자 및 기관
주요 기여자로는 Karen Simonyan(VGG, R-CNN), Ross Girshick(R-CNN, Fast R-CNN, Faster R-CNN), Joseph Redmon(YOLO)이 있다. Berkeley AI Research, Stanford AI Lab, MIT CSAIL의 학술 그룹이 이 분야를 발전시켰다. Google DeepMind, OpenAI, Microsoft Research와 같은 산업 연구소도 기여했다. 객체 검출의 지속적인 진화는 인공지능과 컴퓨터 비전의 더 넓은 풍경을 계속 형성하고 있다.