Oxford-IIIT Pet 데이터셋은 컴퓨터 비전 분야에서 세밀한 이미지 분류와 의미론적 분할을 위한 널리 사용되는 벤치마크이다. 2012년 옥스퍼드 대학교와 하이데라바드 인도 정보 기술 연구소(IIIT-H)의 연구자들에 의해 공개되었으며, 37개의 고양이 및 개 품종에 대한 7,349개의 이미지로 구성된다. 각 이미지는 종 레이블, 품종 레이블, 픽셀 수준의 트라이맵 분할 마스크, 그리고 대략적인 머리 경계 상자로 주석이 달려 있다. 이 데이터셋은 시각적으로 유사한 품종을 분류하고 복잡한 배경에서 동물을 분할하는 연구를 장려하기 위해 설계되었다.
이 데이터셋은 변형 가능한 부품 기반 모델과 의미론적 분할 접근법을 결합한 모델을 제안한 논문과 함께 소개되었다. 원래 발표에서는 공간 피라미드 매칭을 사용한 단어 가방 모델로 59.2%의 분류 정확도를, 제안된 방법으로 49.8%의 평균 교차-결합(IoU) 분할 정확도를 보고했다. 이러한 수치는 현대의 딥러닝 모델에 의해 훨씬 능가되었지만, 데이터셋은 여전히 새로운 아키텍처를 평가하는 표준으로 남아 있다.
데이터셋 구조
이미지는 12개의 고양이 품종과 25개의 개 품종으로 나뉘며, 각 클래스당 약 200개의 이미지가 있다. 품종에는 아비시니안 고양이, 벵골 고양이, 브리티시 쇼트헤어와 같은 일반적인 애완동물뿐만 아니라 비글, 저먼 셰퍼드, 퍼그와 같은 개도 포함된다. 데이터셋은 훈련 세트와 테스트 세트로 분할되며, 분할은 원래 릴리스에서 제공된다. 훈련 세트에는 3,680개의 이미지가 있고, 테스트 세트에는 3,669개의 이미지가 있다. 분할 마스크는 트라이맵으로, 각 픽셀은 전경, 배경 또는 불확실한 경계 영역으로 레이블이 지정된다.
연구 영향
Oxford-IIIT Pet 데이터셋은 특히 U-Net 및 기타 신경망 아키텍처의 의미론적 분할 평가를 위해 수백 개의 연구에서 사용되었다. 종종 PASCAL VOC 데이터셋과 함께 전이 학습 벤치마크로 짝을 이룬다. 데이터셋의 적당한 크기는 ImageNet과 같은 더 큰 데이터셋과 달리 처음부터 모델을 훈련하는 데 적합하다. 또한 클래스당 이미지 수가 제한되어 있어 일반화를 개선하기 위한 증강을 장려하므로 데이터 증강 기술을 연구하는 데도 사용되었다.
일반적인 평가 프로토콜
분류의 표준 평가는 평균 클래스별 정확도를 사용하며, 분할은 모든 클래스에 걸친 평균 IoU로 측정된다. 연구자들은 일반적으로 이미지를 224x224 픽셀과 같은 고정 해상도로 크기를 조정하고, 훈련 중에 무작위 뒤집기와 자르기를 적용한다. 많은 발표된 결과는 현대의 잔차 네트워크와 인코더-디코더 모델을 사용하여 95% 이상의 분류 정확도와 90% 이상의 분할 IoU를 보고한다. 데이터셋의 공식 웹사이트는 원래 주석과 발표된 결과 목록을 제공하지만, 2010년대 중반 이후로 업데이트되지 않았다.
한계 및 대안
데이터셋에는 클래스당 상대적으로 적은 수의 이미지와 잘 정돈된 스튜디오 같은 사진에 대한 편향을 포함한 알려진 한계가 있다. 모든 품종은 순종으로, 혼합 품종 애완동물의 다양성을 반영하지 않는다. 더 어려운 작업을 위해 연구자들은 Stanford Dogs나 iNaturalist 챌린지와 같은 더 큰 데이터셋으로 전환했다. 그러나 Oxford-IIIT Pet 데이터셋은 컴팩트한 크기와 깨끗한 주석 덕분에 분할 모델의 프로토타입을 만드는 편리한 출발점으로 남아 있다.
유산
데이터셋은 Omkar M. Parkhi, Andrea Vedaldi, Andrew Zisserman, 그리고 C. V. Jawahar에 의해 만들어졌다. 2012년 영국 기계 비전 컨퍼런스(BMVC)에서 발표된 동반 논문은 수천 번 인용되었다. 이는 세밀한 인식 방법의 개발에 기여했고, 약한 지도 분할을 위한 트라이맵 마스크의 사용을 대중화하는 데 도움이 되었다. 데이터셋은 학술 사용을 위해 자유롭게 이용 가능하며, 옥스퍼드 대학교의 Visual Geometry Group 웹사이트에서 호스팅된다.