Cats vs. Dogs는 2013년 Kaggle 대회를 위해 소개된 잘 알려진 데이터셋이다. 이 데이터셋은 25,000장의 컬러 이미지로 구성되어 있으며, 고양이 사진 12,500장과 개 사진 12,500장으로 균등하게 나뉜다. 이미지는 다양한 인터넷 사진 컬렉션에서 수집되었으며, 다양한 해상도와 종횡비로 제공되었다. 주요 과제는 이진 이미지 분류, 즉 주어진 이미지가 고양이인지 개인지를 판별하는 것이다.
이 데이터셋은 Machine learning 커뮤니티, 특히 Deep learning 및 Neural network 아키텍처에 관한 강좌와 튜토리얼에서 표준 벤치마크로 빠르게 자리 잡았다. 적당한 크기와 단순한 이진 라벨링 덕분에 데이터 전처리, Data Augmentation, 전이 학습, 모델 평가와 같은 기본 개념을 시연하는 데 이상적이다. 실무자들이 합성곱 신경망(CNN) 구축을 배울 때 처음 접하는 실제 데이터셋 중 하나이기도 하다.
대회 및 역사
Cats vs. Dogs 대회는 2013년 Kaggle에서 개최되었으며, 참가자들이 이미지를 자동으로 분류하는 알고리즘을 개발하도록 장려하는 것이 목표였다. 이 대회는 수백 개 팀의 참여를 이끌었고, 이미지 인식 작업에 딥러닝을 사용하는 것을 대중화하는 데 기여했다. 당시 많은 우승 솔루션은 수작업 특징과 전통적인 분류기를 사용했지만, 이 데이터셋은 곧 이 분야를 지배하게 될 합성곱 신경망의 초기 시험장 역할도 했다.
대회가 끝난 후에도 이 데이터셋은 Kaggle에서 공개적으로 이용 가능한 상태로 남았으며, 수많은 연구 논문, 대학 강좌, 온라인 튜토리얼에서 다운로드되어 사용되었다. 이러한 오랜 수명은 데이터셋의 단순성과 TensorFlow 및 PyTorch와 같은 일반적인 라이브러리를 사용하여 쉽게 로드하고 처리할 수 있다는 점에 부분적으로 기인한다.
데이터셋 특성
Cats vs. Dogs 데이터셋의 각 이미지는 "cat.0.jpg" 또는 "dog.0.jpg"와 같이 라벨을 나타내는 파일 이름을 가진 JPEG 파일이다. 이미지 크기는 다양하며, 일반적인 크기는 각 변이 수백 픽셀에서 천 픽셀 이상까지 이른다. 이러한 가변성은 신경망에 입력하기 전에 크기 조정 및 정규화와 같은 전처리 단계를 필요로 한다.
이 데이터셋은 클래스당 정확히 12,500개의 이미지로 균형을 이루고 있어 평가 지표를 단순화한다. 그러나 여러 동물이 포함된 이미지, 폐색, 또는 특이한 자세가 있는 이미지가 있어 분류기를 혼란시킬 수 있다는 점에서 어려움이 없는 것은 아니다. 또한 이미지가 완벽하게 선별된 것은 아니므로 잘못된 라벨이 있는 경우가 가끔 있지만, 드물다.
딥러닝 교육에서의 활용
Cats vs. Dogs는 입문용 딥러닝 강좌에서 교육 도구로 자주 사용된다. 단일 GPU에서 합리적인 시간 내에 훈련할 수 있을 만큼 작으면서도 Batch Normalization, Dropout, Learning Rate Scheduling과 같은 기법의 이점을 입증할 만큼 크다. 많은 튜토리얼에서 이 데이터셋을 사용하여 처음부터 간단한 CNN을 구성하는 방법과 Residual Network (ResNet) 아키텍처와 같은 사전 훈련된 모델을 사용한 전이 학습을 설명한다.
이 데이터셋은 또한 회전, 뒤집기, 확대/축소와 같은 변환을 적용하여 훈련 세트의 유효 크기를 늘리고 일반화를 개선하는 Data Augmentation 연습에도 적합하다. 이미지가 실제 사진이므로 합성 데이터셋보다 더 현실적인 도전 과제를 제공하며, 학생들이 강력한 전처리와 모델 튜닝의 중요성을 이해하도록 돕는다.
영향 및 유산
교육 외에도 Cats vs. Dogs는 새로운 알고리즘을 벤치마킹하고 다양한 조건에서 분류기의 동작을 연구하는 데 사용되어 왔다. 또한 추가 클래스나 더 어려운 변형이 포함된 버전과 같은 파생 데이터셋에 영감을 주었다. 이 데이터셋의 인기는 이미지 분류를 Artificial intelligence 발전을 위한 표준 테스트베드로 사용하는 광범위한 추세에 기여했다.
ImageNet과 같은 더 크고 복잡한 데이터셋이 이후 최첨단 연구의 표준이 되었지만, Cats vs. Dogs는 빠른 실험과 컴퓨터 비전의 기초를 가르치는 데 여전히 귀중한 자원으로 남아 있다. 접근성과 명확한 라벨링 덕분에 앞으로도 수년간 머신러닝 커뮤니티에서 필수 요소로 계속 사용될 것이다.