CIFAR-10 데이터셋(Canadian Institute For Advanced Research)은 머신러닝 및 컴퓨터 비전 알고리즘을 훈련하고 평가하는 데 사용되는 60,000개의 저해상도 컬러 이미지 모음이다. 2009년에 발표된 이후 이 분야에서 가장 널리 사용되는 벤치마크 중 하나가 되었으며, 연구자들이 객체 인식에 대한 다양한 접근 방식을 신속하게 테스트할 수 있게 해준다. 이 데이터셋은 32x32 픽셀 이미지로 구성되며 10개 클래스(비행기, 자동차, 새, 고양이, 사슴, 개, 개구리, 말, 배, 트럭)로 나뉘고, 클래스당 6,000개의 이미지가 포함된다.
CIFAR-10은 2008년의 80 Million Tiny Images 데이터셋의 레이블이 지정된 하위 집합이다. 데이터셋이 생성될 당시 학생들이 모든 이미지에 레이블을 붙이는 작업을 유급으로 수행했다. 이미지가 저해상도이기 때문에 이 데이터셋은 다양한 알고리즘으로 빠른 실험을 가능하게 하며, 머신러닝 및 인공지능 분야에서 새로운 기법을 개발하는 연구자들의 표준 출발점이 되었다.
데이터셋 구조
60,000개의 이미지는 일반적으로 50,000개의 훈련 이미지와 10,000개의 테스트 이미지로 나뉜다. 각 이미지는 3개 채널(빨강, 초록, 파랑)을 가진 32x32 컬러 사진으로, 이미지당 총 3,072픽셀에 해당한다. 10개 클래스는 상호 배타적이며, 각 이미지는 정확히 하나의 범주에 속한다. 작은 이미지 크기는 CIFAR-10을 평균 469x387 해상도의 이미지를 포함하는 ImageNet과 같은 고해상도 데이터셋과 구별짓는 특징이다.
머신러닝 연구에서의 역할
사진 속 객체를 인식하는 컴퓨터 알고리즘은 종종 예제를 통해 학습하며, CIFAR-10은 이러한 목적을 위한 표준화된 예제 집합을 제공한다. 다양한 종류의 합성곱 신경망이 CIFAR-10의 이미지를 인식하는 데 가장 뛰어난 성능을 보이는 경향이 있다. 이 데이터셋은 초기 얕은 신경망에서 잔차 연결과 주의 메커니즘을 갖춘 현대적 아키텍처에 이르기까지 딥러닝의 발전을 추적하는 데 중요한 역할을 해왔다.
CIFAR-10에서 최첨단 성능을 주장하는 연구 논문은 출시 이후 꾸준히 등장해 왔다. 그러나 모든 논문이 이미지 뒤집기나 이미지 이동과 같은 동일한 전처리 기법을 표준화한 것은 아니다. 따라서 한 논문의 최첨단 성능 주장은 이전 주장보다 더 높은 오류율을 가질 수 있지만, 다른 전처리 조건에서는 여전히 유효할 수 있다.
벤치마크 및 성능
알고리즘 개발 외에도 CIFAR-10은 신경망을 더 빠르고 저렴하게 실행하기 위해 경쟁하는 팀들의 성능 벤치마크로 사용된다. 예를 들어 DAWNBench 대회는 다양한 하드웨어 및 소프트웨어 스택에서의 훈련 시간과 비용을 비교하는 벤치마크 데이터를 웹사이트에 제공한다. 이러한 사용은 데이터셋을 Google Cloud, Amazon Web Services, Azure와 같은 기업들의 광범위한 인프라 노력과 연결한다.
유사 데이터셋
CIFAR-10을 확장하거나 보완하는 여러 관련 데이터셋이 있다. CIFAR-100은 유사하지만 100개 클래스에 각각 600개의 이미지를 포함한다. CIFAR-10H는 인간의 지각적 불확실성으로 레이블이 지정된 버전이다. ImageNet(ILSVRC) 데이터셋은 더 높은 해상도의 1,000개 클래스에 걸친 100만 개의 컬러 이미지를 포함한다. Street View House Numbers(SVHN) 데이터셋은 10개 클래스(숫자 0-9)의 약 600,000개 이미지를 32x32 해상도로 제공한다. 80 Million Tiny Images 데이터셋은 CIFAR-10이 파생된 상위 집합 역할을 한다.
같이 보기
- 머신러닝 연구용 데이터셋 목록
- MNIST 데이터베이스
참고 문헌
- CIFAR-10 페이지 - 데이터셋의 공식 홈페이지
- Canadian Institute For Advanced Research