영어에서 번역됨

CIFAR-100은 100개의 클래스에 걸쳐 있는 60,000개의 저해상도 컬러 이미지로 구성된 레이블된 데이터셋으로, 머신러닝 및 컴퓨터 비전 알고리즘의 훈련과 벤치마킹에 널리 사용됩니다.

CIFAR-100은 100개의 클래스에 각각 600개의 이미지로 구성된 60,000개의 32x32 컬러 이미지 데이터셋으로, 클래스당 600개의 이미지를 포함합니다. 이는 80 Million Tiny Images 데이터셋의 레이블이 지정된 하위 집합으로, 2009년 캐나다 고등연구소(Canadian Institute For Advanced Research)의 연구자들이 발표했습니다. 이 데이터셋은 특히 딥러닝 모델과 같은 기계 학습 및 컴퓨터 비전 알고리즘을 훈련하고 평가하는 데 일반적으로 사용됩니다. 낮은 해상도 덕분에 연구자들은 더 큰 데이터셋으로 확장하기 전에 다양한 접근 방식을 빠르게 테스트할 수 있습니다.

100개의 클래스는 20개의 상위 클래스로 그룹화됩니다. 예를 들어, '수생 포유류' 상위 클래스에는 비버, 돌고래, 수달, 물개, 고래가 포함됩니다. 각 이미지에는 세부 라벨(특정 클래스)과 광범위 라벨(상위 클래스)이라는 두 가지 라벨이 있습니다. 이러한 구조는 세분화된 분류와 계층적 학습 작업을 모두 가능하게 합니다. 데이터셋은 50,000개의 훈련 이미지와 10,000개의 테스트 이미지로 나뉘며, 각 클래스는 훈련 이미지 500개와 테스트 이미지 100개를 포함합니다.

역사 및 생성

CIFAR-100은 2009년 CIFAR-10과 함께 소개되었습니다. 이미지는 웹에서 수집된 저해상도 이미지 모음인 80 Million Tiny Images 데이터셋에서 가져왔습니다. 학생들이 레이블을 지정하여 정확한 기준 진실을 보장했습니다. 이 데이터셋은 10개의 클래스만 있는 CIFAR-10보다 더 도전적인 대안을 제공하기 위해 만들어졌습니다. 클래스 수가 많을수록 분류 작업의 난이도가 높아져 CIFAR-100은 신경망 아키텍처를 평가하는 표준 벤치마크가 되었습니다.

기계 학습에서의 사용

CIFAR-100은 이미지 분류, 객체 인식, 전이 학습과 같은 작업을 위한 기계 학습 연구에서 널리 사용됩니다. 연구자들은 종종 이를 사용하여 다양한 인공지능 모델의 성능을 비교합니다. 컨볼루션 신경망(CNN)은 CIFAR-10과 유사하게 CIFAR-100에서 최상의 결과를 달성하는 경향이 있습니다. 이 데이터셋은 또한 AWS Trainium 또는 Cerebras 시스템과 같은 하드웨어에서 모델을 더 빠르고 저렴하게 훈련하기 위해 경쟁하는 팀들이 있는 컴퓨팅 효율성 벤치마킹에도 사용됩니다.

벤치마크 및 최첨단 성능

많은 연구 논문이 CIFAR-100에서 최첨단 결과를 보고하지만, 이미지 뒤집기, 이동, 증강과 같은 다양한 전처리 기술로 인해 비교가 복잡해집니다. 일부 모델은 10% 미만의 오류율을 달성하지만, 정확한 순위는 실험 설정에 따라 달라집니다. 이 데이터셋은 또한 훈련 및 추론 성능을 위한 벤치마크 제품군인 DAWNBench의 일부입니다. 최근 몇 년 동안 트랜스포머 기반 모델과 고급 CNN이 강력한 성능을 보여주었지만, 단일 아키텍처가 지배하지는 않습니다.

관련 데이터셋

CIFAR-100은 유사한 데이터셋 계열의 일부입니다. CIFAR-10은 각각 6,000개의 이미지를 가진 10개의 클래스가 있습니다. CIFAR-10H는 CIFAR-10 이미지에 대한 인간의 지각 불확실성 레이블을 제공합니다. ImageNet(ILSVRC)은 1,000개의 클래스에 걸쳐 백만 개 이상의 고해상도 이미지를 포함합니다. SVHN(Street View House Numbers) 데이터셋은 숫자의 32x32 컬러 이미지를 포함합니다. 80 Million Tiny Images 데이터셋은 두 CIFAR 변형의 소스 역할을 합니다. 이러한 데이터셋은 컴퓨터 비전딥러닝 연구를 collectively 지원합니다.

같이 보기

  • mnist-database
  • list-of-datasets-for-machine-learning-research
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:dataset·computer-vision·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사