ImageNet-Sketch는 2019년에 도입된 벤치마크 데이터셋으로, 이미지 분류 모델이 서로 다른 시각적 도메인으로 얼마나 잘 일반화되는지 테스트하기 위해 만들어졌습니다. 이 데이터셋은 50,000개의 흑백 스케치 이미지로 구성되어 있으며, 원본 ImageNet 데이터셋의 1,000개 클래스 각각에 대해 50개의 이미지를 포함합니다. 스케치는 "[클래스 이름]의 스케치"와 같은 검색어로 Google 이미지 검색에서 수집되었으며, 의도된 대상을 묘사하는지 확인하기 위해 수동으로 필터링되었습니다. 자연 사진과 달리 이러한 이미지는 추상적인 선 그림으로, 종종 세부 정보가 최소화되어 있어 표준 사진 데이터셋으로 훈련된 모델에게 도전적인 도메인 이동 테스트를 제공합니다.
이 데이터셋은 캘리포니아 대학교 버클리 캠퍼스의 연구자들(Haohan Wang, Songwei Ge, Zachary Lipton, Eric Xing)에 의해 만들어졌습니다. 2019년 신경 정보 처리 시스템 컨퍼런스(NeurIPS)에서 발표된 "Learning Robust Global Representations by Penalizing Local Predictive Power"라는 제목의 논문과 함께 공개되었습니다. 주요 동기는 분포 이동, 특히 실제 세계 이미지에서 추상적인 인간 스케치로의 이동에 대한 모델의 견고성을 평가하는 간단하면서도 효과적인 프로브를 제공하는 것이었습니다. ImageNet-Sketch는 이후 Machine learning 및 Deep learning 분야에서 표준 평가 세트가 되었으며, ImageNet-C 및 ImageNet-R과 같은 다른 견고성 벤치마크와 함께 자주 사용됩니다.
Construction and Characteristics
구축 과정은 1,000개의 ImageNet 클래스 각각에 대해 "sketch of [class]" 패턴으로 Google 이미지 검색을 쿼리하는 것을 포함했습니다. 반환된 이미지는 사진이나 다이어그램과 같은 비스케치 이미지를 제거하고 각 클래스에 최소 50개의 유효한 스케치가 있는지 확인하기 위해 필터링되었습니다. 최종 데이터셋은 클래스당 정확히 50개의 이미지를 포함하여 총 50,000개의 이미지로 구성됩니다. 모든 이미지는 Neural network 분류기의 표준 입력 크기와 일치하도록 일반적으로 224x224 픽셀의 일관된 해상도로 크기가 조정됩니다.
ImageNet-Sketch의 주요 특징은 자연 이미지보다 본질적으로 더 추상적이고 덜 사실적인 인간이 그린 스케치에 의존한다는 점입니다. 이러한 스케치는 종종 색상, 질감 및 미세한 세부 정보를 생략하여 모델이 전역적인 모양과 구조적 단서에 의존하도록 강제합니다. 이는 모델이 견고하고 일반화 가능한 특징을 학습했는지 또는 자연 이미지의 표면적인 통계에 과적합되었는지 연구하는 데 특히 유용합니다.
Role in Robustness Evaluation
ImageNet-Sketch는 도메인 이동 하에서 이미지 분류기의 견고성을 측정하는 데 널리 사용됩니다. ImageNet에서 훈련된 모델은 ImageNet-Sketch에서 평가할 때 정확도가 크게 떨어지는 경우가 많으며, 자연 이미지에서 약 70-80%의 top-1 정확도에서 스케치에서 20-30%로 떨어집니다. 이러한 성능 격차는 많은 Deep learning 모델이 분포 외 입력에 직면했을 때 취약함을 강조합니다.
이 데이터셋은 종종 견고성 리더보드와 연구에 포함됩니다. 예를 들어, ImageNet-C 및 ImageNet-P 손상 벤치마크의 핵심 구성 요소이지만, 합성 손상이 아닌 자연적이고 인간이 만든 도메인 이동을 나타낸다는 점에서 구별됩니다. 연구자들은 Data Augmentation 전략, 적대적 훈련, Residual Network (ResNet) 변형과 같은 아키텍처 변경과 같은 다양한 견고성 기술의 효과를 평가하기 위해 ImageNet-Sketch를 사용했습니다. 또한 모델의 내부 표현을 조사하는 데 사용되어 많은 모델이 전역적인 모양보다는 질감과 지역적 패턴에 크게 의존하며, 스케치가 이를 방해한다는 것을 밝혀냈습니다.
Relationship to Other Benchmarks
ImageNet-Sketch는 ImageNet-R(그림과 만화와 같은 예술적 렌디션 포함) 및 ImageNet-A(자연적으로 발생하는 적대적 예제 포함)와 같은 다른 도메인 이동 데이터셋을 보완합니다. ImageNet-R이 다양한 예술 스타일을 포함하는 반면, ImageNet-Sketch는 특히 선 그림에 초점을 맞춰 모양 기반 인식에 대한 더 깨끗한 테스트를 제공합니다. 이 데이터셋은 Sketchy 데이터셋 및 TU-Berlin 스케치 데이터셋과도 관련이 있지만, 규모와 ImageNet 클래스와의 직접적인 정렬에서 독특합니다.
Artificial intelligence 연구의 더 넓은 맥락에서 ImageNet-Sketch는 현재 모델의 한계를 강조하고 견고하고 일반화 가능한 학습에 대한 관심을 높이는 데 중요한 역할을 했습니다. 도메인 일반화, 자기 지도 학습 및 모델 해석 가능성에 관한 논문에서 자주 인용됩니다. 2025년 현재, 이는 컴퓨터 비전의 표준 평가 도구로 남아 있으며, 많은 최첨단 모델이 이 벤치마크에서의 성능을 보고합니다.
Limitations and Criticisms
ImageNet-Sketch의 한 가지 한계는 스케치가 웹 검색에서 수집되어 스타일이나 내용에 편향이 도입될 수 있다는 점입니다. 예를 들어, 일부 클래스는 다른 클래스보다 더 다양한 스케치 스타일을 가질 수 있으며, 필터링 과정에서 순수한 스케치가 아닌 이미지가 우연히 포함될 수 있습니다. 또한 데이터셋은 정적이므로 시간이 지남에 따라 진화하는 스케치 스타일을 포착하지 못합니다. 이러한 문제에도 불구하고 단순성과 사용 용이성으로 인해 연구자들에게 인기 있는 선택이 되었습니다.
또 다른 비판은 ImageNet-Sketch의 성능 저하가 스케치가 극단적인 추상화이기 때문에 실제 세계의 도메인 이동을 완전히 반영하지 못할 수 있다는 점입니다. 그러나 이러한 극단성은 바로 데이터셋을 스트레스 테스트에 가치 있게 만드는 이유입니다. 이는 연구자들이 픽셀 패턴을 암기하는 것을 넘어 더 추상적이고 전이 가능한 표현을 학습하는 방법을 개발하도록 강제합니다.
Usage in Research and Industry
학술 연구에서 ImageNet-Sketch는 종종 새로운 아키텍처와 훈련 방법을 벤치마킹하는 데 사용됩니다. 예를 들어, 비전 트랜스포머와 컨볼루션 네트워크에 대한 연구는 견고성을 입증하기 위해 이 데이터셋의 결과를 자주 보고합니다. 또한 다양한 데이터에 대한 사전 훈련이 이러한 분포 외 세트의 성능을 향상시킬 것으로 기대되는 기반 모델 개발에도 사용됩니다. 산업계에서는 자율 주행이나 의료 영상과 같은 이미지 인식 시스템을 작업하는 회사가 모델 일반화의 건전성 검사로 ImageNet-Sketch를 사용할 수 있지만, 연구 환경에서 더 일반적입니다.
이 데이터셋은 공개적으로 다운로드할 수 있으며, 사용은 비상업적 연구 사용을 허용하는 원본 ImageNet 약관의 적용을 받습니다. 수천 개의 논문에서 인용되어 이 분야에서 가장 영향력 있는 견고성 벤치마크 중 하나가 되었습니다. 2025년 현재, 특히 커뮤니티가 다양하고 예측할 수 없는 환경에서 신뢰할 수 있는 모델을 구축하는 데 초점을 맞추면서 계속해서 관련성 있고 널리 사용되는 리소스입니다.
Future Directions
앞으로 연구자들은 ImageNet-Sketch를 3D 스케치나 애니메이션 그림과 같은 다른 도메인으로 확장하고 더 세분화된 클래스로 더 도전적인 버전을 만드는 방법을 모색하고 있습니다. 또한 평가만 하는 것이 아니라 본질적으로 더 견고한 모델을 훈련하는 데 데이터셋을 사용하는 데에도 관심이 있습니다. 예를 들어, 일부 연구는 모양 편향을 개선하기 위해 훈련 세트에 스케치 데이터를 통합하는 것을 탐구했으며, 이는 다른 도메인 이동에서 더 나은 일반화로 이어질 수 있습니다. 이 데이터셋은 진정으로 견고한 Artificial intelligence 시스템을 달성하기 위한 지속적인 노력의 초석으로 남아 있습니다.