ImageNet-1K는 ImageNet 시각 데이터베이스의 표준화된 하위 집합으로, 정확히 1,000개의 겹치지 않는 객체 클래스를 포함합니다. 이는 2010년에 시작된 ImageNet 대규모 시각 인식 챌린지(ILSVRC)의 분류 및 위치 파악 벤치마크로 도입되었습니다. 이 하위 집합은 20,000개 이상의 범주에 걸쳐 1,400만 개 이상의 수작업 주석 이미지를 보유한 더 큰 ImageNet 데이터셋에서 파생되었으며, 셀 수 있는 명사이고 시각적으로 구별되는 클래스의 축소된 목록을 선택하여 구성되었습니다. ImageNet-1K는 머신 러닝과 딥 러닝에서 중요한 기준점이 되었으며, 2010년대 신경망 아키텍처와 훈련 기법의 발전을 위한 주요 테스트베드 역할을 했습니다.
데이터셋의 이미지는 제3자 URL에서 가져온 것이며 ImageNet 자체가 소유하지 않습니다. 각 이미지는 WordNet 어휘 데이터베이스의 시넷(synset)에 해당하는 WordNet ID(wnid)로 알려진 정확히 하나의 클래스 식별자로 레이블이 지정됩니다. 범주는 동물과 식물에서 차량과 가정용품에 이르는 다양한 일상 객체를 포괄하며, 미세한 구별을 테스트하기 위한 120개의 세분화된 개 품종 클래스를 포함합니다. ImageNet-1K 이미지는 다양한 해상도의 RGB 형식이며, 일반적으로 모델에 입력되기 전에 고정 크기로 전처리되고 정규화됩니다.
역사와 제작
AI 연구자 페이페이 리(Fei-Fei Li)는 2006년에 ImageNet 프로젝트를 구상하여 AI 연구의 초점을 알고리즘에서 대규모 데이터로 전환하는 것을 목표로 했습니다. 2007년에 그녀는 WordNet 창시자인 프린스턴 대학 교수 크리스티안 펠바움(Christiane Fellbaum)을 만나 WordNet의 명사 계층을 기반으로 데이터셋을 구축하기로 결정했습니다. 프로젝트는 2008년 7월에 Amazon Mechanical Turk를 사용하여 레이블링을 시작했으며, 167개국에서 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링했습니다. 레이블링은 2010년 4월에 완료되었으며, 1,400만 개의 각 이미지는 세 번 검증되었습니다.
원래 계획은 각각 10,000개의 이미지를 가진 40,000개의 범주를 구상했지만, 초당 약 2개의 이미지를 처리하는 인간 분류 속도와 같은 실용적 제약으로 인해 범위가 축소되었습니다. 첫 공개 발표는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 컨퍼런스(CVPR)에서의 포스터였습니다. 2009년에 알렉스 버그(Alex Berg)가 객체 위치 파악을 추가할 것을 제안했고, 이는 PASCAL 시각 객체 클래스 대회와의 협력으로 이어져 2010년에 1,000개의 클래스로 ILSVRC가 시작되었습니다.
딥 러닝에서의 역할
ImageNet-1K는 2012년 9월 30일에 주목을 받았습니다. 당시 합성곱 신경망인 AlexNet이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류율을 달성하여 2위보다 10.8% 포인트 이상 우수했습니다. 이 성공은 그래픽 처리 장치(GPU)에서의 훈련에 의해 가능해졌으며, 이는 딥 러닝 혁명의 핵심 요소였습니다. 이 결과는 The Economist가 지적한 바와 같이 기술 산업 전반에 걸쳐 주목을 받았습니다.
이후 몇 년 동안 빠른 진전이 있었습니다. 2015년에는 마이크로소프트의 100개 이상의 레이어를 가진 매우 깊은 CNN이 3.57%의 오류율로 ImageNet 2015 대회에서 우승했습니다. 인간의 성능은 2014년에 안드레이 카파시(Andrej Karpathy)가 집중적인 노력으로 약 5.1%, 최대 노력으로 잠재적으로 2.4%로 추정했으며, 이는 모델이 곧 이 벤치마크에서 인간 수준의 분류에 접근하거나 초과했음을 나타냅니다. ImageNet-1K는 잔차 네트워크 아키텍처, 배치 정규화, 데이터 증강 기법과 같은 혁신을 위한 표준 평가 세트가 되었습니다.
데이터셋 구조
ImageNet-1K 범주는 80,000개 이상의 명사 시넷을 포함하는 WordNet 3.0에서 필터링됩니다. 선택 과정은 전체 ImageNet에 대해 21,841개의 시넷을 유지했으며, 1,000개 클래스 하위 집합은 ILSVRC를 위해 선택되었습니다. 각 시넷은 "n02084071"과 같은 고유한 wnid를 가지며, 이는 "개, 가정견, Canis familiaris"에 해당합니다. 범주는 "포유류"와 같은 광범위한 개념에서 "저먼 셰퍼드"와 같은 특정 품종까지 9개 수준의 계층 구조로 구성됩니다.
이미지는 Google, Picsearch, MSN, Yahoo, Flickr를 포함한 온라인 검색 엔진에서 여러 언어의 동의어를 사용하여 수집되었습니다. 예를 들어, 저먼 셰퍼드 범주는 "Alsatian" 및 "pastore tedesco"와 같은 쿼리를 사용했습니다. 해상도는 어류 범주의 4288 x 2848에서 75 x 56 픽셀까지 다양합니다. 실제로 이미지는 일정한 해상도로 크기가 조정되고 백색화됩니다. 예를 들어, PyTorch는 픽셀 값을 [0,1]로 나누고 평균 [0.485, 0.456, 0.406]을 빼고 표준 편차 [0.229, 0.224, 0.225]로 나누어 정규화합니다.
주석 및 사용
각 ImageNet-1K 이미지는 단일 클래스 레이블을 가지고 있습니다. 전체 ImageNet은 또한 약 3,000개의 인기 있는 시넷에 걸쳐 약 100만 개의 이미지에 대한 경계 상자 주석을 제공하여 객체 위치 파악 작업을 가능하게 합니다. 밀집 SIFT 특징은 1,000개 클래스 하위 집합에 대해 공개되었으며, 시각적 단어 가방 접근 방식을 위해 설계되었지만 딥 러닝의 부상으로 덜 일반화되었습니다.
2010년 요약 기준으로 ImageNet은 21,841개의 비어 있지 않은 시넷, 14,197,122개의 이미지, 1,034,908개의 경계 상자 이미지를 보유했습니다. 데이터셋의 주석은 자유롭게 사용할 수 있지만 이미지 자체는 ImageNet이 소유하지 않습니다. ImageNet-1K는 더 큰 데이터셋과 대체 벤치마크의 출현에도 불구하고 인공 지능에서 사전 훈련 및 벤치마킹에 널리 사용되고 있습니다.
유산과 영향
ImageNet-1K에서 AlexNet의 성공은 딥 러닝 붐을 촉발했으며, 컴퓨터 비전을 넘어 자연어 처리 및 대규모 언어 모델 개발과 같은 분야에 영향을 미쳤습니다. 벤치마크의 명확한 지표와 대규모 규모는 모델 아키텍처, 훈련 방법 및 하드웨어 효율성을 비교하기 위한 표준이 되었습니다. 그러나 주석 노이즈와 데이터셋의 정적 특성에 대한 우려는 비판을 불러일으켰고, 일부 연구자들은 새로운 벤치마크를 제안했습니다. 그럼에도 불구하고 ImageNet-1K는 머신 러닝 연구와 교육에서 여전히 기초적인 자원으로 남아 있습니다.