ImageNet은 시각 객체 인식 소프트웨어 연구를 위해 설계된 대규모 시각 데이터베이스이다. 이 프로젝트는 그림에 묘사된 객체를 나타내는 손으로 주석을 단 1,400만 개 이상의 이미지로 구성되며, 최소 100만 개의 이미지에는 경계 상자도 제공된다. 20,000개 이상의 범주를 포함하며, 각 범주는 일반적으로 수백 개의 이미지로 구성된다. 제3자 이미지 URL과 해당 주석의 데이터베이스는 무료로 제공되지만, 실제 이미지는 ImageNet이 소유하지 않는다. 2010년부터 ImageNet은 매년 대회인 ImageNet 대규모 시각 인식 챌린지(ILSVRC)를 개최해 왔으며, 여기서 소프트웨어 프로그램은 1,000개의 겹치지 않는 클래스로 구성된 축소된 목록을 사용하여 객체와 장면을 분류하고 감지하기 위해 경쟁한다.
이 프로젝트는 AI 연구자 페이페이 리(Fei-Fei Li)의 비전에서 시작되었으며, 그녀는 2006년에 이 아이디어를 작업하기 시작하여 AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하고 개선하는 것을 목표로 했다. 당시 대부분의 AI 연구는 모델과 알고리즘에 초점을 맞추었지만, 리는 데이터 병목 현상을 해결하고자 했다. 2007년에 리는 WordNet의 창시자 중 한 명인 프린스턴 대학 교수 크리스티안 펠바움(Christiane Fellbaum)을 만났고, 이후 WordNet의 약 22,000개 명사를 기반으로 ImageNet을 구축하며 그 기능 중 많은 부분을 통합했다. 리는 또한 평균적인 사람이 약 30,000가지 종류의 객체를 인식한다는 1987년 추정치에서 영감을 얻었다. 프린스턴 대학의 조교수로서 리는 연구 팀을 구성하고 Amazon Mechanical Turk를 사용하여 이미지 분류를 지원했다. 라벨링은 2008년 7월에 시작되어 2010년 4월에 끝났으며, 167개국에서 온 49,000명의 작업자가 1억 6,000만 개 이상의 후보 이미지를 필터링하고 라벨링했으며, 1,400만 개의 각 이미지를 세 번 라벨링할 수 있는 충분한 예산이 있었다.
이 데이터베이스는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 학회(CVPR)에서 "ImageNet: 대규모 계층적 데이터셋 미리보기"라는 제목의 포스터로 처음 발표되었다. 2009년에 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했고, 이는 PASCAL 시각 객체 클래스 대회와의 협력으로 이어져 2010년에 ImageNet 대규모 시각 인식 챌린지가 시작되었으며, 이는 1,000개의 클래스와 객체 위치 파악을 특징으로 하여 2010년 PASCAL VOC의 20개 클래스와 19,737개 이미지보다 훨씬 많았다.
데이터셋 구축
ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 이미지에 객체 클래스의 존재 여부를 나타내며, 예를 들어 "이 이미지에 호랑이가 있다" 또는 "이 이미지에 호랑이가 없다"와 같다. 객체 수준 주석은 표시된 객체의 보이는 부분 주위에 경계 상자를 제공한다. ImageNet은 객체를 분류하기 위해 광범위한 WordNet 스키마의 변형을 사용하며, 세밀한 분류를 위해 120개의 개 품종 범주가 추가된다. 2012년에 ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 평균 작업자는 분당 50개의 이미지를 식별했다. 전체 ImageNet의 원래 계획은 약 50,000개의 synset에 걸쳐 약 5,000만 개의 깨끗하고 다양하며 전체 해상도의 이미지였지만, 이는 달성되지 않았다.
2010년 4월 30일 기준 요약 통계:
- 비어 있지 않은 synset의 총 수: 21,841
- 이미지의 총 수: 14,197,122
- 경계 상자 주석이 있는 이미지 수: 1,034,908
- SIFT 특징이 있는 synset 수: 1,000
- SIFT 특징이 있는 이미지 수: 120만
범주 및 이미지 형식
ImageNet의 범주는 WordNet 개념에서 필터링되었다. 동의어를 포함할 수 있는 각 개념은 "동의어 집합" 또는 "synset"이라고 불린다. WordNet 3.0에는 100,000개 이상의 synset이 있었지만, 대부분 명사(80,000개 이상)였으며, ImageNet은 시각적으로 설명할 수 있는 가산 명사의 수를 21,841개의 synset으로 집중시켰다. 각 synset에는 WordNet ID(wnid)가 있으며, 이는 품사와 오프셋의 연결이다. 모든 wnid는 ImageNet이 명사만 포함하므로 "n"으로 시작한다. 예를 들어, "개, 가정견, Canis familiaris"의 wnid는 "n02084071"이다. 범주는 "포유류"와 같은 수준 1부터 "저먼 셰퍼드"와 같은 수준 9까지 9개 수준에 걸쳐 있다.
이미지는 다국어 동의어를 사용하여 온라인 이미지 검색에서 스크래핑되었다. 다양한 해상도의 RGB 형식으로 제공된다. 예를 들어, ImageNet 2012 "물고기" 범주에서 해상도는 4288 x 2848에서 75 x 56까지 다양하다. 기계 학습에서 이러한 이미지는 일반적으로 훈련 전에 표준 일정 해상도로 전처리되고 백색화된다. 예를 들어, PyTorch에서 이미지는 픽셀 값을 0과 1 사이로 나누어 정규화한 다음 평균 [0.485, 0.456, 0.406]을 빼고 표준 편차 [0.229, 0.224, 0.225]로 나눈다. 이러한 통계는 ImageNet에서 파생된다.
라벨 및 주석
각 이미지는 정확히 하나의 wnid로 라벨링된다. ImageNet-1K의 밀집 SIFT 특징(원시 SIFT 설명자, 양자화된 코드워드 및 좌표 포함)은 다운로드할 수 있었으며, 단어 가방 접근 방식용으로 설계되었다. 객체의 경계 상자는 약 3,000개의 synset에 대해 제공되었으며, 각각 평균 150개의 이미지가 있었다. 일부 이미지에는 속성 주석이 있지만, 세부 사항은 완전히 지정되지 않았다. 데이터셋에는 120만 개의 이미지에 대한 SIFT 특징이 있는 일부 synset도 포함된다.
딥러닝에 대한 중요성
ImageNet은 딥러닝 혁명에서 중추적인 역할을 했다. 2012년 9월 30일, AlexNet이라는 합성곱 신경망이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류율을 달성하여 준우승자보다 10.8% 포인트 이상 낮았다. 이 성공은 훈련 중 그래픽 처리 장치(GPU) 사용으로 가능해졌으며, 이는 딥러닝 혁명의 필수 요소가 되었다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에서 주목하기 시작했다." 2015년에 AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 2014년에 안드레이 카파시(Andrej Karpathy)는 집중적인 노력으로 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실에서 약 10명이 덜 노력으로 약 12-13%에 도달했다. 최대 노력으로 인간은 약 2.4%의 오류에 도달할 수 있다고 추정되었다.
ImageNet의 영향은 대회 자체를 훨씬 넘어선다. 크고 구조화된 라벨링된 데이터셋의 가용성은 연구자들이 전례 없는 규모와 다양성으로 모델을 훈련하고 벤치마킹할 수 있게 했다. 이는 Deep learning 혁신과 같은 신경망, 잔차 네트워크, 그리고 Data Augmentation 및 Batch Normalization과 같은 기술의 채택을 주도했다. 또한 기계 학습 및 인공 지능의 발전을 가속화했으며, 분류 및 위치 파악과 같은 벤치마크 작업은 컴퓨터 비전 시스템 평가의 기초가 되었다. WordNet을 통한 데이터셋의 구성은 다른 대규모 데이터셋과 PyTorch 및 기타 프레임워크의 표준 워크플로우에 영향을 미쳤다.
ImageNet의 공개 가용성은 더 넓은 영향도 미쳤다. 이는 Google DeepMind, OpenAI, 및 Microsoft를 포함한 많은 연구 그룹과 기업에서 모델을 훈련하고 평가하는 데 사용되었다. 그 영향은 이후 언어 모델링에서 표준이 된 Transformer (architecture) 아키텍처의 개발로 확장된다. 최근 몇 년 동안 ImageNet은 컴퓨터 비전 연구의 필수 참고 자료로 남아 있지만, 제3자 이미지 사용으로 인해 저작권 및 개인 정보 보호에 대한 논의도 촉발했다. 이러한 우려에도 불구하고, ImageNet의 규모와 구조는 ImageNet과 같은 다른 도메인의 유사한 데이터셋에 계속 영감을 주고 있지만, 초점은 원래 ImageNet과 시각 인식 발전에서의 역할에 남아 있다.
출처 및 영향
요약하면, ImageNet의 창조는 인공 지능 역사에서 획기적인 사건이었다. 이는 데이터 중심 접근 방식의 중요성을 강조한 포괄적이고 확장 가능한 데이터셋을 제공했다. 딥러닝 붐에 대한 그 영향은 과장할 수 없으며, 이는 생성 AI 및 대규모 모델의 현재 시대를 가능하게 한 알고리즘과 하드웨어의 돌파구를 가능하게 했다. 2025년 현재 ImageNet은 트랜스포머, 대규모 언어 모델, 및 기반 모델과 관련된 새로운 방법과 이론을 평가하기 위한 벤치마크로 여전히 사용된다. 이 프로젝트의 풀뿌리 접근 방식 - 글로벌 커뮤니티를 통한 주석 크라우드소싱 - 은 이후 많은 데이터셋과 이니셔티브의 모델을 확립했다.
ImageNet의 성공은 고품질의 대규모 데이터셋이 AI 발전에 유익할 뿐만 아니라 종종 필수적임을 입증했다. 이는 Amazon Web Services 및 Google Cloud와 같은 분산 컴퓨팅 및 클라우드 서비스의 발전과 NVIDIA 및 AMD**와 같은 회사의 하드웨어 개선을 촉발했다. 대회 자체인 ImageNet 대규모 시각 인식 챌린지는 컴퓨터 비전의 진전을 측정하는 기관으로 남아 있다. AI의 지속적인 진화에도 불구하고, ImageNet의 유산은 학술 연구에서 자율 주행 차량, 의료 영상 및 다중 모달 시스템의 실제 배포에 이르기까지 지속되며, 기호 AI에서 신경망 및 기계 학습으로의 분야 궤적을 형성한다. 출시 후 몇 년 동안 ImageNet은 COCO 및 Flickr와 같은 후속 데이터셋의 설계에 영향을 미쳤으며, 이는 기계 지능의 경계를 발전시키기 위한 대규모 주석 데이터를 제공하는 것을 유사하게 목표로 한다.