ImageNet은 시각적 객체 인식 소프트웨어 연구에 사용되도록 설계된 대규모 시각 데이터베이스이다. 이 데이터베이스에는 무엇이 그려져 있는지를 나타내는 손으로 주석을 단 이미지가 1,400만 개 이상 포함되어 있으며, 최소 100만 개의 이미지에는 경계 상자도 제공된다. 이 데이터베이스는 20,000개 이상의 범주를 다루며, 각 범주는 일반적으로 수백 개의 이미지로 구성된다. 2010년부터 ImageNet 프로젝트는 연례 소프트웨어 대회인 ImageNet 대규모 시각 인식 챌린지(ILSVRC)를 운영해 왔으며, 여기서 소프트웨어 프로그램은 객체와 장면을 올바르게 분류하고 감지하기 위해 경쟁한다. 이 챌린지는 겹치지 않는 1,000개의 클래스로 구성된 축소된 목록을 사용한다.
이 프로젝트는 AI 연구자 페이페이 리(Fei-Fei Li)가 구상했으며, 그녀는 2006년에 이 아이디어를 작업하기 시작했다. 대부분의 AI 연구가 모델과 알고리즘에 초점을 맞추던 시기에, 리는 AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하고 개선하는 것을 목표로 했다. 2007년, 그녀는 WordNet의 창시자 중 한 명인 프린스턴 대학의 크리스티안 펠바움(Christiane Fellbaum) 교수를 만나 프로젝트에 대해 논의했다. 이로 인해 WordNet의 약 22,000개 명사를 기반으로 ImageNet을 구축하게 되었고, 그 특징 중 많은 부분을 활용했다. 리는 또한 평균적인 사람이 약 30,000가지 종류의 객체를 인식한다는 1987년의 추정치에서 영감을 받았다.
역사와 구축
프린스턴 대학의 조교수로서 리는 ImageNet 프로젝트를 작업할 연구자 팀을 구성했다. 그들은 이미지 분류를 돕기 위해 Amazon Mechanical Turk를 사용했다. 라벨링은 2008년 7월에 시작되어 2010년 4월에 끝났다. 1억 6,000만 개 이상의 후보 이미지를 필터링하고 라벨링하는 데 167개국에서 온 49,000명의 작업자가 필요했다. 예산은 1,400만 개의 각 이미지가 세 번 라벨링되도록 허용했다.
원래 계획은 40,000개 범주에 대해 범주당 10,000개 이미지, 총 4억 개 이미지로 각각 세 번 검증하는 것이었다. 그러나 인간은 초당 최대 두 개의 이미지를 분류할 수 있으며, 이 속도로는 (휴식 없이) 19인년의 노동이 걸릴 것으로 추정되었다. 팀은 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 회의(CVPR)에서 "ImageNet: 대규모 계층적 데이터셋의 미리보기"라는 제목의 포스터로 이 데이터베이스를 처음 발표했다. 이 포스터는 2009년 Vision Sciences Society에서 재사용되었다.
2009년, 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했다. 리는 2009년 PASCAL Visual Object Classes 대회에 협력을 위해 접근했으며, 이로 인해 2010년에 ImageNet 대규모 시각 인식 챌린지가 시작되었다. 이 챌린지는 1,000개 클래스와 객체 위치 파악을 특징으로 했으며, 2010년에 20개 클래스와 19,737개 이미지만 있던 PASCAL VOC와 대조되었다.
딥 러닝에 대한 중요성
2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류를 달성하여, 2위보다 10.8퍼센트 포인트 이상 낮았다. CNN을 사용하는 것은 훈련 중 그래픽 처리 장치(GPU)를 사용했기 때문에 가능했으며, 이는 딥 러닝 혁명의 필수 요소였다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티 내부뿐만 아니라 기술 산업 전반에 걸쳐 주목하기 시작했다."
2015년, AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 테스트 세트에서 3.57%의 오류로 ImageNet 2015 대회에서 우승했다. 안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실의 약 10명은 덜 노력으로 약 12-13%에 도달했다. 최대 노력으로 인간은 2.4%의 오류에 도달할 수 있다고 추정되었다.
데이터셋 구조
ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 이미지에 객체 클래스의 존재 또는 부재를 나타내며, 예를 들어 "이 이미지에 호랑이가 있다" 또는 "이 이미지에 호랑이가 없다"와 같다. 객체 수준 주석은 표시된 객체의 보이는 부분 주위에 경계 상자를 제공한다. ImageNet은 광범위한 WordNet 스키마의 변형을 사용하여 객체를 분류하며, 미세한 분류를 보여주기 위해 120개의 개 품종 범주가 추가되었다.
2012년에 ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 평균 작업자는 분당 50개의 이미지를 식별했다. 전체 ImageNet의 원래 계획은 약 5,000만 개의 깨끗하고 다양하며 전체 해상도의 이미지를 약 50,000개의 synset에 걸쳐 포함하는 것이었지만, 이는 달성되지 않았다.
2010년 4월 30일 기준 요약 통계는 다음과 같다: 비어 있지 않은 synset의 총 수: 21,841개; 이미지의 총 수: 14,197,122개; 경계 상자 주석이 있는 이미지 수: 1,034,908개; SIFT 특징이 있는 synset 수: 1,000개; SIFT 특징이 있는 이미지 수: 120만 개.
범주
ImageNet의 범주는 WordNet 개념에서 필터링되었다. 각 개념은 여러 동의어(예: "kitty"와 "young cat")를 포함할 수 있으므로 "동의어 집합" 또는 "synset"이라고 불린다. WordNet 3.0에는 100,000개 이상의 synset이 있었으며, 대부분이 명사(80,000개 이상)였다. ImageNet 데이터셋은 이를 시각적으로 설명할 수 있는 가산 명사인 21,841개의 synset으로 필터링했다.
WordNet 3.0의 각 synset에는 품사와 "오프셋"(고유 식별 번호)의 연결인 "WordNet ID"(wnid)가 있다. ImageNet은 명사만 포함하므로 모든 wnid는 "n"으로 시작한다. 예를 들어, synset "dog, domestic dog, Canis familiaris"의 wnid는 "n02084071"이다. 범주는 레벨 1(예: "mammal")부터 레벨 9(예: "German shepherd")까지 9개 레벨로 나뉜다.
이미지 형식
이미지는 여러 언어의 동의어를 사용하여 온라인 이미지 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr 등)에서 스크랩되었다. 예를 들어, 독일 셰퍼드의 경우: German police dog, Alsatian, ovejero alemán, pastore tedesco, 德国牧羊犬. ImageNet은 다양한 해상도의 RGB 형식 이미지로 구성된다. 예를 들어, ImageNet 2012 "fish" 범주에서 해상도는 4288 x 2848에서 75 x 56까지 다양하다. 기계 학습에서 이러한 이미지는 일반적으로 표준 상수 해상도로 전처리되고, 신경망에 의한 추가 처리 전에 백색화된다.
예를 들어, PyTorch에서 ImageNet 이미지는 기본적으로 픽셀 값을 0과 1 사이로 나누어 정규화한 다음 [0.485, 0.456, 0.406]을 빼고 [0.229, 0.224, 0.225]로 나눈다. 이는 ImageNet의 평균과 표준 편차이므로 입력 데이터를 백색화한다.
라벨 및 주석
각 이미지는 정확히 하나의 wnid로 라벨링된다. ImageNet-1K용 밀집 SIFT 특징(원시 SIFT 설명자, 양자화된 코드워드, 각 설명자/코드워드의 좌표)은 시각적 단어 가방을 위해 설계되어 다운로드할 수 있었다. 객체의 경계 상자는 각 synset에 평균 150개 이미지가 있는 약 3,000개의 인기 있는 synset에 대해 제공되었다. 또한 일부 이미지에는 속성 주석이 있지만, 세부 사항은 제한적이다.
유산과 영향
ImageNet은 기계 학습 및 컴퓨터 비전 연구의 벤치마크가 되었으며, 인공 지능의 발전을 주도했다. 연례 챌린지는 합성곱 신경망 및 기타 아키텍처의 혁신을 촉진하여 딥 러닝의 더 넓은 분야에 영향을 미쳤다. 데이터셋의 규모와 구조는 또한 이후의 대규모 데이터 프로젝트와 데이터 증강 기술의 개발에 정보를 제공했다.