ImageNet은 시각 객체 인식 소프트웨어 연구에 사용하도록 설계된 대규모 시각 데이터베이스이다. 1,400만 개 이상의 수작업 주석 이미지와 20,000개 이상의 범주를 포함하며, 각 범주는 일반적으로 수백 개의 이미지로 구성된다. 최소 1백만 개의 이미지에는 경계 상자 주석이 포함되어 있다. 주석 및 제3자 이미지 URL 데이터베이스는 무료로 제공되지만, 실제 이미지의 소유권은 ImageNet에 있지 않다. 2010년부터 이 프로젝트는 연례 소프트웨어 대회인 ImageNet 대규모 시각 인식 챌린지(ILSVRC)를 개최해 왔으며, 여기서 프로그램들은 1,000개의 겹치지 않는 클래스로 구성된 축소된 목록을 사용하여 객체와 장면을 분류하고 탐지하기 위해 경쟁한다.
이 프로젝트는 AI 연구자 페이페이라(Fei-Fei Li)의 비전에서 시작되었으며, 그녀는 대부분의 연구가 모델과 알고리즘에 집중되던 시기에 AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하고자 했다. ImageNet은 이후 딥러닝 혁명의 초석이 되어 컴퓨터 비전의 돌파구를 가능하게 했고, 더 넓은 인공지능 분야에 영향을 미쳤다.
역사
페이페이라 리는 2006년에 ImageNet에 대한 아이디어를 구상하기 시작했다. 2007년, 그녀는 WordNet의 창시자 중 한 명인 프린스턴 대학의 크리스티안 펠바움(Christiane Fellbaum) 교수를 만나 프로젝트에 대해 논의했다. 이 만남을 통해 리는 WordNet의 약 22,000개 명사를 기반으로 ImageNet을 구축하고 그 기능 중 상당수를 활용하게 되었다. 그녀는 또한 평균적인 사람이 약 30,000가지의 서로 다른 종류의 객체를 인식한다는 1987년의 추정치에서 영감을 얻었다.
프린스턴 대학의 조교수로 재직하는 동안, 리는 프로젝트를 위해 연구원 팀을 구성했다. 그들은 이미지 분류를 돕기 위해 Amazon Mechanical Turk를 사용했다. 라벨링은 2008년 7월에 시작되어 2010년 4월에 끝났으며, 167개국에서 온 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링하고 라벨링했다. 예산 덕분에 1,400만 개의 각 이미지를 세 번 라벨링할 수 있었다.
원래 계획은 40,000개 범주에 대해 범주당 10,000개의 이미지, 총 4억 개의 이미지를 각각 세 번 검증하는 것이었다. 그러나 인간은 초당 최대 2개의 이미지를 분류할 수 있으며, 그 속도로는 휴식 없이 19인년(人年)의 노동이 필요할 것으로 추정되었다. 전체 계획은 달성되지 못했다.
이 데이터베이스는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 학회(CVPR)에서 "ImageNet: 대규모 계층적 데이터셋 미리보기"라는 제목의 포스터로 처음 발표되었다. 이 포스터는 2009년 Vision Sciences Society에서 재사용되었다.
2009년, 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했다. 리는 협업을 위해 PASCAL Visual Object Classes 대회에 접근했고, 그 결과 2010년에 ImageNet 대규모 시각 인식 챌린지가 시작되었다. 이 챌린지는 1,000개의 클래스와 객체 위치 파악을 포함했으며, 2010년 PASCAL VOC는 단 20개의 클래스와 19,737개의 이미지만을 보유했다.
딥러닝에 대한 중요성
2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류율을 달성하여 준우승자보다 10.8% 포인트 이상 낮은 성능을 기록했다. 훈련 중 그래픽 처리 장치(GPU)를 사용한 것이 이를 가능하게 했으며, 이는 딥러닝 혁명의 필수 요소였다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에 걸쳐 주목하기 시작했다."
2015년, AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 초심층 CNN에 의해 성능이 추월당했으며, 이는 테스트 세트에서 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력을 기울이면 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실의 약 10명은 적은 노력으로 약 12-13%에 도달했다. 최대한의 노력을 기울이면 인간이 2.4%에 도달할 수 있을 것으로 추정되었다.
이러한 결과는 딥러닝 및 신경망 아키텍처의 강력함을 입증했으며, 기술 산업 전반에 걸쳐 머신러닝 기술의 채택을 가속화했다.
데이터셋
ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 이미지에 객체 클래스의 존재 여부를 나타내며, 예를 들어 "이 이미지에 호랑이가 있다" 또는 "이 이미지에 호랑이가 없다"와 같다. 객체 수준 주석은 표시된 객체의 보이는 부분 주위에 경계 상자를 제공한다. ImageNet은 객체를 분류하기 위해 광범위한 WordNet 스키마의 변형을 사용하며, 세밀한 분류를 보여주기 위해 120개의 개 품종 범주가 추가되었다.
2012년에 ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였다. 평균 작업자는 분당 50개의 이미지를 식별했다.
2010년 4월 30일에 제공된 요약 통계:
- 비어 있지 않은 synset의 총 수: 21,841
- 이미지의 총 수: 14,197,122
- 경계 상자 주석이 있는 이미지 수: 1,034,908
- SIFT 특징이 있는 synset 수: 1,000
- SIFT 특징이 있는 이미지 수: 1.2백만
범주
ImageNet의 범주는 WordNet 개념에서 필터링되었다. 각 개념은 여러 동의어(예: "kitty"와 "young cat")를 포함할 수 있으므로 "동의어 집합" 또는 "synset"이라고 한다. WordNet 3.0에는 100,000개 이상의 synset이 있으며, 대부분이 명사(80,000개 이상)이다. ImageNet 데이터셋은 이를 시각적으로 설명할 수 있는 셀 수 있는 명사인 21,841개의 synset으로 필터링했다.
WordNet 3.0의 각 synset에는 품사와 "오프셋"(고유 식별 번호)의 연결인 "WordNet ID"(wnid)가 있다. ImageNet은 명사만 포함하므로 모든 wnid는 "n"으로 시작한다. 예를 들어, synset "dog, domestic dog, Canis familiaris"의 wnid는 "n02084071"이다.
ImageNet의 범주는 "포유류"와 같은 수준 1에서 "저먼 셰퍼드"와 같은 수준 9까지 9개 수준으로 나뉜다.
이미지 형식
이미지는 여러 언어의 동의어를 사용하여 온라인 이미지 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr 등)에서 스크래핑되었다. 예를 들어, 저먼 셰퍼드의 경우 검색어에는 "German police dog", "Alsatian", "ovejero alemán", "pastore tedesco", "德国牧羊犬" 등이 포함되었다.
ImageNet은 다양한 해상도의 RGB 형식 이미지로 구성된다. 예를 들어, ImageNet 2012에서 "물고기" 범주의 해상도는 4288 x 2848에서 75 x 56까지 다양하다. 머신러닝에서 이러한 이미지는 일반적으로 신경망에 의한 추가 처리를 위해 표준 상수 해상도로 전처리되고 백색화된다. 예를 들어, PyTorch에서 ImageNet 이미지는 픽셀 값을 0과 1 사이로 나눈 다음 [0.485, 0.456, 0.406]을 빼고 [0.229, 0.224, 0.225]로 나누어 정규화된다. 이는 ImageNet의 평균과 표준 편차이므로 입력 데이터를 백색화한다.
라벨 및 주석
각 이미지는 정확히 하나의 wnid로 라벨링된다. ImageNet-1K용 Dense SIFT 특징(원시 SIFT 설명자, 양자화된 코드워드, 각 설명자/코드워드의 좌표)은 시각적 단어 가방을 위해 설계되어 다운로드할 수 있었다. 객체의 경계 상자는 각 synset에 평균 150개의 이미지가 있는 약 3,000개의 인기 있는 synset에 대해 제공되었다. 또한 일부 이미지에는 속성 주석이 있지만, 이에 대한 전체 범위는 여기서 자세히 설명되지 않는다.
유산
ImageNet의 창설은 AI에서 데이터 중심 접근 방식으로의 전환을 의미하며, 이후의 데이터셋과 벤치마크에 영향을 미쳤다. 연례 챌린지는 컴퓨터 비전의 진전을 측정하는 표준이 되었으며, 그 성공은 생성형 AI 및 기타 AI 애플리케이션의 성장을 촉진했다. 이 데이터셋은 모델을 훈련하고 평가하기 위한 기초 자원으로 남아 있으며, 그 영향은 자율 주행 및 의료 영상과 같은 분야로 확장된다.
성과에도 불구하고 ImageNet은 편향성과 주석 품질에 대한 의문을 제기했으며, AI 커뮤니티에서 데이터셋 큐레이션과 윤리에 대한 논의를 촉발했다. 그럼에도 불구하고 현대 AI 개발에서의 역할은 논쟁의 여지가 없으며, 연구와 산업에서 계속 널리 사용되고 있다.