ImageNet Challenge(공식 명칭: ImageNet Large Scale Visual Recognition Challenge, ILSVRC)은 프로그램이 이미지 속 객체와 장면을 올바르게 분류하고 탐지하기 위해 경쟁하는 연례 소프트웨어 대회이다. 2010년에 시작되었으며, 2만 개 이상의 범주에 걸쳐 1,400만 개 이상의 수작업 주석 이미지를 포함하는 더 큰 ImageNet 데이터베이스에서 추출된 1,000개의 비중복 클래스 목록을 사용한다. 이 대회는 컴퓨터 비전 분야의 중추적 벤치마크가 되었으며, 2012년 이후 딥러닝 혁명을 촉발했다.
역사
AI 연구자 페이페이 리(Fei-Fei Li)는 2006년에 ImageNet 개념을 개발하기 시작했으며, 대부분의 연구가 모델에 초점을 맞추던 시기에 AI 알고리즘 훈련에 사용할 데이터를 확장하는 것을 목표로 했다. 2007년, 리는 WordNet의 창시자 중 한 명인 프린스턴 대학의 크리스티안 펠바움(Christiane Fellbaum) 교수를 만나 WordNet의 약 2만 2,000개 명사를 기반으로 ImageNet을 구축했다. 그녀는 평균적인 사람이 약 3만 종류의 객체를 인식한다는 1987년의 추정치에서 영감을 얻었다.
프린스턴 대학의 조교수로서 리는 아마존 Mechanical Turk를 이미지 분류에 사용하는 팀을 구성했다. 라벨링 작업은 2008년 7월부터 2010년 4월까지 진행되었으며, 167개국에서 4만 9,000명의 작업자가 참여하여 1억 6,000만 개 이상의 후보 이미지를 필터링하고 라벨링했다. 1,400만 개의 각 이미지는 세 번 라벨링되었다. 원래 계획은 4만 개 범주에 걸쳐 범주당 1만 개의 이미지를 목표로 했지만, 이는 달성되지 못했다.
이 데이터베이스는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 학회(CVPR)에서 "ImageNet: A Preview of a Large-scale Hierarchical Dataset"이라는 제목의 포스터로 처음 발표되었다. 2009년, 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했고, 이는 PASCAL Visual Object Classes 대회와의 협력으로 이어졌다. 2010년 첫 ImageNet Challenge는 1,000개 클래스와 객체 위치 파악을 포함했으며, PASCAL VOC의 20개 클래스와 1만 9,737개 이미지와 비교되었다.
딥러닝에 대한 중요성
2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 Challenge에서 15.3%의 top-5 오류율을 달성하여 준우승자보다 10.8% 포인트 이상 낮은 성과를 냈다. 이 성공은 딥러닝 혁명의 필수 요소인 그래픽 처리 장치(GPU) 훈련에 의해 가능해졌다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에서 주목하기 시작했다."
2015년, AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 테스트 세트에서 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 안드레이 카르파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1%의 오류율에 도달할 수 있고, 최대한의 노력으로 인간이 2.4%에 도달할 수 있다고 추정했다.
데이터셋
ImageNet은 주석 과정을 크라우드소싱한다. 이미지 수준 주석은 객체 클래스의 존재 여부를 나타내며, 객체 수준 주석은 경계 상자를 제공한다. 데이터셋은 세분화된 분류를 위해 120개의 개 품종 범주가 추가된 WordNet 스키마의 변형을 사용한다.
2010년 4월 30일 기준으로 ImageNet은 2만 1,841개의 비어 있지 않은 synset, 1,419만 7,122개의 이미지, 103만 4,908개의 경계 상자 주석 이미지, 120만 개의 SIFT 특징 이미지를 보유했다. 2012년, ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 작업자는 분당 평균 50개의 이미지를 식별했다.
범주
범주는 WordNet 개념에서 필터링되며, 각각 "synset"(동의어 집합)이라고 한다. ImageNet은 시각적으로 설명 가능한 가산 명사인 2만 1,841개의 synset을 포함한다. 각 synset은 "n"으로 시작하는 WordNet ID(wnid)를 가진다(예: "개"의 경우 "n02084071"). 범주는 레벨 1(예: "포유류")부터 레벨 9(예: "저먼 셰퍼드")까지 9개 레벨로 나뉜다.
이미지 형식
이미지는 여러 언어의 동의어를 사용하여 온라인 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr)에서 수집되었다. 이미지는 다양한 해상도의 RGB 형식이다. 예를 들어, ImageNet 2012에서 "물고기" 범주는 4288 x 2848에서 75 x 56 픽셀까지 다양하다. 머신러닝에서 이미지는 일반적으로 표준 해상도로 전처리되고 백색화된다. 예를 들어, PyTorch에서 이미지는 픽셀 값을 [0,1]로 나누고, [0.485, 0.456, 0.406]을 빼고, [0.229, 0.224, 0.225]로 나누어 정규화된다.
라벨 및 주석
각 이미지는 정확히 하나의 wnid로 라벨링된다. 밀집 SIFT 특징(원시 설명자, 양자화된 코드워드, 좌표)은 시각적 단어 가방을 위해 설계된 ImageNet-1K에 사용 가능했다. 경계 상자는 평균 150개의 이미지를 가진 약 3,000개의 인기 있는 synset에 대해 사용 가능했다. 일부 이미지에는 속성 주석도 있지만, 세부 정보는 제한적이다.
유산
ImageNet Challenge는 머신러닝 및 딥러닝 기술을 발전시키는 데 중요한 역할을 했다. 이 대회는 신경망 아키텍처(예: 잔차 네트워크)와 배치 정규화 및 데이터 증강과 같은 훈련 방법의 사용을 대중화했다. 대회의 성공은 인공지능에 대한 관심을 촉발했으며, 이후 생성형 AI 및 대규모 언어 모델 연구의 발전에 영향을 주었지만, 대회 자체는 시각적 작업에 초점을 맞추었다.