ImageNet 대규모 시각 인식 챌린지(ILSVRC)

영어에서 번역됨

ImageNet 대규모 시각 인식 챌린지(ILSVRC)는 2010년부터 2017년까지 매년 개최된 대회로, 소프트웨어 프로그램들이 이미지 속 객체를 분류하고 탐지하는 데 경쟁하며 딥러닝과 컴퓨터 비전 분야의 주요 발전을 이끌었다.

ImageNet 대규모 시각 인식 챌린지(ILSVRC)는 2010년부터 2017년까지 매년 개최된 소프트웨어 경연 대회로, ImageNet 프로젝트의 일부였다. 이 대회는 알고리즘이 선별된 1,000개의 겹치지 않는 객체 클래스 내에서 객체와 장면을 정확하게 분류하고 탐지하는 과제를 부여했다. 이 챌린지는 컴퓨터 비전에서 딥러닝 혁명을 촉발한 것으로 널리 인정받으며, 특히 2012년 합성곱 신경망이 정확도에서 극적인 향상을 달성한 이후 더욱 두드러졌다.

이 대회는 시각 객체 인식 연구를 위해 설계된 대규모 시각 데이터베이스인 ImageNet 프로젝트에서 성장했다. AI 연구자 페이페이 리(Fei-Fei Li)가 시작한 ImageNet은 20,000개 이상의 범주에 걸쳐 1,400만 개 이상의 수작업 주석 이미지를 포함하며, 최소 100만 개의 이미지에는 경계 상자 주석도 제공된다. ILSVRC는 이러한 이미지와 범주의 하위 집합을 사용하여 컴퓨터 비전 알고리즘을 평가하고 비교하기 위한 표준화된 벤치마크를 제공했다.

역사

페이페이 리는 2006년에 ImageNet을 구상하기 시작했으며, 대부분의 연구가 모델과 알고리즘에 초점을 맞추던 시기에 AI 알고리즘 훈련에 사용할 데이터를 확장하는 것을 목표로 했다. 2007년에 그녀는 WordNet의 창시자 중 한 명인 프린스턴 교수 크리스티안 펠바움(Christiane Fellbaum)을 만났고, 이로 인해 WordNet의 약 22,000개의 명사를 기반으로 ImageNet을 구축하게 되었다. 리는 또한 평균적인 사람이 약 30,000종류의 객체를 인식한다는 1987년 추정치에서 영감을 받았다.

프린스턴의 조교수로서 리는 팀을 구성하고 이미지 분류를 위해 Amazon Mechanical Turk를 사용했다. 라벨링은 2008년 7월부터 2010년 4월까지 진행되었으며, 167개국에서 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링하고 라벨링했다. 1,400만 개의 각 이미지는 세 번 라벨링되었다. 원래 계획은 40,000개 범주에 걸쳐 범주당 10,000개의 이미지를 요구했지만, 이는 비현실적임이 입증되었다. 인간은 초당 최대 2개의 이미지를 분류할 수 있으며, 이는 약 19인년의 노동이 필요할 것으로 추정되었다.

데이터베이스는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 학회(CVPR)에서 "ImageNet: 대규모 계층적 데이터셋의 미리보기"라는 제목의 포스터로 처음 발표되었다. 2009년에 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했고, 이로 인해 PASCAL 시각 객체 클래스 대회와의 협력이 이루어졌다. 첫 번째 ILSVRC는 2010년에 개최되었으며, PASCAL VOC의 20개 클래스와 19,737개 이미지에 비해 1,000개 클래스와 객체 위치 파악을 특징으로 했다.

딥러닝에 대한 중요성

2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류율을 달성하여 준우승자보다 10.8% 포인트 이상 낮은 성능을 보였다. 이 성공은 훈련 중 그래픽 처리 장치(GPU)를 사용함으로써 가능해졌으며, 이는 딥러닝 혁명의 필수 요소였다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에서 주목하기 시작했다."

2015년에는 AlexNet이 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 테스트 세트에서 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실의 약 10명은 적은 노력으로 약 12-13%에 도달했다. 최대한의 노력으로 인간은 2.4%의 오류율을 달성할 수 있다고 추정되었다.

이 챌린지의 영향은 컴퓨터 비전을 넘어 신경망 아키텍처, 훈련 기술, 하드웨어 가속화의 혁신을 촉발했다. 또한 머신러닝 프레임워크의 개발과 인공지능의 더 넓은 분야에도 영향을 미쳤다.

데이터셋

ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 이미지에서 객체 클래스의 존재 여부를 나타내며, 객체 수준 주석은 객체의 보이는 부분 주위에 경계 상자를 제공한다. ImageNet은 WordNet 스키마의 변형을 사용하여 객체를 분류하며, 세분화된 분류를 위해 120개의 개 품종 범주가 추가되었다.

2012년에 ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 평균 작업자는 분당 50개의 이미지를 식별했다. 전체 ImageNet의 원래 계획은 약 50,000개의 시냇셋에 걸쳐 약 5,000만 개의 깨끗하고 다양하며 전체 해상도의 이미지를 포함하는 것이었지만, 이는 달성되지 않았다.

2010년 4월 30일 기준 요약 통계는 다음과 같다:

  • 비어 있지 않은 시냇셋의 총 수: 21,841
  • 이미지의 총 수: 14,197,122
  • 경계 상자 주석이 있는 이미지 수: 1,034,908
  • SIFT 특징이 있는 시냇셋 수: 1,000
  • SIFT 특징이 있는 이미지 수: 120만

범주

ImageNet의 범주는 WordNet 개념에서 필터링되었다. 여러 동의어(예: "kitty"와 "young cat")를 포함할 수 있는 각 개념은 "동의어 집합" 또는 "시냇셋"이라고 한다. WordNet 3.0에는 100,000개 이상의 시냇셋이 포함되어 있으며, 대부분 명사(80,000개 이상)이다. ImageNet은 이를 시각적으로 설명할 수 있는 가산 명사인 21,841개의 시냇셋으로 필터링했다.

WordNet 3.0의 각 시냇셋에는 품사와 오프셋의 연결인 "WordNet ID"(wnid)가 있다. ImageNet은 명사만 포함하므로 모든 wnid는 "n"으로 시작한다. 예를 들어, "dog, domestic dog, Canis familiaris" 시냇셋의 wnid는 "n02084071"이다. 범주는 "mammal"과 같은 수준 1부터 "German shepherd"와 같은 수준 9까지 9개 수준으로 나뉜다.

이미지 형식

이미지는 여러 언어의 동의어를 사용하여 온라인 이미지 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr 등)에서 스크랩되었다. 예를 들어, 독일 셰퍼드의 경우 "German police dog", "Alsatian", "ovejero alemán", "pastore tedesco", "德国牧羊犬"과 같은 용어를 사용했다.

ImageNet은 다양한 해상도의 RGB 형식 이미지로 구성된다. 예를 들어, ImageNet 2012 "물고기" 범주에서 해상도는 4288 x 2848에서 75 x 56까지 다양하다. 머신러닝에서 이러한 이미지는 일반적으로 표준 상수 해상도로 전처리되고 신경망에 의한 추가 처리 전에 백색화된다. 예를 들어, PyTorch에서 ImageNet 이미지는 픽셀 값을 0과 1 사이로 나눈 다음 [0.485, 0.456, 0.406]을 빼고 [0.229, 0.224, 0.225]로 나누어 정규화되며, 이는 ImageNet의 평균과 표준 편차이다.

라벨 및 주석

각 이미지는 정확히 하나의 wnid로 라벨링된다. ImageNet-1K에 대한 밀집 SIFT 특징(원시 SIFT 설명자, 양자화된 코드워드 및 좌표)은 시각적 단어 가방을 위해 다운로드 가능했다. 객체의 경계 상자는 약 3,000개의 인기 있는 시냇셋에 대해 제공되었으며, 시냇셋당 평균 150개의 이미지가 있었다. 또한 일부 이미지에는 속성 주석이 있지만, 챌린지는 주로 분류 및 위치 파악 작업에 초점을 맞췄다.

ILSVRC는 2017년에 종료되었지만, 그 유산은 ImageNet 데이터셋의 형태로 지속되며, 이는 여전히 컴퓨터 비전 모델을 평가하기 위한 표준 벤치마크로 남아 있다. 이 대회의 대규모 실제 데이터와 엄격한 평가에 대한 강조는 분야의 빠른 발전을 이끌었으며, 이후 생성형 AI 및 머신러닝의 다른 영역의 발전에 영향을 미쳤다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·deep-learning·competition·dataset
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사