영어에서 번역됨

ILSVRC(ImageNet Large Scale Visual Recognition Challenge) 2010은 소프트웨어 프로그램이 ImageNet 데이터베이스에서 객체를 분류하고 탐지하기 위해 경쟁한 첫 번째 연례 대회로, 1,000개의 겹치지 않는 클래스와 객체 위치 파악을 사용했습니다.

ImageNet 대규모 시각 인식 챌린지(ILSVRC) 2010은 시각 객체 인식 연구를 위해 설계된 대규모 시각 데이터베이스인 ImageNet 프로젝트가 주최한 연례 소프트웨어 대회의 첫 번째 대회였다. 이 챌린지는 참가 프로그램이 1,000개의 비중복 클래스로 구성된 축소된 목록 내에서 객체와 장면을 정확하게 분류하고 탐지하도록 요구했으며, 이는 2010년에 20개의 클래스와 19,737개의 이미지만을 사용한 PASCAL 시각 객체 클래스(VOC) 대회와 같은 이전 벤치마크보다 크게 확장된 규모였다. 2010년 챌린지는 표준화된 대규모 평가 플랫폼을 제공함으로써 컴퓨터 비전의 전환점을 표시했으며, 이는 이후 딥러닝 혁명을 촉발하는 계기가 되었다.

기원과 발전

ImageNet 프로젝트는 대부분의 AI 연구가 데이터보다는 모델과 알고리즘에 초점을 맞추던 시기인 2006년에 AI 연구자 페이페이 리(Fei-Fei Li)에 의해 구상되었다. 리는 AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하고 개선하는 것을 목표로 했다. 2007년, 그녀는 WordNet의 창시자 중 한 명인 프린스턴 교수 크리스티안 펠바움(Christiane Fellbaum)을 만났고, 이는 WordNet의 약 22,000개의 명사를 기반으로 ImageNet을 구축하는 것으로 이어졌다. 리는 또한 평균적인 사람이 약 30,000종의 서로 다른 객체를 인식한다는 1987년의 추정치에서 영감을 받았다.

프린스턴의 조교수로서 리는 연구자 팀을 구성하고 이미지 분류를 위해 Amazon Mechanical Turk를 사용했다. 라벨링은 2008년 7월에 시작되어 2010년 4월에 끝났으며, 167개국에서 온 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링하고 라벨링했다. 원래 계획은 40,000개 범주에 걸쳐 각 범주당 10,000개의 이미지, 총 4억 개의 이미지를 요구했지만, 실용적인 제약으로 인해 축소되었다. 데이터베이스는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 회의(CVPR)에서 "ImageNet: 대규모 계층적 데이터셋의 미리보기"라는 제목의 포스터로 처음 발표되었다.

2009년에 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했고, 리는 협력을 위해 PASCAL VOC 대회에 접근했다. 이로 인해 ILSVRC가 2010년에 1,000개의 클래스와 객체 위치 파악 기능으로 시작되었으며, 이는 PASCAL VOC의 20개 클래스에서 상당히 확장된 것이다.

데이터셋 구성

ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 객체 클래스의 존재 여부를 나타내는 반면, 객체 수준 주석은 객체의 보이는 부분 주위에 경계 상자를 제공한다. 데이터셋은 세분화된 분류를 위해 120개의 개 품종 범주로 보강된 WordNet 스키마의 변형을 사용한다. 2010년 4월 30일 기준으로 데이터셋에는 21,841개의 비어 있지 않은 시넷(동의어 집합), 14,197,122개의 이미지, 경계 상자 주석이 있는 1,034,908개의 이미지, SIFT 특징이 있는 120만 개의 이미지가 포함되어 있었다.

범주는 시넷이라고 불리는 WordNet 개념에서 필터링되었다. 각 시넷은 ImageNet이 명사만 포함하기 때문에 "n"으로 시작하는 WordNet ID(wnid)를 가진다. 범주는 수준 1(예: "포유류")부터 수준 9(예: "저먼 셰퍼드")까지 9개 수준으로 나뉜다. 이미지는 여러 언어의 동의어를 사용하여 Google, Picsearch, MSN, Yahoo, Flickr와 같은 온라인 검색 엔진에서 스크랩되었다. 이미지는 다양한 해상도의 RGB 형식이며, 예를 들어 2012년 "물고기" 범주에서 해상도는 4288 x 2848에서 75 x 56까지 다양하다. 기계 학습에서 이러한 이미지는 일반적으로 표준 해상도로 전처리되고 신경망에 의해 처리되기 전에 백색화된다.

딥러닝에 대한 중요성

ILSVRC 2010은 2012년의 주요 돌파구를 위한 무대를 마련했다. 2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류를 달성했으며, 이는 2위보다 10.8% 포인트 이상 낮은 수치였다. 이 성공은 딥러닝 혁명의 필수 요소인 훈련 중 그래픽 처리 장치(GPU) 사용에 의해 가능해졌다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티 내부뿐만 아니라 기술 산업 전반에 걸쳐 주목하기 시작했다."

2015년에 AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실에서 약 10명이 덜 노력하여 약 12-13%에 도달했다. 최대한의 노력으로 인간이 2.4%의 오류율을 달성할 수 있다고 추정되었다.

유산

ILSVRC 2010 자체는 딥러닝 우승자를 배출하지 않았지만, 컴퓨터 비전의 빠른 발전을 이끌 벤치마크를 확립했다. 챌린지의 대규모 표준화된 평가는 신경망딥러닝 기술 개발의 촉매제가 되었으며, 이후 인공지능 및 관련 분야의 연구에 영향을 미쳤다. 데이터셋과 챌린지는 여전히 영향력이 있으며, 2010년 판은 이후 기계 학습 접근 방식의 힘을 보여준 후속 대회의 기반이 되었다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·image-classification·machine-learning·benchmark
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사