영어에서 번역됨

ImageNet-21K는 21,000개 이상의 시각적 범주(synset)와 1,400만 개의 수작업 주석 이미지를 포함하는 전체 ImageNet 데이터셋으로, 기계 학습에서 시각적 객체 인식 모델을 훈련하고 평가하는 데 사용됩니다.

ImageNet-21K는 시각적 객체 인식 소프트웨어 연구를 위해 설계된 대규모 시각 데이터베이스인 완전한 ImageNet 데이터세트를 의미한다. 여기에는 WordNet 어휘 데이터베이스에서 파생된 synset으로 알려진 21,000개 이상의 범주로 구성된 1,400만 개 이상의 수작업 주석 이미지가 포함된다. 이 데이터세트는 제3자 이미지 URL의 주석으로 무료로 제공되지만, 실제 이미지는 ImageNet이 소유하지 않는다. 2010년부터 ImageNet은 ImageNet 대규모 시각 인식 챌린지(ILSVRC)라는 연례 대회를 개최해 왔으며, 이 대회는 일반적으로 ImageNet-1K라고 불리는 1,000개의 겹치지 않는 클래스로 축소된 하위 집합을 사용한다.

역사

AI 연구자 페이페이 리(Fei-Fei Li)는 2006년 AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하기 위해 ImageNet에 대한 아이디어를 개발하기 시작했다. 2007년 그녀는 WordNet의 창시자 중 한 명인 프린스턴 대학의 크리스티안 펠바움(Christiane Fellbaum) 교수를 만났고, 이후 WordNet의 약 22,000개 명사를 기반으로 ImageNet을 구축했다. 리는 또한 평균적인 사람이 약 30,000종류의 객체를 인식한다는 1987년 추정치에서 영감을 받았다.

프린스턴 대학의 조교수로서 리는 팀을 구성하고 이미지 분류를 위해 Amazon Mechanical Turk를 사용했다. 라벨링은 2008년 7월에 시작되어 2010년 4월에 끝났으며, 167개국에서 온 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링하고 라벨링했다. 1,400만 개의 각 이미지는 세 번 라벨링되었다. 원래 계획은 40,000개 범주에 걸쳐 범주당 10,000개의 이미지, 총 4억 개의 이미지를 요구했지만, 이는 달성되지 않았다. 첫 공개 발표는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 학회(CVPR)에서의 포스터였다.

2009년 알렉스 버그(Alex Berg)는 객체 위치 파악을 추가할 것을 제안했고, 이는 PASCAL 시각 객체 클래스 대회와의 협력으로 이어졌으며, 2010년 ILSVRC가 시작되어 PASCAL VOC의 20개 클래스와 비교하여 1,000개 클래스와 객체 위치 파악을 특징으로 했다.

딥러닝에 대한 중요성

2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류율을 달성하여 준우승자보다 10.8% 포인트 이상 낮은 성과를 냈다. 이 성공은 훈련 중 그래픽 처리 장치(GPU)를 사용함으로써 가능해졌으며, 이는 Deep learning 혁명의 핵심 요소였다. The Economist에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에 걸쳐 주목하기 시작했다."

2015년 AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1% 오류율에 도달할 수 있다고 추정했으며, 그의 연구실의 약 10명은 덜 노력으로 약 12-13%에 도달했다. 최대한의 노력으로 인간이 2.4% 오류율을 달성할 수 있다고 추정되었다.

데이터세트

ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 객체 클래스의 존재 또는 부재를 나타내는 반면, 객체 수준 주석은 보이는 객체 주변에 경계 상자를 제공한다. 데이터세트는 세분화된 분류를 위해 120개의 개 품종 범주로 보강된 WordNet 스키마의 변형을 사용한다. 2012년 ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 작업자는 분당 평균 50개의 이미지를 식별했다.

2010년 4월 30일 기준으로 데이터세트에는 21,841개의 비어 있지 않은 synset, 14,197,122개의 이미지, 경계 상자 주석이 있는 1,034,908개의 이미지, SIFT 특징이 있는 120만 개의 이미지(1,000개 synset용)가 있었다.

범주

범주는 WordNet 개념에서 필터링되었으며, 각각 "synset"(동의어 집합)이라고 한다. WordNet 3.0에는 100,000개 이상의 synset(대부분 명사 80,000개 이상)이 포함되어 있으며, ImageNet은 이를 시각적으로 설명할 수 있는 21,841개의 가산 명사로 필터링했다. 각 synset에는 "n"으로 시작하는 WordNet ID(wnid)가 있는데, 이는 명사만 포함되기 때문이다. 예를 들어, "개, 가정견, Canis familiaris"의 wnid는 "n02084071"이다. 범주는 레벨 1(예: "포유류")부터 레벨 9(예: "저먼 셰퍼드")까지 9개 레벨에 걸쳐 있다.

이미지 형식

이미지는 여러 언어의 동의어를 사용하여 온라인 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr)에서 스크래핑되었다. RGB 형식이며 해상도가 다양하다. 예를 들어, 2012년 버전에서 "물고기" 범주는 4288 x 2848에서 75 x 56 픽셀까지 범위가 있다. Machine learning에서 이미지는 일반적으로 일정한 해상도로 전처리되고 백색화된다. PyTorch에서 ImageNet 이미지는 픽셀 값을 [0,1]로 나누고, [0.485, 0.456, 0.406]을 빼고, [0.229, 0.224, 0.225]로 나누어 정규화되며, 이는 데이터세트의 평균과 표준 편차이다.

라벨 및 주석

각 이미지는 정확히 하나의 wnid로 라벨링된다. 조밀한 SIFT 특징(원시 설명자, 양자화된 코드워드 및 좌표)은 시각적 단어 가방 모델용으로 설계된 ImageNet-1K에 사용할 수 있다. 경계 상자는 약 3,000개의 인기 있는 synset에 대해 사용할 수 있으며, synset당 평균 150개의 이미지가 있다. 일부 이미지에는 속성 주석도 있다.

영향 및 유산

ImageNet-21K는 Artificial intelligenceComputer vision 연구를 발전시키는 데 중요한 역할을 해왔다. ILSVRC 챌린지, 특히 2012년 AlexNet 결과는 Neural networkDeep learning 방법의 광범위한 채택을 촉진했다. 데이터세트의 규모와 계층적 구조는 대규모 모델 훈련을 가능하게 하여 이후 Generative AI 및 기타 분야의 발전에 영향을 미쳤다. 전체 21K 데이터세트는 벤치마킹을 위해 1K 하위 집합보다 덜 일반적으로 사용되지만, 사전 훈련과 세분화된 분류 연구를 위한 귀중한 자원으로 남아 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·dataset·deep-learning·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사