ImageNet(데이터셋)

영어에서 번역됨

ImageNet은 시각적 객체 인식 연구에 사용되는 1,400만 개 이상의 수작업 주석 이미지를 포함한 대규모 계층적 시각 데이터베이스로, 매년 열리는 ImageNet 대규모 시각 인식 챌린지(ILSVRC)로 가장 잘 알려져 있습니다.

ImageNet은 시각 객체 인식 소프트웨어 연구에 사용되도록 설계된 대규모 시각 데이터베이스이다. 이 프로젝트는 그림에 나타난 객체를 나타내는 손으로 주석을 단 1,400만 개 이상의 이미지를 제공하며, 최소 100만 개의 이미지에는 경계 상자도 포함되어 있다. 2만 개 이상의 범주를 포함하며, 각 범주는 일반적으로 수백 개의 이미지를 포함한다. 제3자 이미지 URL에 대한 주석 데이터베이스는 무료로 제공되지만, 실제 이미지는 ImageNet이 소유하지 않는다. 2010년부터 이 프로젝트는 연례 소프트웨어 대회인 ImageNet 대규모 시각 인식 챌린지(ILSVRC)를 운영해 왔으며, 여기서 프로그램은 1,000개의 겹치지 않는 클래스로 구성된 축소된 목록을 사용하여 객체와 장면을 분류하고 탐지하기 위해 경쟁한다.

역사

AI 연구자 페이페이 리(Fei-Fei Li)는 2006년에 ImageNet에 대한 아이디어를 개발하기 시작했다. 대부분의 AI 연구가 모델과 알고리즘에 초점을 맞추던 시기에, 리는 AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하고 개선하는 것을 목표로 했다. 2007년, 리는 WordNet의 창시자 중 한 명인 프린스턴 대학 교수 크리스티안 펠바움(Christiane Fellbaum)을 만나 프로젝트에 대해 논의했다. 이 만남을 계기로 리는 WordNet의 약 22,000개 명사에서 시작하여 그 기능 중 많은 부분을 채택하여 ImageNet을 구축하게 되었다. 그녀는 또한 평균적인 사람이 약 30,000종류의 객체를 인식한다는 1987년 추정치에서 영감을 받았다.

프린스턴 대학의 조교수로서 리는 프로젝트 작업을 위해 연구자 팀을 구성했다. 그들은 이미지 분류를 돕기 위해 아마존 Mechanical Turk를 사용했다. 라벨링은 2008년 7월에 시작되어 2010년 4월에 끝났으며, 167개국에서 온 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링하고 라벨링했다. 예산은 1,400만 개의 각 이미지가 세 번 라벨링되도록 허용했다. 원래 계획은 40,000개 범주에 걸쳐 범주당 10,000개의 이미지, 총 4억 개의 이미지를 각각 세 번 검증하는 것이었다. 그러나 인간은 초당 최대 2개의 이미지를 분류할 수 있으며, 그 속도로는 휴식 없이 19인년의 노동이 필요할 것으로 추정되었다.

데이터베이스는 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 컨퍼런스(CVPR)에서 "ImageNet: 대규모 계층적 데이터셋의 미리보기"라는 제목의 포스터로 처음 발표되었다. 2009년, 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했다. 리는 2009년 PASCAL 시각 객체 클래스 대회에 협력을 제안했고, 그 결과 2010년에 시작된 ImageNet 대규모 시각 인식 챌린지가 1,000개 클래스와 객체 위치 파악을 특징으로 하게 되었으며, PASCAL VOC의 20개 클래스와 19,737개 이미지와 비교되었다.

딥러닝에 대한 중요성

2012년 9월 30일, AlexNet이라는 합성곱 신경망(CNN)이 ImageNet 2012 챌린지에서 15.3%의 top-5 오류를 달성하여 준우승자보다 10.8% 포인트 이상 낮은 성과를 냈다. 훈련 중 그래픽 처리 장치(GPU)의 사용은 합성곱 신경망을 실현 가능하게 만들었으며, 이는 딥러닝 혁명의 필수 요소였다. 이코노미스트에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에 걸쳐 주목하기 시작했다."

2015년, AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 테스트 세트에서 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다. 안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실의 약 10명은 적은 노력으로 약 12-13%에 도달했다. 최대한의 노력으로 인간이 2.4%에 도달할 수 있을 것으로 추정되었다.

데이터셋

ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 이미지에서 객체 클래스의 존재 또는 부재를 나타내며, 예를 들어 "이 이미지에 호랑이가 있다" 또는 "이 이미지에 호랑이가 없다"와 같다. 객체 수준 주석은 표시된 객체의 보이는 부분 주위에 경계 상자를 제공한다. ImageNet은 세분화된 분류를 보여주기 위해 120개의 개 품종 범주로 보강된 광범위한 WordNet 스키마의 변형을 사용하여 객체를 분류한다.

2012년, ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 평균 작업자는 분당 50개의 이미지를 식별했다. 전체 ImageNet에 대한 원래 계획은 약 50,000개의 synset에 걸쳐 약 5,000만 개의 깨끗하고 다양하며 전체 해상도의 이미지를 갖는 것이었지만, 이는 달성되지 않았다. 2010년 4월 30일 기준 요약 통계에는 21,841개의 비어 있지 않은 synset, 총 14,197,122개의 이미지, 경계 상자 주석이 있는 1,034,908개의 이미지, SIFT 특징이 있는 1,000개의 synset, SIFT 특징이 있는 120만 개의 이미지가 포함되었다.

범주

ImageNet의 범주는 WordNet 개념에서 필터링되었다. 각 개념은 여러 동의어(예: "kitty"와 "young cat")를 포함할 수 있으므로 "동의어 세트" 또는 "synset"이라고 불린다. WordNet 3.0에는 100,000개 이상의 synset이 있으며, 대부분은 명사(80,000개 이상)이다. ImageNet은 이를 시각적으로 설명할 수 있는 셀 수 있는 명사인 21,841개의 synset으로 필터링했다. WordNet 3.0의 각 synset에는 품사와 오프셋의 연결인 "WordNet ID"(wnid)가 있다. ImageNet은 명사만 포함하므로 모든 wnid는 "n"으로 시작한다. 예를 들어, "dog, domestic dog, Canis familiaris"의 wnid는 "n02084071"이다. 범주는 레벨 1(예: "mammal")부터 레벨 9(예: "German shepherd")까지 9개 레벨로 나뉜다.

이미지 형식

이미지는 "German shepherd," "German police dog," "Alsatian," "ovejero alemán," 및 "pastore tedesco"와 같은 여러 언어의 동의어를 사용하여 온라인 이미지 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr 등)에서 스크래핑되었다. ImageNet은 다양한 해상도의 RGB 형식 이미지로 구성된다. 예를 들어, ImageNet 2012 "fish" 범주에서 해상도는 4288 x 2848에서 75 x 56까지 다양하다. 기계 학습에서 이러한 이미지는 일반적으로 표준 일정 해상도로 전처리되고 신경망에 의한 추가 처리 전에 백색화된다. 예를 들어, PyTorch에서 ImageNet 이미지는 픽셀 값을 0과 1 사이로 나눈 다음 [0.485, 0.456, 0.406]을 빼고 [0.229, 0.224, 0.225]로 나누어 정규화되며, 이는 ImageNet의 평균과 표준 편차이다.

라벨 및 주석

각 이미지는 정확히 하나의 wnid로 라벨링된다. ImageNet-1K에 대한 밀집 SIFT 특징(원시 SIFT 설명자, 양자화된 코드워드 및 좌표)은 시각적 단어 가방 모델용으로 설계되어 다운로드할 수 있었다. 경계 상자는 약 3,000개의 인기 있는 synset에 대해 사용 가능했으며, synset당 평균 150개의 이미지가 있었다. 또한 일부 이미지에는 속성 주석이 있으며, 데이터셋은 특히 기계 학습 연구, 특히 인공지능 모델의 훈련 및 평가에 광범위하게 사용되었다.

유산 및 영향

ImageNet은 컴퓨터 비전 및 인공지능 분야에 깊은 영향을 미쳤다. 이는 객체 인식 및 분류의 진전을 가속화하는 표준화된 벤치마크를 제공했다. 2012년 AlexNet의 성공은 딥러닝 혁명을 촉발하여 다양한 영역에서 딥러닝 기술의 광범위한 채택으로 이어졌다. ImageNet의 계층적 구조와 대규모 규모는 다른 데이터셋의 개발과 트랜스포머 기반 모델의 설계에도 영향을 미쳤으며, 이는 나중에 생성형 AI대규모 언어 모델의 기초가 되었다. 데이터셋은 시각 인식 시스템의 훈련 및 평가를 위한 중요한 자원으로 남아 있으며, 그 유산은 계속해서 AI 연구와 응용을 형성하고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·dataset·deep-learning·image-recognition
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사