ImageNet LSVRC 2012

영어에서 번역됨

ImageNet LSVRC 2012는 연례 ImageNet 대규모 시각 인식 챌린지(ImageNet Large Scale Visual Recognition Challenge)로, 컨볼루션 신경망인 AlexNet이 top-5 오류율 15.3%를 달성하여 다른 모든 참가작을 10.8퍼센트 포인트 이상 앞서며 딥러닝 붐을 촉발시켰다.

ImageNet Large Scale Visual Recognition Challenge(ILSVRC) 2012은 프로그램들이 ImageNet 데이터베이스에서 객체와 장면을 올바르게 분류하고 탐지하기 위해 경쟁하는 연례 소프트웨어 대회의 세 번째 판이었다. 2012년 대회는 인공 지능 역사에서 전환점으로 널리 간주되는데, 우승작인 AlexNet이라는 신경망이 테스트 세트에서 15.3%의 top-5 오류율을 달성하여 준우승자보다 10.8퍼센트 포인트 이상 낮은 수치를 기록했기 때문이다. 이러한 극적인 개선은 딥 러닝머신 러닝 기술의 힘을 입증했으며, 이후에도 이 분야를 계속 형성하는 연구와 투자의 물결을 촉발했다.

ImageNet 프로젝트 자체는 2006년 AI 연구자 페이페이 리(Fei-Fei Li)에 의해 시작되었으며, AI 알고리즘 훈련에 사용할 수 있는 데이터를 확장하는 것을 목표로 했다. 리는 2007년 프린스턴 대학의 크리스티안 펠바움(Christiane Fellbaum) 교수와 만났는데, 그녀는 WordNet의 창시자 중 한 명이었으며, 이후 WordNet의 약 22,000개 명사를 출발점으로 사용하여 ImageNet을 구축했다. 데이터베이스는 Amazon Mechanical Turk를 통한 크라우드소싱 주석의 도움으로 구축되었으며, 라벨링은 2008년 7월에 시작되어 2010년 4월에 종료되었다. 이 작업에는 167개국에서 온 49,000명의 작업자가 1억 6천만 개 이상의 후보 이미지를 필터링하고 라벨링하는 데 참여하여, 20,000개 이상의 범주에 걸쳐 1,400만 개 이상의 수작업 주석 이미지가 생성되었다.

역사와 발전

ImageNet에 대한 아이디어는 당시 대부분의 AI 연구가 데이터보다는 모델과 알고리즘에 초점을 맞추고 있다는 리의 관찰에서 emerged. 그녀는 평균적인 사람이 약 30,000가지 종류의 객체를 인식한다는 1987년 추정치에서 영감을 받았다. 2007년, 리는 크리스티안 펠바움을 만나 프로젝트에 대해 논의했고, 그 회의는 WordNet의 명사 synset에서 시작하여 ImageNet을 구축하기로 결정하는 결과를 낳았다. 리는 그녀가 조교수로 있던 프린스턴 대학에서 연구자 팀을 구성했고, 그들은 Amazon Mechanical Turk를 사용하여 이미지를 분류했다.

원래 계획은 40,000개 범주에 대해 각 범주당 10,000개 이미지, 총 4억 개 이미지를 각각 세 번 검증하는 것이었다. 그러나 인간은 초당 최대 2개의 이미지를 분류할 수 있으며, 그 속도로는 휴식 없이 19인년(human-years)의 노동이 필요할 것으로 추정되었다. 팀은 2009년 플로리다에서 열린 컴퓨터 비전 및 패턴 인식 회의(CVPR)에서 "ImageNet: A Preview of a Large-scale Hierarchical Dataset"이라는 제목의 포스터로 데이터베이스를 처음 발표했다.

2009년, 알렉스 버그(Alex Berg)는 객체 위치 파악을 작업으로 추가할 것을 제안했다. 리는 협력을 위해 PASCAL Visual Object Classes 대회에 접근했고, 그 결과 2010년에 ImageNet Large Scale Visual Recognition Challenge가 시작되었다. 이 대회는 2010년 PASCAL VOC의 20개 클래스와 19,737개 이미지와 비교하여 1,000개의 비중복 클래스 목록을 사용한다.

딥 러닝에 대한 중요성

2012년 9월 30일, 합성곱 신경망(CNN)인 AlexNet은 ImageNet 2012 Challenge에서 15.3%의 top-5 오류율을 달성했다. 이는 준우승자보다 10.8퍼센트 포인트 이상 낮은 수치였다. 합성곱 신경망의 사용은 훈련 중 그래픽 처리 장치(GPU)의 사용으로 가능해졌으며, 이는 딥 러닝 혁명의 필수 요소였다. The Economist에 따르면, "갑자기 사람들은 AI 커뮤니티뿐만 아니라 기술 산업 전반에 걸쳐 주목하기 시작했다."

AlexNet의 승리는 종종 딥 러닝 붐의 방아쇠로 인용된다. 그것은 신경망이 복잡한 시각적 작업에서 최첨단 결과를 달성할 수 있음을 입증했으며, 생성 AI대규모 언어 모델을 포함한 다양한 분야에서 딥 러닝 기술의 빠른 채택으로 이어졌다. 2015년, AlexNet은 100개 이상의 레이어를 가진 마이크로소프트의 매우 깊은 CNN에 의해 능가되었으며, 이는 테스트 세트에서 3.57%의 오류율로 ImageNet 2015 대회에서 우승했다.

안드레이 카파시(Andrej Karpathy)는 2014년에 집중적인 노력으로 5.1%의 오류율에 도달할 수 있다고 추정했으며, 그의 연구실의 약 10명은 더 적은 노력으로 약 12-13%에 도달했다. 최대한의 노력으로 인간이 2.4%의 오류율에 도달할 수 있다고 추정되었다.

데이터 세트 구성

ImageNet은 주석 프로세스를 크라우드소싱한다. 이미지 수준 주석은 이미지에서 객체 클래스의 존재 또는 부재를 나타내며, 예를 들어 "이 이미지에 호랑이가 있다" 또는 "이 이미지에 호랑이가 없다"와 같다. 객체 수준 주석은 표시된 객체의 보이는 부분 주위에 경계 상자를 제공한다. ImageNet은 세분화된 분류를 보여주기 위해 120개의 개 품종 범주로 보강된 광범위한 WordNet 스키마의 변형을 사용하여 객체를 분류한다.

2012년, ImageNet은 Mechanical Turk의 세계 최대 학술 사용자였으며, 평균 작업자는 분당 50개의 이미지를 식별했다. 2010년 4월 30일에 제공된 요약 통계는 총 21,841개의 비어 있지 않은 synset, 14,197,122개의 이미지, 1,034,908개의 경계 상자 주석 이미지, 그리고 120만 개의 SIFT 특징 이미지를 보여주었다.

ImageNet의 범주는 WordNet 개념에서 필터링되었다. 각 개념은 "synset"(동의어 세트)이라고 불리며, WordNet 3.0에는 100,000개 이상의 synset이 있었고, 대부분은 명사(80,000개 이상)였다. ImageNet은 이를 시각적으로 설명할 수 있는 가산 명사인 21,841개의 synset으로 필터링했다. 각 synset에는 WordNet ID(wnid)가 있으며, ImageNet이 명사만 포함하기 때문에 "n"으로 시작한다. 범주는 "포유류"와 같은 수준 1부터 "저먼 셰퍼드"와 같은 수준 9까지 9개 수준으로 나뉜다.

이미지 형식 및 전처리

이미지는 여러 언어의 동의어를 사용하여 온라인 이미지 검색 엔진(Google, Picsearch, MSN, Yahoo, Flickr)에서 스크래핑되었다. ImageNet은 다양한 해상도의 RGB 형식 이미지로 구성된다. 예를 들어, ImageNet 2012에서 "물고기" 범주는 4288 x 2848에서 75 x 56까지의 해상도를 가진다. 머신 러닝에서 이러한 이미지는 일반적으로 표준 상수 해상도로 전처리되고 신경망에 의한 추가 처리 전에 백색화(whitened)된다.

예를 들어, PyTorch에서 ImageNet 이미지는 기본적으로 픽셀 값을 0과 1 사이에 오도록 나눈 다음 [0.485, 0.456, 0.406]을 빼고 [0.229, 0.224, 0.225]로 나누어 정규화된다. 이는 ImageNet의 평균과 표준 편차이므로 입력 데이터를 백색화한다.

라벨 및 주석

각 이미지는 정확히 하나의 wnid로 라벨링된다. ImageNet-1K용 밀집 SIFT 특징(원시 SIFT 설명자, 양자화된 코드워드, 각 설명자/코드워드의 좌표)은 시각적 단어 가방(bag of visual words)을 위해 설계되어 다운로드 가능했다. 객체의 경계 상자는 각 synset에 평균 150개 이미지가 있는 약 3,000개의 인기 있는 synset에 대해 사용 가능했다. 일부 이미지에는 속성 주석도 있지만, 전체 세부 사항은 사용 가능한 소스에 명시되어 있지 않다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·deep-learning·computer-vision·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사