AlexNet은 합성곱 신경망으로, 토론토 대학에서 Alex Krizhevsky가 일리야 수츠케버 및 제프리 힌턴과 함께 설계했다. 2012년 ILSVRC-2012 대회에 출전하여 이미지넷 사진을 1,000개 범주로 분류했으며, top-5 오류율 15.3%를 기록하여, 여전히 전통적인 수작업 컴퓨터 비전 특징에 의존하던 차점자보다 10퍼센트 포인트 이상 앞섰다. 이 결과는 현대 딥러닝 시대의 시작점으로 널리 간주된다.
네트워크의 이름은 주 저자의 이름을 줄인 것으로 공식 제품명으로 의도된 것이 아니며, 논문 자체는 일반적으로 "ImageNet Classification with Deep Convolutional Neural Networks" (2012)로 인용된다.
역사
Krizhevsky는 Hinton의 연구실에서 대학원생으로 AlexNet을 구축했으며, 1990년대 Yann LeCun의 초기 합성곱 네트워크 연구를 확장했다. 합성곱 네트워크는 20년 동안 존재했고, Fei-Fei Li의 그룹이 조립한 ImageNet 데이터셋은 2009년부터 공개되었지만, 어떤 팀도 충분히 깊은 네트워크와 충분한 계산 능력 및 데이터를 결합하여 고전적인 비전 파이프라인을 이기지 못했다. Krizhevsky는 NVIDIA GPU 카드 두 개(GTX 580)에서 모델을 훈련했으며, 단일 카드에 메모리가 부족했기 때문에 네트워크를 두 카드에 분할했고, NVIDIA의 CUDA 플랫폼을 사용하여 저수준 커널을 직접 작성했다.
구조
AlexNet은 8개의 학습된 레이어를 가진다: 5개의 합성곱 레이어와 그 뒤를 따르는 3개의 완전 연결 레이어로, 총 약 6천만 개의 매개변수를 가진다. 여러 선택이 이전 네트워크와 구별되었다. 느린 포화 시그모이드 또는 tanh 함수 대신 ReLU(정류 선형 유닛) 활성화 함수를 사용하여 훈련 속도를 크게 높였다. 완전 연결 레이어에 정규화 기법인 드롭아웃을 적용하여 120만 개 훈련 이미지 데이터셋에서 과적합을 줄였다. 데이터 증강(무작위 잘라내기 및 수평 뒤집기)을 사용하여 과적합을 더 제한했고, 레이어 간 로컬 응답 정규화를 사용했으며, 이 기법은 이후 세대의 네트워크에서 대부분 폐기되었다. 훈련은 두 GPU에서 약 6일 동안 확률적 경사 하강법을 사용한 역전파로 이루어졌으며, 당시 비전 모델로서는 비정상적으로 큰 계산 투자였다.
영향과 유산
AlexNet의 압도적인 승리는 두 번째 AI 겨울의 좌절 이후 신경망 접근법에 회의적이었던 컴퓨터 비전 분야의 많은 사람에게 깊이와 규모, GPU 계산의 결합이 승리 조합임을 확신시켰다. 원래 논문의 인용 수는 수만 건에 이르며, 이 논문은 분야를 바꾼 경험적 결과의 전형적인 예로 자주 가르쳐진다. 산업 채택은 빠르게 뒤따랐다: 2년 안에 ImageNet 대회의 대부분 참가자가 깊은 합성곱 네트워크를 사용했고, Google, Facebook, Baidu를 포함한 기업은 대규모 내부 딥러닝 팀을 구축했다. NVIDIA의 주가와 전략은 AlexNet 이후 GPU가 그래픽 렌더링뿐만 아니라 훈련용으로 점점 더 마케팅되면서 변화했으며, 이 관계는 네트워크가 AlexNet의 8개 레이어에서 수백 개 레이어로, 나중에는 트랜스포머의 매우 다른 구조로 성장하면서 다음 10년 동안 더 깊어졌다.
AlexNet 자체는 이후 ImageNet 대회에서 VGGNet, GoogLeNet, ResNet과 같은 더 깊은 네트워크에 빠르게 대체되었으며, 많은 작업에서 합성곱 구조는 이후 비전 트랜스포머에 도전받았다. 그 지속적인 중요성은 기술적이라기보다 역사적이다: 일반적으로 더 넓은 머신러닝 및 컴퓨터 비전 커뮤니티가 규모 있는 딥러닝 방법에 전념하도록 설득한 단일 결과로 인용되며, 학술 연구 우선순위와 이를 지원하는 하드웨어 산업을 모두 재편했다.