영어에서 번역됨

AlexNet은 2012년 토론토 대학에서 Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton이 개발한 심층 합성곱 신경망으로, top-5 오류율 15.3%로 ImageNet 대규모 시각 인식 챌린지에서 우승하며 컴퓨터 비전 분야의 딥러닝을 크게 발전시켰다.

AlexNet은 2012년 토론토 대학교의 알렉스 크리제프스키(Alex Krizhevsky), 일리아 서츠케버(Ilya Sutskever), 제프리 힌턴(Geoffrey Hinton)이 개발한 이미지 분류용 합성곱 신경망 구조이다. 이 구조는 이미지를 1,000개의 서로 다른 객체 범주로 분류하며, 시각 인식 분야에서 심층 합성곱 신경망의 최초 대규모 시연으로 널리 인정받고 있다. 이 모델은 6천만 개의 매개변수와 65만 개의 뉴런을 포함하며, 그 깊이가 높은 성능의 핵심이었고, 훈련 중 그래픽 처리 장치(GPU)를 사용함으로써 실현 가능했다.

세 연구자는 SuperVision 팀을 구성하여 2012년 9월 30일에 AlexNet을 ImageNet 대규모 시각 인식 챌린지(ILSVRC)에 제출했다. 이 네트워크는 top-5 오류율 15.3%를 달성하여 준우승자보다 10.8% 이상의 격차로 대회에서 우승했다. 이 결과는 딥러닝의 전환점이 되었으며, 컴퓨터 비전과 인공지능 분야의 후속 연구에 큰 영향을 미쳤다.

구조

AlexNet은 8개의 층을 포함한다: 처음 5개는 합성곱 층이며, 일부는 최대 풀링 층이 뒤따르고, 마지막 3개는 완전 연결 층이다. 마지막 층을 제외한 네트워크는 두 개의 복사본으로 분할되어 각각 하나의 GPU에서 실행되는데, 이는 단일 Nvidia GTX 580의 3GB VRAM에 맞지 않았기 때문이다. 구조는 (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax로 표현할 수 있으며, 여기서 CONV는 ReLU 활성화를 사용하는 합성곱 층, RN은 국소 응답 정규화, MP는 최대 풀링, FC는 ReLU를 사용하는 완전 연결 층, Linear는 활성화가 없는 완전 연결 층, DO는 드롭아웃을 의미한다.

특히 합성곱 층 3, 4, 5는 풀링이나 정규화 없이 연결된다. AlexNet은 비포화 ReLU 활성화 함수를 사용했으며, 이는 tanh 및 sigmoid보다 훈련 성능이 더 우수했다. 이러한 선택은 훈련 효율성의 핵심 요인이었다.

훈련

ImageNet 훈련 세트는 120만 개의 이미지를 포함했다. 모델은 두 개의 Nvidia GTX 580 GPU(각 3GB)를 사용하여 5~6일 동안 90 에포크로 훈련되었으며, 이 GPU는 float32에서 이론적 성능 1.581 TFLOPS를 가지며 출시 당시 가격은 US$500였다. 각 순방향 패스는 약 1.43 GFLOPs를 필요로 했으므로, 두 GPU는 이상적인 조건에서 이론적으로 초당 2,200회 이상의 순방향 패스를 수행할 수 있었다.

데이터 세트 이미지는 JPEG 형식으로 저장되어 27GB의 디스크 공간을 차지했다. 신경망은 훈련 중 각 GPU에서 2GB의 RAM과 약 5GB의 시스템 RAM을 사용했다. GPU는 훈련을 처리했고, CPU는 디스크에서 이미지를 로드하고 데이터 증강을 수행했다.

AlexNet은 배치 크기 128개 예제, 모멘텀 0.9, 가중치 감쇠 0.0005를 사용하는 모멘텀 경사 하강법으로 훈련되었다. 학습률은 10−2에서 시작하여 검증 오류가 감소를 멈출 때마다 수동으로 10배씩 감소시켰으며, 세 번 감소하여 10−5로 끝났다. 두 가지 형태의 데이터 증강이 CPU에서 즉시 계산되어 "계산적으로 무료"였다: 첫째, 각 이미지는 짧은 변이 256픽셀이 되도록 크기가 조정된 후 중앙 256×256 패치가 잘리고 정규화되었다; 둘째, 무작위 224×224 패치(및 그 수평 반전)가 추출되어 훈련 세트 크기를 2048배로 증가시켰다. 또한 RGB 값은 픽셀 값의 주성분 방향을 따라 무작위로 이동되었다.

해상도 224×224는 256 - 16 - 16 = 224이므로, 256×256 이미지의 각 측면에서 16픽셀을 프레임으로 잘라내면 224×224 이미지가 생성되기 때문에 선택되었다. AlexNet은 국소 응답 정규화와 드롭 확률 0.5의 드롭아웃 정규화를 사용했다. 모든 가중치는 평균 0, 표준 편차 0.01의 가우시안으로 초기화되었고, 합성곱 층 2, 4, 5 및 모든 완전 연결 층의 편향은 죽은 ReLU 문제를 피하기 위해 상수 1로 초기화되었다.

테스트 시 이미지는 짧은 변이 256이 되도록 크기가 조정되고, 중앙 256×256 패치가 잘린 후, 다섯 개의 224×224 패치(네 모서리와 중앙)와 그 수평 반전이 계산되어 총 10개의 패치가 생성된다. 네트워크의 예측 확률은 10개 패치 모두에서 평균화되어 최종 예측을 생성한다.

ImageNet 대회

2012년 ImageNet 대회에 사용된 버전은 7개의 AlexNet 앙상블이었다. 표준 구조의 5개 AlexNet은 ILSVRC-2012 훈련 세트로 훈련되었다. 두 개의 변형 AlexNet도 훈련되었으며, 각각 마지막 풀링 층 위에 추가 합성곱 층을 가지며, 먼저 전체 ImageNet Fall 2011 릴리스(22K 범주의 1,500만 이미지)로 훈련된 후 ILSVRC-2012 훈련 세트로 미세 조정되었다. 최종 시스템은 7개 네트워크의 예측 확률을 평균화했다.

역사

이전 연구

1980년, 후쿠시마 구니히코(Kunihiko Fukushima)는 비지도 학습으로 훈련된 초기 CNN인 네오코그니트론(neocognitron)을 제안했다. 1989년 Yann LeCun 등이 개발한 LeNet-5는 역전파를 사용한 지도 학습을 사용했으며, 소규모로 AlexNet과 본질적으로 동일한 구조를 가졌다. 최대 풀링은 1990년 음성 처리에 사용되었고, 1992년 Cresceptron에서 이미지 처리에 처음 사용되었다.

2000년대에는 GPU 하드웨어가 개선되면서 연구자들은 신경망 훈련을 포함한 범용 계산에 GPU를 적용했다. 2006년 K. Chellapilla 등은 동등한 CPU 구현보다 4배 빠른 GPU에서 CNN을 훈련했다. 2009년 Raina 등은 Nvidia GeForce GTX 280에서 1억 개의 매개변수를 가진 심층 신뢰 네트워크를 CPU보다 최대 70배 속도로 훈련했다. 2011년 IDSIA의 Dan Cireșan 등이 개발한 심층 CNN은 동등한 CPU 구현보다 60배 빨랐으며, 2011년 5월 15일부터 2012년 9월 10일 사이에 그들의 CNN은 4개의 이미지 대회에서 우승하고 여러 데이터베이스에서 최첨단 결과를 달성했다. AlexNet 논문에 따르면, Cireșan의 이전 네트워크는 AlexNet과 "다소 유사"하며, 둘 다 CUDA로 작성되어 GPU에서 실행되었다.

컴퓨터 비전

1990~2010년 기간 동안 신경망은 커널 회귀 및 서포트 벡터 머신과 같은 다른 머신 러닝 방법보다 우수하지 않았다. 2012년 AlexNet의 성공은 컴퓨터 비전에서 딥러닝의 힘을 입증하여 CNN의 광범위한 채택과 잔차 네트워크와 같은 후속 구조의 개발로 이어졌다. 또한 머신 러닝을 위한 GPU 기반 계산에 대한 관심을 촉진했으며, AI에서 지배적인 접근 방식으로서 딥러닝의 부상에 기여했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:deep-learning·computer-vision·neural-network·image-classification
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사