AlexNet 논문 (2012)

영어에서 번역됨

AlexNet은 2012년 토론토 대학에서 알렉스 크리제프스키(Alex Krizhevsky), 일리야 서츠케버(Ilya Sutskever), 제프리 힌턴(Geoffrey Hinton)이 개발한 심층 합성곱 신경망입니다. 이 네트워크는 ImageNet ILSVRC-2012 대회에서 top-5 오류율 15.3%로 우승하며 딥러닝 혁명을 촉발했습니다.

AlexNet은 2012년 토론토 대학교에서 Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton이 개발한 이미지 분류용 합성곱 신경망 아키텍처이다. 이 네트워크는 이미지를 1,000개의 객체 범주로 분류하며, 시각 인식에서 심층 합성곱 네트워크의 최초 대규모 시연으로 널리 간주된다. 2012년 ImageNet 대규모 시각 인식 챌린지(ILSVRC)에서의 결정적 승리는 기계 학습의 전환점이 되었으며, 인공 지능 연구와 산업 전반에 걸쳐 딥 러닝의 빠른 채택을 촉진했다.

이 모델은 6천만 개의 매개변수와 65만 개의 뉴런을 포함한다. 아키텍처는 8개의 레이어로 구성된다: 5개의 합성곱 레이어(일부는 최대 풀링 뒤따름)와 3개의 완전 연결 레이어이다. 네트워크는 비포화 ReLU 활성화 함수를 사용하여 전통적인 tanh 및 sigmoid 활성화보다 훈련 속도를 개선했다. 메모리 제약으로 인해 네트워크는 두 개의 GPU에 분할되었으며, 각 복사본은 절반의 뉴런을 처리했다. 마지막 완전 연결 레이어는 두 GPU의 출력을 결합했다.

아키텍처

AlexNet의 구조는 다음과 같이 요약할 수 있다: (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax. 여기서 CONV는 ReLU 활성화가 있는 합성곱 레이어, RN은 국소 응답 정규화, MP는 최대 풀링, FC는 ReLU가 있는 완전 연결 레이어, Linear는 활성화가 없는 완전 연결 레이어, DO는 드롭아웃을 나타낸다. 특히 합성곱 레이어 3, 4, 5는 사이에 풀링이나 정규화 없이 순차적으로 연결되었다.

네트워크는 과적합을 줄이기 위해 국소 응답 정규화와 드롭 확률 0.5의 드롭아웃 정규화를 사용했다. 모든 가중치는 평균 0, 표준 편차 0.01의 가우시안 분포로 초기화되었다. 합성곱 레이어 2, 4, 5 및 모든 완전 연결 레이어의 편향은 죽은 ReLU 문제를 피하기 위해 1로 초기화되었다.

훈련

모델은 120만 개의 이미지를 포함하는 ImageNet 훈련 세트에서 훈련되었다. 훈련은 90 에포크 동안 5~6일에 걸쳐 두 개의 Nvidia GTX 580 GPU(각 3GB)에서 실행되었으며, 이 GPU는 float32에서 이론적 성능 1.581 TFLOPS를 가졌다. 각 순방향 패스는 약 1.43 GFLOPs를 필요로 했다. JPEG 형식으로 저장된 데이터 세트 이미지는 디스크 공간 27GB를 차지했다; 네트워크는 훈련 중 각 GPU에서 2GB의 RAM과 시스템 RAM 약 5GB를 사용했다. GPU는 훈련을 처리했고 CPU는 이미지 로딩과 데이터 증강을 수행했다.

훈련은 배치 크기 128, 모멘텀 0.9, 가중치 감쇠 0.0005의 모멘텀 경사 하강법을 사용했다. 학습률은 10⁻²에서 시작하여 검증 오류가 평평해질 때마다 수동으로 10배씩 줄여 10⁻⁵로 끝났다. 두 가지 형태의 데이터 증강이 CPU에서 즉시 적용되어 사실상 무료였다: 첫째, 이미지의 짧은 쪽이 256픽셀이 되도록 크기를 조정한 다음 중앙 256×256 크롭을 취해 정규화했다; 둘째, 256×256 크롭에서 무작위 224×224 패치(및 수평 반사)를 추출하여 훈련 세트 크기를 2048배 증가시켰다. 또한 각 이미지의 RGB 값은 픽셀 색상 분포의 주성분을 따라 무작위로 이동되었다.

ImageNet 대회

SuperVision이라는 팀은 2012년 9월 30일 ILSVRC-2012 대회에 7개의 AlexNet 앙상블을 제출했다. 5개의 네트워크는 표준 아키텍처를 사용했고, 2개의 변형은 추가 합성곱 레이어를 가졌으며 더 큰 ImageNet Fall 2011 릴리스(1500만 이미지, 22,000개 범주)에서 사전 훈련된 후 ILSVRC-2012 훈련 세트에서 미세 조정되었다. 최종 예측은 7개 네트워크 모두의 확률 평균이었다. 앙상블은 top-5 오류율 15.3%를 달성했으며, 준우승자보다 10.8퍼센트 포인트 이상 우수하여 컴퓨터 비전 커뮤니티를 놀라게 한 극적인 개선이었다.

영향과 유산

AlexNet의 성공은 대규모 시각 인식을 위한 심층 합성곱 네트워크의 힘을 입증했으며, 잔차 네트워크 및 U-Net과 같은 후속 아키텍처에 직접적인 영향을 미쳤다. 또한 심층 네트워크 훈련을 위한 GPU 사용을 대중화했으며, 이는 해당 분야의 표준 관행이 되었다. 이 논문의 깊이 강조와 ReLU, 드롭아웃, 데이터 증강의 효과는 현대 딥 러닝 관행을 형성했다. AlexNet은 종종 딥 러닝 혁명의 촉매로 인용되며, 생성형 AI의 돌파구와 대규모 언어 모델 및 트랜스포머 개발로 이어졌다. 그 영향은 학계를 넘어 OpenAI, Google DeepMind, Anthropic과 같은 기업의 AI 연구 투자를 촉진했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:deep-learning·computer-vision·neural-networks·image-classification
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사