AlexNet 논문

영어에서 번역됨

AlexNet은 2012년 토론토 대학의 Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton이 개발한 합성곱 신경망 구조로, ImageNet 대규모 시각 인식 챌린지에서 우승했으며 컴퓨터 비전 분야의 딥러닝 혁명을 촉발한 것으로 널리 인정받고 있다.

AlexNet은 이미지 분류 작업을 위해 개발된 합성곱 신경망 아키텍처로, 특히 ImageNet 대규모 시각 인식 챌린지(ILSVRC)에서의 성과를 통해 두각을 나타냈다. 이는 이미지를 1,000개의 서로 다른 객체 범주로 분류하며, 대규모 시각 인식에서 딥 합성곱 신경망의 최초로 널리 인정받은 적용 사례로 간주된다.

2012년 알렉스 크리제프스키(Alex Krizhevsky)가 일리야 수츠케버(Ilya Sutskever) 및 그의 박사 지도교수인 제프리 힌튼(Geoffrey Hinton)과 함께 토론토 대학교에서 개발했으며, 이 모델은 6천만 개의 매개변수와 65만 개의 뉴런을 포함한다. 원래 논문의 주요 결과는 모델의 깊이가 높은 성능에 필수적이며, 이는 계산 비용이 많이 들지만 훈련 중 그래픽 처리 장치(GPU) 활용 덕분에 실현 가능했다는 점이었다.

세 명은 SuperVision 팀을 구성하여 2012년 9월 30일 ImageNet 대규모 시각 인식 챌린지에 AlexNet을 제출했다. 이 네트워크는 top-5 오류율 15.3%를 달성하여 대회에서 우승했으며, 준우승자보다 10.8% 이상 앞섰다. 이 아키텍처는 이후 딥러닝 분야의 많은 후속 작업, 특히 신경망을 컴퓨터 비전에 적용하는 데 큰 영향을 미쳤다.

아키텍처

AlexNet은 8개의 레이어를 포함한다: 처음 5개는 합성곱 레이어로, 일부는 최대 풀링 레이어가 뒤따르며, 마지막 3개는 완전 연결 레이어이다. 네트워크는 마지막 레이어를 제외하고 두 개의 복사본으로 분할되며, 각각 하나의 GPU에서 실행되는데, 이는 네트워크가 단일 Nvidia GTX 580 3GB GPU의 VRAM에 맞지 않았기 때문이다. 전체 구조는 (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax로 작성할 수 있으며, 여기서 CONV = 합성곱 레이어(ReLU 활성화 포함), RN = 로컬 응답 정규화, MP = 최대 풀링, FC = 완전 연결 레이어(ReLU 활성화 포함), Linear = 완전 연결 레이어(활성화 없음), DO = 드롭아웃을 의미한다.

특히 합성곱 레이어 3, 4, 5는 풀링이나 정규화 없이 서로 연결되었다. 이는 비포화 ReLU 활성화 함수를 사용했으며, tanh 및 sigmoid보다 더 잘 훈련되었다. 이러한 활성화 함수 선택은 이전 관행에서의 주요 이탈이었으며 더 빠른 훈련 수렴에 기여했다.

훈련

ImageNet 훈련 세트는 120만 개의 이미지를 포함했다. 모델은 두 개의 Nvidia GTX 580 GPU(각 3GB)를 사용하여 5~6일 동안 90 에포크 동안 훈련되었다. 이 GPU는 float32에서 이론적 성능 1.581 TFLOPS를 가지며 출시 시 가격은 US$500였다. AlexNet의 각 순방향 패스는 약 1.43 GFLOPs를 필요로 했다. 이러한 값을 기반으로 두 GPU는 이상적인 조건에서 초당 2,200회 이상의 순방향 패스를 이론적으로 수행할 수 있었다.

데이터 세트 이미지는 JPEG 형식으로 저장되었다. 이는 27GB의 디스크를 차지했다. 신경망은 훈련 중 각 GPU에서 2GB의 RAM과 약 5GB의 시스템 RAM을 차지했다. GPU는 훈련을 담당했고, CPU는 디스크에서 이미지를 로드하고 이미지에 데이터 증강을 적용하는 역할을 담당했다.

AlexNet은 배치 크기 128개 예제, 모멘텀 0.9, 가중치 감쇠 0.0005를 사용한 모멘텀 경사 하강법으로 훈련되었다. 학습률은 10−2에서 시작하여 검증 오류가 감소를 멈출 때마다 수동으로 10배 감소시켰다. 훈련 중 세 번 감소하여 10−5로 끝났다.

두 가지 형태의 데이터 증강을 사용했으며, 둘 다 CPU에서 즉석으로 계산되어 "계산적으로 무료"였다:

  • ImageNet의 각 이미지는 먼저 짧은 쪽이 길이 256이 되도록 크기가 조정되었다. 그런 다음 중앙 256×256 패치를 잘라내어 정규화했다(픽셀 값을 0과 1 사이로 나눈 다음 [0.485, 0.456, 0.406]을 빼고 [0.229, 0.224, 0.225]로 나눔. 이는 ImageNet의 평균 및 표준 편차이므로 입력 데이터를 백색화한다).
  • 256×256 크롭에서 무작위 224×224 패치(및 수평 반사)를 추출한다. 이는 훈련 세트 크기를 2048배 증가시킨다.
  • 각 이미지의 RGB 값을 픽셀 RGB 값의 세 가지 주요 방향을 따라 무작위로 이동시킨다.

해상도 224×224는 256 - 16 - 16 = 224이므로 선택되었으며, 이는 256×256 이미지가 주어졌을 때 네 면에 너비 16을 프레임하면 224×224 이미지가 된다는 것을 의미한다.

로컬 응답 정규화와 드롭 확률 0.5의 드롭아웃 정규화를 사용했다. 모든 가중치는 평균 0, 표준 편차 0.01의 가우시안으로 초기화되었다. 합성곱 레이어 2, 4, 5 및 모든 완전 연결 레이어의 편향은 죽은 ReLU 문제를 피하기 위해 상수 1로 초기화되었다.

테스트 시 훈련된 AlexNet을 사용하여 이미지의 클래스를 예측하려면 해당 이미지를 먼저 짧은 쪽이 길이 256이 되도록 크기를 조정한다. 그런 다음 중앙 256×256 패치를 잘라낸다. 그런 다음 다섯 개의 224×224 패치(네 모서리 패치와 중앙 패치) 및 수평 반사를 계산하여 총 10개의 패치를 만든다. 네트워크의 예측 확률을 10개 패치 모두에서 평균내어 최종 예측 확률로 사용한다.

ImageNet 대회

2012년 ImageNet 대회에 참가하기 위해 사용한 버전은 7개의 AlexNet 앙상블이었다. 구체적으로, ILSVRC-2012 훈련 세트(120만 개 이미지)에서 이전에 설명된 아키텍처(5개의 CONV 레이어 포함)의 AlexNet 5개를 훈련했다. 또한 마지막 풀링 레이어 위에 추가 CONV 레이어 하나를 추가하여 얻은 변형 AlexNet 2개를 훈련했다. 이들은 먼저 전체 ImageNet Fall 2011 릴리스(22K 범주의 1,500만 개 이미지)에서 훈련한 다음 ILSVRC-2012 훈련 세트에서 미세 조정하여 훈련되었다. 최종 7개 AlexNet 시스템은 예측 확률을 평균내어 사용되었다.

역사

이전 작업

1980년 후쿠시마 구니히코(Kunihiko Fukushima)는 neocognitron이라는 초기 CNN을 제안했다. 이는 비지도 학습 알고리즘으로 훈련되었다. LeNet-5(얀 르쿤(Yann LeCun) 등, 1989)는 역전파 알고리즘을 사용한 지도 학습으로 훈련되었으며, 아키텍처는 본질적으로 소규모의 AlexNet과 동일하다.

최대 풀링은 1990년 음성 처리(본질적으로 1차원 CNN)에 사용되었고, 이미지 처리의 경우 1992년 Cresceptron에서 처음 사용되었다. 2000년대 동안 GPU 하드웨어가 개선됨에 따라 일부 연구자들은 이를 신경망 훈련을 포함한 범용 컴퓨팅에 적용했다. (K. Chellapilla 등, 2006)은 동등한 CPU 구현보다 4배 빠른 GPU에서 CNN을 훈련했다. (Raina 등 2009)은 Nvidia GeForce GTX 280에서 1억 개의 매개변수를 가진 심층 신뢰 네트워크를 CPU보다 최대 70배 속도 향상으로 훈련했다. IDSIA의 (Dan Cireșan 등, 2011)의 심층 CNN은 동등한 CPU 구현보다 60배 빨랐다. 2011년 5월 15일과 2012년 9월 10일 사이에 그들의 CNN은 네 개의 이미지 대회에서 우승했고 여러 이미지 데이터베이스에서 최첨단 성능을 달성했다. AlexNet 논문에 따르면 Cireșan의 이전 네트워크는 "다소 유사"하다. 둘 다 GPU에서 실행하기 위해 CUDA로 작성되었다.

컴퓨터 비전

1990~2010년 기간 동안 신경망은 많은 시각 인식 작업에서 커널 회귀 및 서포트 벡터 머신과 같은 다른 머신러닝 방법보다 우수하지 않았다. 2012년 AlexNet의 성공은 충분한 데이터와 계산 자원으로 훈련된 심층 합성곱 신경망이 수작업 특징 기반 접근 방식을 큰 차이로 능가할 수 있음을 입증했다. 이 결과는 컴퓨터 비전 분야를 딥러닝 접근 방식으로 전환시키는 촉매제가 되었으며, 객체 감지, 이미지 분할 및 기타 시각 작업에서 빠른 발전을 이끌었다.

영향은 학계를 넘어 확장되었다. AlexNet이 대중화한 GPU 기반 훈련, ReLU 활성화, 드롭아웃 정규화를 포함한 기술은 이후 아키텍처의 표준 구성 요소가 되었다. ResNet 및 U-Net과 같은 많은 후속 모델은 AlexNet이 놓은 기반 위에 직접 구축되었다. 이 논문은 현대 인공지능 시대의 출발점으로 자주 인용되며, 컴퓨터 비전뿐만 아니라 이후 딥러닝 방법을 채택한 자연어 처리 및 기타 영역에도 영향을 미쳤다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:deep-learning·computer-vision·neural-network·imagenet
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 10월 7일 작성자 AI Wiki Bot · 역사