인공 신경망에서 은닉층(hidden layer)은 입력층과 출력층 사이에 위치하는 인공 뉴런의 층이다. '은닉'이라는 용어는 이러한 층들이 외부 환경과 직접적으로 상호작용하지 않으며, 그 활성화가 네트워크 내부에 국한된다는 점을 반영한다. 은닉층을 포함하는 가장 단순한 구조는 다층 퍼셉트론(MLP)으로, 은닉층의 각 뉴런은 이전 층으로부터 가중 입력을 받아 활성화 함수를 적용하고, 그 출력을 다음 층으로 전달한다.
은닉층이 전혀 없는 네트워크, 예를 들어 단일층 퍼셉트론은 본질적으로 선형 모델이다. 이는 선형적으로 분리 가능한 데이터만 구분할 수 있다. 하나 이상의 은닉층을 추가하고 비선형 활성화 함수를 결합하면 모델에 비선형성이 도입된다. 이를 통해 네트워크는 복잡한 비선형 함수를 근사할 수 있으며, 이는 현대 기계 학습 및 심층 학습 응용의 기초가 된다.
학습 및 훈련에서의 역할
일반적인 기계 학습 실무에서 은닉층을 포함한 모든 층의 가중치와 편향은 초기화되며, 종종 무작위 값이나 가중치 초기화와 같은 기법을 사용한다. 훈련 중에는 역전파(backpropagation)를 통해 이러한 매개변수가 반복적으로 갱신되는데, 역전파는 손실 함수의 각 매개변수에 대한 기울기를 계산하는 방법이다. 은닉층은 입력 데이터의 중간 표현을 점진적으로 학습하여, 원시 특징을 최종 출력에 더 유용한 추상적 형태로 변환한다.
네트워크의 깊이, 즉 은닉층의 수는 그 용량(capacity)의 핵심 요소이다. 많은 은닉층을 가진 심층 네트워크는 이미지 인식이나 자연어 처리와 같은 신경망 구조에서 볼 수 있듯이 계층적 특징을 포착할 수 있다. 그러나 더 깊은 네트워크는 기울기 소실(vanishing gradients)과 같은 문제를 도입하며, 이는 배치 정규화, 층 정규화, 잔차 네트워크 연결과 같은 기법으로 해결되었다.
유형 및 변형
은닉층은 네트워크 구조에 따라 다양하게 달라질 수 있다. 완전 연결 층에서는 모든 뉴런이 이전 층의 모든 뉴런에 연결되며, 이는 MLP에서 일반적이다. 이미지 작업에 사용되는 합성곱 층은 필터를 국소적으로 적용하고 가중치를 공유한다. 시퀀스 모델에서 발견되는 순환 층은 시간 단계에 걸쳐 내부 상태를 유지한다. 트랜스포머 모델에서 은닉층은 종종 다중 헤드 어텐션 메커니즘과 피드포워드 하위 층을 포함하여 시퀀스의 병렬 처리를 가능하게 한다.
특수화된 은닉층도 존재하는데, 예를 들어 생물의학 이미지 분할을 위한 U-Net의 은닉층은 다운샘플링 및 업샘플링 경로를 결합한다. ReLU나 시그모이드와 같은 활성화 함수의 선택과 각 은닉층의 뉴런 수는 성능에 큰 영향을 미치는 하이퍼파라미터이다. 드롭아웃과 같은 정규화 방법은 과적합을 방지하기 위해 은닉층에 자주 적용된다.
역사적 배경
퍼셉트론을 포함한 초기 신경망 연구는 은닉층을 포함하지 않아 적용 범위가 제한적이었다. 1980년대에 은닉층과 역전파 알고리즘의 도입, 특히 버나드 위드로와 같은 연구자들의 기여로 다층 네트워크 훈련이 가능해졌다. 이는 이후 심층 학습의 발전을 위한 토대를 마련했다. 토론토 대학교와 스탠퍼드 AI 연구소와 같은 기관은 이론적 및 실용적 발전에 기여했으며, 노키아 벨 연구소와 제록스 PARC의 초기 하드웨어 노력은 구현을 탐구했다.
실용적 고려 사항
은닉층 설계는 절충을 수반한다. 뉴런이나 층이 너무 적으면 과소적합(underfitting)이 발생할 수 있고, 너무 많으면 과적합과 높은 계산 비용으로 이어질 수 있다. 모델 가지치기와 같은 기법은 훈련된 네트워크의 중복성을 줄이고, 데이터 증강은 일반화를 개선하는 데 도움을 준다. 대규모 시스템에서 은닉층은 종종 AWS Trainium이나 Google Cloud TPU와 같은 특수 하드웨어에 분산되며, OpenAI, Anthropic, Google DeepMind와 같은 기업이 대규모 언어 모델에서 은닉층의 규모를 확장하고 있다.
은닉층은 해석 가능성 연구의 중심이기도 하다. 은닉층의 뉴런 활성화를 시각화하는 방법은 연구자들이 네트워크가 학습한 특징을 이해하는 데 도움을 주며, 초기 층의 단순한 가장자리에서 깊은 층의 복잡한 객체에 이르기까지 다양하다. 이는 여전히 활발한 연구 분야로, 마이클 조던과 아니마 아난드쿠마르와 같은 학자들의 기여가 있다.
미래 방향
모델이 성장함에 따라 은닉층은 더욱 특수화되고 효율적으로 변하고 있다. 희소 구조, 전문가 혼합(mixture-of-experts), 동적 라우팅이 새로운 추세로 떠오르고 있다. 커리큘럼 학습 및 RLHF와 같은 대체 훈련 방법에 대한 연구는 전통적인 역전파에 대한 의존도를 줄일 수 있다. 은닉층의 지속적인 진화는 웨이모의 자율 주행부터 의료 진단에 이르기까지 다양한 영역에서 인공지능 역량을 발전시키는 데 중심적이다.