피드포워드는 정보가 입력 계층에서 은닉 계층을 거쳐 출력 계층으로 단방향으로만 이동하며, 루프나 피드백 연결이 없는 신경망의 기본적인 아키텍처 패턴입니다. 이 설계는 정보가 순환할 수 있는 순환 아키텍처와 대조되며, 딥러닝 모델과 대규모 언어 모델을 포함한 현대 머신러닝 시스템의 대부분을 뒷받침합니다.
이 용어는 제어 이론과 초기 인공지능 연구에서 유래했으며, 피드포워드 시스템은 이전 출력에 의존하지 않고 입력에서 직접 출력을 계산합니다. 신경망의 맥락에서 이는 각 계층의 활성화가 이전 계층의 활성화에서만 계산되어, 역전파를 통해 효율적으로 훈련할 수 있는 단순하고 구성 가능한 구조를 만듭니다.
역사적 발전
피드포워드 네트워크의 개념은 1958년 Frank Rosenblatt이 도입한 퍼셉트론으로 거슬러 올라가며, 이는 단일 계층 피드포워드 모델이었습니다. 1969년 Marvin Minsky와 Seymour Papert의 저서 "Perceptrons"는 단일 계층 피드포워드 네트워크의 한계를 지적하며 연구를 둔화시켰습니다. 이 분야는 1980년대 역전파의 대중화로 부활했으며, 이를 통해 다층 피드포워드 네트워크(종종 다층 퍼셉트론이라고 함)를 훈련할 수 있게 되었습니다. 주요 초기 기여자로는 Bernard Widrow와 적응형 필터링 및 학습 알고리즘을 발전시킨 버클리 AI 연구 관련자들이 있습니다.
2010년대에 이르러 피드포워드 아키텍처는 현대 AI의 중추가 되었습니다. Jakob Uszkoreit, Lukasz Kaiser, Niki Parmar를 포함한 연구자들이 2017년 논문 "Attention Is All You Need"에서 도입한 트랜스포머 아키텍처는 어텐션 메커니즘과 인터리브된 피드포워드 계층에 크게 의존합니다. 이 설계는 OpenAI, Anthropic, Google DeepMind가 개발한 시스템을 뒷받침합니다.
핵심 구성 요소
일반적인 피드포워드 네트워크는 입력 계층, 하나 이상의 은닉 계층, 출력 계층으로 구성됩니다. 각 계층은 선형 변환 후 비선형 활성화 함수를 적용합니다. 일반적인 활성화 함수로는 ReLU(정류 선형 유닛), 시그모이드, tanh가 있습니다. 가중치와 편향은 Adam 또는 확률적 경사 하강법 변형과 같은 최적화 알고리즘을 통해 학습됩니다.
현대 아키텍처에서 피드포워드 계층은 종종 확장 및 축소됩니다. 예를 들어 트랜스포머에서 각 블록은 먼저 표현을 더 높은 차원(종종 모델 너비의 4배)으로 투영한 다음 다시 투영하는 피드포워드 네트워크를 포함하며, 그 사이에 비선형성이 있습니다. 위치별 피드포워드 네트워크라고도 하는 이 설계는 각 토큰을 독립적으로 처리합니다.
현대 아키텍처에서의 역할
피드포워드 계층은 인코더-디코더 모델과 시퀀스-투-시퀀스 시스템에서 필수적입니다. 트랜스포머에서 인코더와 디코더 스택 모두 피드포워드 하위 계층을 포함합니다. 이 계층들은 멀티 헤드 어텐션 메커니즘이 생성한 표현을 변환하여 모델이 복잡한 특징 상호작용을 학습할 수 있게 합니다.
2015년에 도입된 잔차 네트워크(ResNet)는 깊은 피드포워드 스택을 통해 그래디언트가 더 쉽게 흐를 수 있게 하는 스킵 연결을 통합하여 수백 개의 계층을 가진 네트워크를 가능하게 했습니다. 이 혁신은 모델을 현대 생성형 AI 시스템의 규모로 확장하는 데 중요했습니다. 배치 정규화와 계층 정규화와 같은 기법은 깊은 피드포워드 네트워크의 훈련을 더욱 안정화합니다.
훈련 및 최적화
피드포워드 네트워크 훈련은 모든 가중치에 대한 손실 함수의 그래디언트를 계산하는 역전파에 의존합니다. 주요 관행으로는 가중치 초기화 전략, 학습률 스케줄, 그래디언트 폭주를 방지하기 위한 그래디언트 클리핑이 있습니다. 드롭아웃 및 데이터 증강과 같은 정규화 방법은 과적합을 방지하는 데 도움이 됩니다.
손실 함수는 작업에 따라 다릅니다. 분류에는 크로스 엔트로피 손실, 회귀에는 평균 제곱 오차, 생성 모델에는 특수 손실이 사용됩니다. 추론은 종종 빔 서치와 같은 디코딩 전략이나 top-k 샘플링 및 top-p 샘플링을 포함한 샘플링 방법을 사용하며, 온도 스케일링으로 무작위성을 제어합니다.
응용 및 변형
피드포워드 네트워크는 다양한 영역에서 사용됩니다. 컴퓨터 비전에서 합성곱 신경망(CNN)은 본질적으로 피드포워드이며, 이미지 분할을 위한 U-Net(U-Net)과 같은 아키텍처가 있습니다. 자연어 처리에서 피드포워드 계층은 GPT 및 Claude와 같은 대규모 언어 모델에 사용되는 트랜스포머의 핵심입니다. NVIDIA와 같은 회사의 하드웨어 가속기(제공된 목록에는 없지만 AMD, Intel, Qualcomm도 관련 칩을 생산함)는 피드포워드 계산의 핵심인 행렬 곱셈에 최적화되어 있습니다.
변형에는 인코더와 디코더 피드포워드 경로를 연결하는 크로스 어텐션 메커니즘과 순서 정보를 제공하는 위치 인코딩이 포함됩니다. RLAIF(AI 피드백 기반 강화 학습) 및 커리큘럼 학습과 같은 고급 훈련 방법은 모델 동작을 더욱 정교화합니다. 피드포워드 네트워크는 저지연 추론에 최적화된 Groq 및 SambaNova와 같은 특수 하드웨어 설계에도 나타납니다.
한계 및 향후 방향
성공에도 불구하고 피드포워드 네트워크에는 한계가 있습니다. 과거 입력에 대한 고유한 메모리가 없어 외부 메커니즘 없이는 순차 데이터에 부적합합니다. 또한 계산 집약적일 수 있어 많은 에너지와 특수 하드웨어가 필요합니다. 입력당 피드포워드 매개변수의 하위 집합만 활성화하는 혼합 전문가 계층과 같은 더 효율적인 아키텍처와 이론적 특성 이해에 대한 연구가 계속되고 있습니다.
2020년대 중반 현재 피드포워드는 AI의 지배적인 패러다임으로 남아 있으며, 스탠포드 AI 연구소 및 MIT CSAIL과 같은 학술 기관과 산업 연구소의 지속적인 혁신이 있습니다. 피드포워드 설계의 단순성과 확장성은 연구와 배포된 시스템 모두에서 지속적인 관련성을 보장합니다.