전문가 혼합 라우팅

영어에서 번역됨

Mixture of Experts(MoE) 라우팅은 신경망에서 입력 토큰당 전문가 모듈의 일부만 활성화하는 희소 게이팅 메커니즘으로, 계산 비용을 줄이면서 모델 용량을 확장한다. 이는 많은 현대 대규모 언어 모델의 기반이 된다.

Mixture of Experts(MoE) 라우팅은 Machine learning 분야의 기법으로, 신경망이 여러 개의 특화된 하위 네트워크(전문가)와 각 입력에 대해 활성화할 전문가를 선택하는 게이팅 메커니즘을 포함하는 방식입니다. 현대 Deep learning의 맥락에서 라우팅은 종종 희소(sparse)합니다. 즉, 각 토큰 또는 입력에 대해 소수의 전문가만 사용되므로, 모델은 총 파라미터 수는 매우 크게 유지하면서도 유사한 크기의 밀집 모델보다 추론당 계산 비용을 낮출 수 있습니다. 이 접근 방식은 대규모 언어 모델 및 기타 생성형 AI 시스템을 확장하는 데 있어 초석이 되었습니다.

이 개념은 여러 학습기가 문제 공간을 동질적인 영역으로 분할하는 고전적인 앙상블 학습에서 유래합니다. 1990년대의 초기 연구(예: 메타-pi 네트워크 및 적응형 로컬 전문가 혼합)는 이론적 기반을 마련했습니다. 현대 구현에서 MoE 라우팅은 일반적으로 Transformer (architecture) 아키텍처에 통합되며, 여기서 피드포워드 레이어는 전문가 네트워크 집합과 토큰을 가장 관련성 높은 전문가에게 전달하는 라우터로 대체됩니다. 이 설계는 Google DeepMind 및 기타 연구소에서 개발한 모델이 효율적인 훈련과 추론으로 최첨단 성능을 달성할 수 있게 합니다.

역사적 기원

MoE 라우팅의 뿌리는 연구자들이 위원회 기계(committee machines)와 앙상블 방법을 탐구한 1990년대 초반으로 거슬러 올라갑니다. 주목할 만한 초기 시스템 중 하나는 Hampshire와 Waibel이 보고한 메타-pi 네트워크로, 가중치 함수를 사용하여 여러 시간 지연 신경망의 출력을 결합했습니다. 여섯 명의 일본어 화자로부터 음소를 분류하는 실험에서 그들은 여섯 명의 전문가를 훈련시켰고, 게이팅 함수가 화자당 한 명의 전문가를 전담하도록 학습했지만, 한 명의 남성 화자의 목소리는 다른 남성 전문가들의 선형 결합으로 처리된 것을 발견했습니다. 이는 MoE가 입력 공간의 서로 다른 영역에 전문가를 특화시킬 수 있는 능력을 입증했습니다.

또 다른 기초 작업은 적응형 로컬 전문가 혼합으로, 각 전문가가 단순한 가우시안 분포를 예측하는 가우시안 혼합 모델을 사용했습니다. 게이팅 함수는 입력에 기반하여 가중치를 할당하는 선형-소프트맥스 함수였습니다. 이러한 초기 모델은 MoE의 핵심 구성 요소(전문가 집합, 게이팅 함수, 경사 하강법 기반 훈련 절차)를 확립했습니다.

희소 게이팅과 현대 라우팅

대규모 신경망에서 사용되는 현대 MoE 라우팅은 희소 게이팅을 사용합니다. 모든 전문가의 가중 합을 계산하는 대신, 라우터는 각 토큰에 대해 상위 k개 전문가(종종 k=1 또는 k=2)만 선택합니다. 이 희소성은 효율성에 중요합니다. 모든 전문가가 활성화되면 계산 비용이 전문가 수에 비례하여 증가하여 목적이 무의미해지기 때문입니다. 희소 라우팅을 통해 모델은 수백 또는 수천 개의 전문가를 가질 수 있으면서도 토큰당 소수만 활성화하여 토큰당 부동 소수점 연산을 관리 가능한 수준으로 유지할 수 있습니다.

라우팅 함수는 일반적으로 학습된 선형 레이어와 전문가 집합에 대한 소프트맥스로 구성됩니다. 훈련 중에 라우터는 토큰의 표현을 기반으로 토큰을 전문가에게 할당하는 방법을 학습합니다. 그러나 단순한 희소 라우팅은 로드 불균형을 초래할 수 있습니다. 즉, 소수의 전문가가 대부분의 토큰을 받고 다른 전문가는 충분히 활용되지 않을 수 있습니다. 이를 해결하기 위해 현대 구현은 Switch Transformer에서 도입된 로드 밸런싱 손실과 같은 균형 잡힌 라우팅을 장려하는 보조 손실을 사용합니다.

트랜스포머와의 통합

Transformer (architecture) 기반 모델에서 MoE 라우팅은 가장 일반적으로 피드포워드 네트워크(FFN) 하위 레이어에 적용됩니다. 표준 트랜스포머에서 각 토큰은 밀집 FFN을 통과합니다. MoE 트랜스포머에서는 FFN이 전문가 FFN 집합으로 대체되고, 라우터가 각 토큰을 처리할 전문가를 결정합니다. 이 설계는 2021년 Google DeepMind 연구자들이 도입한 Switch Transformer에 의해 대중화되었으며, 대규모 모델 훈련에서 상당한 속도 향상을 달성했습니다. 또 다른 영향력 있는 아키텍처는 GShard 프레임워크의 Mixture of Experts 레이어로, 효율적인 다국어 기계 번역을 가능하게 했습니다.

이러한 MoE 트랜스포머는 OpenAI, Anthropic 및 기타 조직의 모델을 포함한 많은 대규모 언어 모델에서 채택되었습니다. 예를 들어, GPT-4 및 Claude와 같은 모델은 MoE 아키텍처를 사용하는 것으로 보고되지만, 정확한 세부 사항은 종종 독점적입니다. 라우팅 메커니즘은 이러한 모델이 추론 비용을 합리적으로 유지하면서 수조 개의 파라미터로 확장할 수 있게 합니다.

라우팅 알고리즘과 로드 밸런싱

MoE의 효율성과 효과를 개선하기 위해 여러 라우팅 알고리즘이 개발되었습니다. 가장 일반적인 것은 상위-k 라우팅으로, 라우터가 게이팅 점수가 가장 높은 k개 전문가를 선택합니다. 변형에는 탐색을 장려하기 위해 훈련 중 게이팅 점수에 노이즈를 추가하는 노이즈가 있는 상위-k 라우팅과, 토큰이 전문가를 선택하는 대신 각 전문가가 상위 토큰을 선택하는 전문가 선택 라우팅이 있습니다. 후자는 2022년 Google 연구자들이 제안했으며, 로드 밸런스와 훈련 안정성을 개선할 수 있습니다.

로드 밸런싱은 중요한 과제입니다. 명시적인 메커니즘이 없으면 라우터가 항상 동일한 전문가를 선택하도록 붕괴되어 활용도가 낮아질 수 있습니다. Switch Transformer는 토큰 할당의 불균형을 패널티로 부과하는 보조 손실을 도입했습니다. 다른 방법에는 미분 가능한 해싱과 계층적 라우팅(1단계 라우터가 전문가 그룹을 선택하고 2단계 라우터가 그룹 내에서 선택)이 포함됩니다.

대규모 언어 모델에서의 응용

MoE 라우팅은 대규모 언어 모델을 확장하는 표준 기법이 되었습니다. 이를 통해 모델은 수조 개의 파라미터(예: 1조)를 가지면서도 각 토큰에 대해 그 중 일부만 사용할 수 있어, 프로덕션 환경에서 모델을 서빙하는 데 필수적입니다. OpenAI, AnthropicGoogle DeepMind와 같은 기업은 자사의 대표 모델에 MoE를 통합했습니다. 예를 들어, Mistral AI의 Mixtral 모델은 8개의 전문가를 가진 희소 MoE 아키텍처를 사용하며 토큰당 2개를 활성화하여, 훨씬 더 큰 밀집 모델과 경쟁력 있는 성능을 달성합니다.

언어 모델 외에도 MoE 라우팅은 컴퓨터 비전 및 음성 인식과 같은 다른 영역에서도 사용됩니다. 예를 들어, V-MoE 모델은 비전 트랜스포머에 MoE를 적용하고, GShard 아키텍처는 신경 기계 번역에 사용되었습니다. 이 기법은 MoE 모델 훈련 및 서빙을 위한 인프라를 제공하는 Amazon Web ServicesGoogle Cloud 제품에도 관련이 있습니다.

과제와 미래 방향

장점에도 불구하고 MoE 라우팅은 몇 가지 과제를 제시합니다. 주요 문제 중 하나는 메모리 소비입니다. 소수만 활성화되더라도 모든 전문가 파라미터를 메모리에 저장해야 하므로, 전문가 병렬 처리 및 오프로딩과 같은 정교한 모델 병렬 처리와 메모리 관리가 필요합니다. 또 다른 과제는 훈련 불안정성으로, 라우터와 전문가가 진동을 유발하는 피드백 루프에 들어갈 수 있습니다. 연구자들은 경사 클리핑 및 신중한 초기화와 같은 다양한 안정화 기법을 제안했습니다.

미래 방향에는 더 효율적인 라우팅 알고리즘, 더 나은 로드 밸런싱, 전문가 메모리 사용량을 줄이는 방법이 포함됩니다. 라우팅 결정이 모델이 어떻게 특화되는지에 대한 통찰력을 제공할 수 있으므로 MoE를 더 해석 가능하게 만드는 연구도 진행 중입니다. 2025년 현재 MoE 라우팅은 활발한 연구 영역으로 남아 있으며, 새로운 아키텍처와 기법이 정기적으로 등장하고 있습니다.

결론

Mixture of Experts 라우팅은 입력별로 전문가의 하위 집합을 선택적으로 활성화하여 신경망을 확장하는 강력한 기법입니다. 앙상블 학습의 초기 뿌리에서 트랜스포머로의 현대적 통합에 이르기까지, MoE는 효율적이고 유능한 매우 큰 모델의 개발을 가능하게 했습니다. 더 크고 더 유능한 AI 시스템에 대한 수요가 증가함에 따라, MoE 라우팅은 Artificial intelligence의 진화에서 중심적인 역할을 계속할 것입니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:mixture-of-experts·routing·neural-networks·sparse-gating
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사