희소 MoE 라우팅

영어에서 번역됨

희소 MoE 라우팅은 mixture-of-experts 신경망에서 각 입력 토큰을 소수의 전문가 서브네트워크에 할당하는 메커니즘으로, 토큰당 계산 비용을 줄이면서 대규모 모델 용량을 가능하게 한다.

Sparse MoE 라우팅은 Mixture of experts 신경망에서 각 입력 토큰을 처리할 전문가 하위 네트워크를 결정하는 메커니즘입니다. 희소 혼합 전문가 계층에서 라우터 또는 게이팅 함수는 입력을 평가하고 더 큰 풀에서 일반적으로 하나 또는 두 개의 소수의 전문가만 선택합니다. 이는 모든 전문가가 모든 출력에 기여하는 밀집 혼합 전문가와 대조됩니다. 라우팅 결정은 토큰별로 이루어지며, 입력 시퀀스의 서로 다른 부분이 서로 다른 전문가에 의해 처리될 수 있습니다. 이 설계는 모델의 총 매개변수 수를 증가시키면서 토큰당 계산 비용을 대략 일정하게 유지합니다. 선택된 전문가만 순방향 및 역방향 패스 중에 활성화되기 때문입니다.

이 개념은 1990년대 혼합 전문가에 대한 초기 연구에서 등장했지만, 희소 라우팅은 2010년대와 2020년대에 대규모 언어 모델을 밀집 Transformer (architecture) 아키텍처의 한계를 넘어 확장하는 방법으로 실질적으로 중요해졌습니다. 토큰을 전문화된 전문가에게 라우팅함으로써 모델은 모든 매개변수가 모든 입력에 대해 활성화될 필요 없이 데이터의 다양한 패턴을 포착할 수 있습니다. Sparse MoE 라우팅은 이제 Google DeepMind, OpenAI 및 기타 연구 기관에서 개발한 여러 주요 프로덕션 모델의 핵심 구성 요소입니다.

역사적 기원

혼합 전문가의 기본 아이디어는 1990년대 초로 거슬러 올라갑니다. Robert A. Jacobs, Michael I. Jordan, Steven J. Nowlan 및 Geoffrey E. Hinton을 포함한 연구자들은 1991년에 적응형 로컬 전문가 혼합 아키텍처를 도입했으며, 여기서 게이팅 네트워크가 여러 전문가 네트워크의 출력에 가중치를 부여했습니다. 같은 시기에 John Hampshire와 Alex Waibel의 메타-파이 네트워크는 6명의 일본어 화자의 데이터에 대해 6개의 시간 지연 신경망을 훈련하여 음성 음소 분류에 유사한 가중치 방식을 적용했습니다. 이러한 초기 시스템은 모든 전문가가 각 출력에 기여하는 밀집 가중치를 사용했지만, 전문가 함수, 게이팅 함수 및 가중 결합이라는 핵심 구성 요소를 확립했습니다.

전문가의 하위 집합만 활성화되는 희소 라우팅은 1990년대 후반과 2000년대 초반에 탐구되었지만, 딥러닝의 부상과 함께 주목을 받았습니다. 2017년에 Google DeepMind의 연구자들은 각 입력에 대해 상위 k개 전문가를 선택하는 훈련 가능한 게이팅 네트워크를 도입한 희소 게이팅 혼합 전문가 계층을 발표했습니다. 이 연구는 희소 활성화가 계산의 비례적 증가 없이 모델 용량을 극적으로 증가시킬 수 있음을 입증하여 이후 대규모 응용의 길을 열었습니다.

라우팅 메커니즘

희소 MoE 계층에서 라우팅 메커니즘은 일반적으로 전문가 차원에 대한 소프트맥스가 뒤따르는 선형 계층으로 구성된 게이팅 함수로 구성됩니다. 입력 토큰 표현 \(x\)에 대해 라우터는 \(n\)개의 각 전문가에 대한 점수를 계산하며, 종종 \(w(x)_i = \text{softmax}(W_g x)_i\)로 표현됩니다. 여기서 \(W_g\)는 학습 가능한 가중치 행렬입니다. 그런 다음 라우터는 가장 높은 점수를 가진 상위 k개 전문가를 선택하며, 여기서 k는 일반적으로 1 또는 2로 설정된 하이퍼파라미터입니다. 계층의 출력은 선택된 전문가의 출력의 가중 합이며, 가중치는 선택된 전문가 간에 정규화됩니다.

이 토큰별 선택은 모델이 전문화할 수 있게 합니다. 서로 다른 전문가는 다른 언어, 도메인 또는 구문 패턴과 같은 다른 유형의 입력을 처리하는 방법을 학습할 수 있습니다. 라우팅 결정은 추론 중에 결정적이지만, 훈련 중에는 라우터가 전문가와 함께 공동으로 훈련되어야 합니다. 상위 k 선택은 미분 가능하지 않기 때문에 연구자들은 탐색과 부하 균형을 장려하기 위해 훈련 중에 로짓에 학습 가능한 노이즈를 추가하는 직선 추정기 또는 노이즈가 있는 상위 k 게이팅과 같은 기술을 사용합니다.

부하 균형 및 보조 손실

Sparse MoE 라우팅의 주요 과제는 전문가가 대략 균등하게 사용되도록 하는 것입니다. 개입이 없으면 라우터는 소수의 전문가가 대부분의 토큰을 받고 다른 전문가는 충분히 활용되지 않아 효과적인 용량이 감소하는 상태로 수렴할 수 있습니다. 이를 해결하기 위해 모델은 전문가 간의 불균형한 토큰 분포에 페널티를 주는 보조 부하 균형 손실을 통합합니다. google 연구자들이 2021년 Switch Transformer에서 도입한 일반적인 접근 방식은 각 전문가에게 라우팅된 토큰의 비율에 해당 전문가의 평균 라우터 확률을 곱한 값에 비례하는 손실 항을 추가합니다. 이는 라우터가 토큰을 더 균일하게 분배하도록 장려합니다.

또 다른 기술은 전문가 용량으로, 주어진 배치에서 각 전문가가 처리할 수 있는 토큰 수를 제한합니다. 전문가가 용량에 도달하면 초과 토큰은 삭제되거나 잔여 연결로 라우팅됩니다. 이는 단일 전문가가 병목 현상이 되는 것을 방지하고 예측 가능한 계산을 보장합니다. DeepSeek-V3(2024)에서 사용된 보조 손실 없는 라우팅과 같은 최근 방법은 명시적 보조 손실 없이 동적 바이어스 조정을 사용하여 부하를 균형화합니다.

확장 및 효율성

Sparse MoE 라우팅은 밀집 모델이 허용하는 것보다 훨씬 더 많은 모델 매개변수 확장을 가능하게 합니다. 예를 들어, Switch Transformer는 최대 1.6조 개의 매개변수를 가진 모델을 도입했지만 각 토큰은 그 중 극히 일부만 활성화했습니다. 유사하게, 2023년 Mistral AI가 출시한 Mixtral 8x7B는 계층당 8개의 전문가를 사용하고 토큰당 2개를 활성화하여 더 큰 밀집 모델과 비교 가능한 성능을 달성하면서 토큰당 더 적은 계산을 사용합니다. Google의 GShard(2020)는 기계 번역에 Sparse MoE를 적용했으며, GLaM(2021) 및 PaLM(2022)과 같은 이후 모델은 효율성을 위해 MoE 계층을 통합했습니다.

효율성 향상은 토큰당 계산 비용이 총 매개변수 수가 아닌 활성 전문가 수에 따라 달라진다는 사실에서 비롯됩니다. 이를 통해 모델은 정확도를 향상시킬 수 있는 더 많은 매개변수를 가질 수 있으면서 추론 및 훈련 비용을 관리 가능하게 유지할 수 있습니다. 그러나 Sparse MoE 모델은 모든 전문가 매개변수를 저장하기 위해 더 많은 메모리가 필요하며, 토큰이 다른 장치에 있을 수 있는 전문가로 라우팅되어야 하므로 분산 훈련에서 통신 오버헤드를 도입합니다.

대규모 언어 모델에서의 응용

Sparse MoE 라우팅은 대규모 언어 모델에서 표준 기술이 되었습니다. 많은 오픈 가중치 및 독점 모델이 품질과 비용의 균형을 맞추기 위해 MoE 계층을 사용합니다. 예를 들어, Mistral AI의 Mixtral 8x7B 및 Mixtral 8x22B, Alibaba의 Qwen1.5-MoE, DeepSeek의 DeepSeek-V2 및 V3는 모두 희소 라우팅을 사용합니다. 독점 공간에서 OpenAI의 GPT-4는 혼합 전문가 아키텍처를 사용하는 것으로 널리 알려져 있지만, 회사는 세부 사항을 확인하지 않았습니다. Anthropic의 Claude 모델과 Google의 Gemini 모델도 공개 성명과 특허를 기반으로 MoE 계층을 통합할 가능성이 높습니다.

이러한 모델은 도메인, 언어 또는 추론 작업에 걸쳐 전문가를 전문화하기 위해 라우팅을 사용합니다. 예를 들어, 일부 전문가는 수학적 추론을 처리하는 반면 다른 전문가는 코드 생성 또는 다국어 텍스트에 집중할 수 있습니다. 라우터는 입력 컨텍스트를 기반으로 토큰을 적절한 전문가로 지시하는 방법을 학습하여 모든 전문가가 모든 토큰을 처리할 필요 없이 전반적인 성능을 향상시킵니다.

훈련 과제

Sparse MoE 모델 훈련은 부하 균형 외에도 고유한 과제를 제시합니다. 라우터는 매개변수의 작은 변화가 라우팅 결정의 큰 변화로 이어져 훈련 발산을 유발하는 불안정성을 겪을 수 있습니다. 노이즈가 있는 상위 k 게이팅 및 라우터 드롭아웃과 같은 기술은 훈련을 안정화하는 데 도움이 됩니다. 또한 전문가가 너무 일찍 전문화되어 모델이 일반화하지 못하는 일종의 모드 붕괴로 이어질 수 있습니다. 연구자들은 이를 완화하기 위해 전문가 드롭아웃 및 라우팅 정규화와 같은 방법을 제안했습니다.

또 다른 과제는 분산 훈련의 통신 오버헤드입니다. 일반적인 설정에서 각 전문가는 다른 장치에 배치되며, 토큰은 원래 장치에서 선택된 전문가를 호스팅하는 장치로 전송되어야 합니다. 이 all-to-all 통신은 특히 큰 배치 크기에서 병목 현상이 될 수 있습니다. Megatron 및 DeepSpeed 라이브러리의 구현과 같은 효율적인 구현은 최적화된 통신 일정을 사용하여 이 오버헤드를 줄입니다.

최근 개발

최근 연구는 라우팅 품질을 개선하고 MoE 모델의 비용을 줄이는 데 중점을 두고 있습니다. Mixture-of-Depths(2024) 접근 방식은 희소성의 아이디어를 깊이 차원으로 확장하여 토큰을 다른 전문가에게 라우팅할 뿐만 아니라 계층을 완전히 건너뛰게 합니다. 또 다른 방향은 전문가가 더 작고 더 많아져 더 세분화된 전문화를 허용하는 미세 입자 전문가 분할입니다. 예를 들어, DeepSeek-V3는 계층당 256개의 전문가를 사용하고 8개만 활성화하여 훈련 비용을 줄이면서 최첨단 성능을 달성합니다.

하드웨어 및 소프트웨어 공동 설계도 발전했습니다. NVIDIAAMD와 같은 회사는 MoE 추론을 위해 가속기를 최적화했으며, vLLM 및 TensorRT-LLM과 같은 프레임워크는 효율적인 MoE 서빙을 지원합니다. 엣지 배포에 대한 관심이 증가하면서 제한된 메모리를 가진 장치에 맞추기 위해 전문가 가지치기 및 양자화와 같은 MoE 모델 압축에 대한 연구가 이루어졌습니다.

미래 방향

Sparse MoE 라우팅은 여전히 활발한 연구 분야입니다. 최적의 전문가 수와 라우팅 세분성을 자동으로 결정하는 방법, 라우팅을 더 해석 가능하게 만드는 방법, MoE를 Model Pruning 및 양자화와 같은 다른 효율성 기술과 결합하는 방법에 대한 공개 질문이 있습니다. 모델이 계속 확장됨에 따라 희소 라우팅은 능력과 계산 비용의 균형을 맞추는 데 중심적인 역할을 하여 과도한 리소스 요구 없이 더 강력한 AI 시스템을 가능하게 할 것입니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:mixture-of-experts·neural-networks·efficiency·routing
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사