Mixture of experts

영어에서 번역됨

신경망 아키텍처로, 각 입력을 훨씬 더 큰 풀에서 소수의 전문 하위 네트워크(전문가라고 함)의 작은 부분집합으로 라우팅하여, 총 매개변수 수가 토큰당 계산량의 비례적 증가 없이 늘어날 수 있게 한다.

Mixture of experts(일반적으로 MoE로 약칭)는 신경망 아키텍처로, 모델이 experts라고 불리는 많은 전문 하위 네트워크를 포함하지만 주어진 입력에 대해 그 중 일부만 활성화되는 구조입니다. 라우팅 메커니즘(일반적으로 자체적인 작은 학습 네트워크)은 각 입력(예: Transformer (architecture) 계층의 토큰)을 검사하여 어떤 experts가 이를 처리할지 결정합니다. 이러한 희소 활성화 패턴을 통해 모델의 총 매개변수 수는 매우 커질 수 있지만 각 토큰을 처리하는 데 필요한 계산량은 훨씬 적게 유지됩니다. 왜냐하면 특정 입력에 대해 모델의 대부분 매개변수가 유휴 상태로 남아 있기 때문입니다.

핵심 아이디어는 딥러닝 시대 이전인 1990년대 초반의 적응형 로컬 experts 혼합에 대한 초기 연구로 거슬러 올라가지만, 대규모 Transformer (architecture) 기반 모델의 부상과 함께 부활하여 상당히 확장되었습니다. Google 연구자들은 2010년대 후반에 대규모 언어 모델에 통합된 희소 게이트 혼합 전문가 계층을 시연했으며, 이 접근 방식은 2020년대 초반을 통해 Large language model 용량을 확장하는 방법으로 널리 채택되었습니다. 2023년 12월에 출시된 Mistral AI의 Mixtral 모델은 가장 큰 연구소 외부에서 이 접근 방식을 가장 두드러지게 공개적으로 시연한 사례 중 하나였으며, MoE 아키텍처는 또한 일부 주요 연구소의 가장 큰 프론티어 모델(보고된 GPT-4 설계 측면 포함)의 기반이 되는 것으로 널리 추정되었지만 항상 공식적으로 확인된 것은 아닙니다.

작동 방식

일반적인 MoE transformer에서 각 transformer 블록에 있는 표준 밀집 피드포워드 계층은 8개에서 수백 개에 이르는 병렬 expert 하위 네트워크 세트와 게이팅 또는 라우터 네트워크로 대체됩니다. 계층을 통과하는 각 토큰에 대해 라우터는 모든 expert에 대한 점수를 계산하고 상위 몇 개(일반적으로 1~2개)만 선택하여 해당 토큰을 실제로 처리하게 합니다. 선택된 experts의 출력은 종종 라우터의 신뢰도에 따라 가중치가 적용되어 결합되며 계층의 출력을 생성합니다. 토큰당 일부 experts만 사용되기 때문에 단일 순방향 패스에 대한 활성(또는 "활성화된") 매개변수 수는 모델의 총 매개변수 수보다 훨씬 작을 수 있으며, 총 수백억 개의 매개변수를 가진 모델이 Inference (AI) 측면에서 훨씬 더 작은 밀집 모델과 대략 동일한 계산 비용으로 실행될 수 있습니다.

장점과 절충점

MoE의 주요 장점은 총 모델 용량과 토큰당 계산 비용을 분리하는 것으로, 모델이 많은 experts에 걸쳐 더 많은 지식과 전문 기능을 저장할 수 있으면서도 사용 비용이 비례적으로 증가하지 않도록 합니다. 이는 고정 계산 예산 하에서 더 큰 효과적인 용량에 도달할 수 있으므로 훈련 효율성과 서빙 시 Inference (AI) 효율성 모두에서 MoE를 매력적으로 만들었습니다. 그러나 절충점은 실재합니다. MoE 모델은 토큰당 몇 개만 사용되더라도 모든 experts를 유지하기 위해 상당히 더 많은 총 메모리가 필요하므로 비용 부담이 원시 계산보다 메모리와 저장 공간으로 이동합니다. 라우팅은 훈련 중 불안정하거나 불균형할 수 있으며, 특정 부하 균형 기술을 사용하지 않으면 일부 experts가 다른 experts보다 훨씬 더 많은 트래픽을 받을 수 있습니다. 또한 MoE 모델은 역사적으로 여러 가속기에서 효율적으로 훈련하고 서빙하는 것이 동등한 성능의 밀집 모델보다 더 복잡했습니다.

채택

2024년과 2025년까지 mixture-of-experts는 오픈 가중치 및 비공개 프론티어 모델 모두에서 일반적인 아키텍처 선택이 되었으며, DeepSeek-R1, 여러 Qwen 변형, Grok을 포함한 시스템에 나타나 일반적으로 총 매개변수 수를 수백억 단위로 매우 크게 늘리면서 토큰당 활성 계산을 훨씬 더 적당하고 서비스 가능한 범위로 유지하는 방법으로 사용되었습니다. 이 기술은 대규모 언어 모델을 규모에 맞게 서빙하는 비용을 관리하기 위해 연구소가 사용하는 주요 수단 중 하나로 QuantizationKnowledge distillation과 함께 자주 논의됩니다.

분류:model-architecture·efficiency·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사