译自英文

稀疏MoE路由是混合专家神经网络中的一种机制,它将每个输入令牌分配给一小部分专家子网络,从而在降低每个令牌计算成本的同时实现大规模模型容量。

稀疏MoE路由是Mixture of experts神经网络中的一种机制,用于确定每个输入标记由哪些专家子网络处理。在稀疏混合专家层中,路由器或门控函数评估输入,并从较大的专家池中仅选择少量专家(通常为一个或两个)进行处理。这与密集混合专家形成对比,后者中所有专家都对每个输出做出贡献。路由决策是针对每个标记做出的,允许输入序列的不同部分由不同的专家处理。这种设计增加了模型的参数总量,同时保持每个标记的计算成本大致不变,因为在前向和后向传播中仅激活选定的专家。

这一概念源于20世纪90年代关于混合专家的早期工作,但稀疏路由在2010年代和2020年代变得实际重要,成为将大型语言模型扩展到超越密集Transformer (architecture)架构限制的一种方式。通过将标记路由到专门的专家,模型可以捕捉数据中的多样化模式,而无需为每个输入激活所有参数。稀疏MoE路由现已成为多个知名生产模型的核心组件,包括由Google DeepMindOpenAI和其他研究组织开发的模型。

历史起源

混合专家的基础思想可以追溯到20世纪90年代初。包括Robert A. Jacobs、Michael I. Jordan、Steven J. Nowlan和Geoffrey E. Hinton在内的研究人员于1991年引入了自适应局部专家混合架构,其中门控网络对多个专家网络的输出进行加权。大约在同一时间,John Hampshire和Alex Waibel的meta-pi网络将类似的加权方案应用于语音音素分类,使用六名日语说话者的数据训练了六个时延神经网络。这些早期系统使用密集加权,意味着所有专家都对每个输出做出贡献,但它们确立了核心组件:专家函数、门控函数和加权组合。

稀疏路由(仅激活部分专家)在20世纪90年代末和21世纪初得到探索,但随着深度学习的兴起而获得发展势头。2017年,Google DeepMind的研究人员发表了稀疏门控混合专家层,引入了一个可训练的门控网络,为每个输入选择top-k专家。这项工作表明,稀疏激活可以大幅增加模型容量,而无需成比例增加计算量,为后来的大规模应用铺平了道路。

路由机制

在稀疏MoE层中,路由机制由门控函数组成,通常是线性层后接专家维度上的softmax。对于输入标记表示\(x\),路由器为\(n\)个专家中的每一个计算分数,通常为\(w(x)_i = \text{softmax}(W_g x)_i\),其中\(W_g\)是可学习的权重矩阵。然后,路由器选择分数最高的top-k专家,其中k是超参数,通常设置为1或2。该层的输出是选定专家输出的加权和,权重在选定专家之间归一化。

这种逐标记选择允许模型实现专门化:不同的专家可以学习处理不同类型的输入,例如不同的语言、领域或句法模式。路由决策在推理期间是确定性的,但在训练期间,路由器必须与专家联合训练。由于top-k选择是不可微的,研究人员使用诸如直通估计器或噪声top-k门控等技术,后者在训练期间向logits添加可学习噪声,以鼓励探索和负载均衡。

负载均衡与辅助损失

稀疏MoE路由的一个主要挑战是确保专家被大致均匀地使用。如果不加干预,路由器可能收敛到少数专家接收大多数标记的状态,而其他专家利用不足,从而降低有效容量。为解决这一问题,模型引入了辅助负载均衡损失,惩罚跨专家的标记分布不平衡。一种常见方法由google研究人员在Switch Transformer(2021)中引入,添加一个损失项,与路由到每个专家的标记比例乘以该专家的平均路由器概率成正比。这鼓励路由器更均匀地分配标记。

另一种技术是专家容量,它限制了每个专家在给定批次中可以处理的标记数量。如果专家达到容量上限,多余的标记要么被丢弃,要么被路由到残差连接。这防止任何单个专家成为瓶颈,并确保计算可预测。更近期的方法,如DeepSeek-V3(2024)中使用的无辅助损失路由,使用动态偏置调整来平衡负载,而无需显式辅助损失。

扩展与效率

稀疏MoE路由使得模型参数扩展远超密集模型所能达到的规模。例如,Switch Transformer引入了参数高达1.6万亿的模型,但每个标记仅激活其中一小部分。同样,Mistral AI于2023年发布的Mixtral 8x7B每层使用八个专家,每个标记激活两个,在每标记计算量更少的情况下实现了与更大密集模型相当的性能。Google的GShard(2020)将稀疏MoE应用于机器翻译,后来的模型如GLaM(2021)和PaLM(2022)也加入了MoE层以提高效率。

效率提升源于每标记的计算成本与激活专家数量成正比,而非总参数数量。这使得模型可以拥有更多参数(这可以提高准确性),同时保持推理和训练成本可控。然而,稀疏MoE模型需要更多内存来存储所有专家参数,并且在分布式训练中引入通信开销,因为标记必须被路由到可能位于不同设备上的专家。

在大型语言模型中的应用

稀疏MoE路由已成为大型语言模型中的标准技术。许多开放权重和专有模型使用MoE层来平衡质量与成本。例如,Mistral AI的Mixtral 8x7B和Mixtral 8x22B、阿里巴巴的Qwen1.5-MoE以及DeepSeek的DeepSeek-V2和V3都采用了稀疏路由。在专有领域,OpenAI的GPT-4被广泛报道使用混合专家架构,尽管该公司尚未确认细节。Anthropic的Claude模型和Google的Gemini模型也可能包含MoE层,基于公开声明和专利。

这些模型使用路由来跨领域、语言或推理任务实现专家专门化。例如,一些专家可能处理数学推理,而其他专家专注于代码生成或多语言文本。路由器学习根据输入上下文将标记引导到适当的专家,从而提高整体性能,而无需所有专家处理每个标记。

训练挑战

训练稀疏MoE模型带来了负载均衡之外的独特挑战。路由器可能遭受不稳定性,参数的小变化导致路由决策的大幅变化,从而引起训练发散。噪声top-k门控和路由器上的dropout等技术有助于稳定训练。此外,专家可能过早专门化,导致一种模式坍缩,模型无法泛化。研究人员提出了专家dropout和路由正则化等方法来缓解这一问题。

另一个挑战是分布式训练中的通信开销。在典型设置中,每个专家放置在不同的设备上,标记必须从其原始设备发送到托管选定专家的设备。这种全对全通信可能成为瓶颈,尤其是在大批量场景下。Megatron和DeepSpeed库中的高效实现使用优化的通信调度来减少这种开销。

近期发展

近期研究聚焦于提高路由质量和降低MoE模型的成本。Mixture-of-Depths(2024)方法将稀疏性思想扩展到深度维度,不仅将标记路由到不同专家,还完全跳过某些层。另一个方向是细粒度专家分割,即专家更小且数量更多,允许更细粒度的专门化。例如,DeepSeek-V3每层使用256个专家,仅激活8个,在降低训练成本的同时实现了最先进的性能。

硬件和软件协同设计也取得了进展。NVIDIAAMD等公司已针对MoE推理优化了其加速器,vLLM和TensorRT-LLM等框架支持高效的MoE服务。对边缘部署日益增长的兴趣催生了压缩MoE模型的研究,例如专家剪枝和量化,以适应内存有限的设备。

未来方向

稀疏MoE路由仍是一个活跃的研究领域。开放问题包括如何自动确定最佳专家数量和路由粒度,如何使路由更具可解释性,以及如何将MoE与其他效率技术(如Model Pruning和量化)相结合。随着模型不断扩展,稀疏路由很可能在平衡能力与计算成本方面发挥核心作用,使更强大的AI系统成为可能,而无需过高的资源需求。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:mixture-of-experts·neural-networks·efficiency·routing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史