混合专家(MoE)路由是机器学习中的一种技术,其中神经网络包含多个专门的子网络(称为专家)以及一个门控机制,该机制为每个输入选择要激活的专家。在现代深度学习的背景下,路由通常是稀疏的:对于每个词元或输入,仅使用一小部分专家,这使得模型可以拥有非常大的总参数数量,同时保持每次推理的计算成本低于类似规模的密集模型。这种方法已成为扩展大型语言模型和其他生成式AI系统的基石。
该概念源于经典的集成学习,其中多个学习器将问题空间划分为同质区域。20世纪90年代的早期工作,如元π网络和局部专家自适应混合,奠定了理论基础。在现代实现中,MoE路由通常集成到Transformer (architecture)架构中,其中前馈层被一组专家网络和一个路由器取代,路由器将词元分派到最相关的专家。这种设计使得Google DeepMind和其他实验室开发的模型能够以高效的训练和推理实现最先进的性能。
历史起源
MoE路由的根源可以追溯到20世纪90年代初,当时研究人员探索了委员会机器和集成方法。一个值得注意的早期系统是元π网络,由Hampshire和Waibel报告,该网络使用加权函数组合多个时间延迟神经网络的输出。在他们对六名日语说话者音素分类的实验中,他们训练了六名专家,并发现门控函数学会为每个说话者分配一名专家,除了一名男性说话者,其声音由其他男性专家的线性组合处理。这证明了MoE能够在输入空间的不同区域上专门化专家。
另一项基础工作是局部专家自适应混合,它使用高斯混合模型,其中每个专家预测一个简单的高斯分布。门控函数是一个线性softmax函数,根据输入分配权重。这些早期模型确立了MoE的核心组件:一组专家、一个门控函数以及基于梯度下降的训练过程。
稀疏门控和现代路由
现代MoE路由,如大规模神经网络中所使用的,采用稀疏门控。路由器不是计算所有专家的加权和,而是为每个词元选择前k个专家(通常k=1或k=2)。这种稀疏性对效率至关重要:如果激活所有专家,计算成本将随专家数量线性增长,从而失去意义。稀疏路由允许模型拥有数百或数千个专家,而每个词元仅激活少数几个,从而保持每个词元的浮点运算量可控。
路由函数通常是一个学习到的线性层,后跟对专家集的softmax。在训练期间,路由器根据词元的表示学习将词元分配给专家。然而,朴素的稀疏路由可能导致负载不平衡,其中少数专家接收大多数词元,而其他专家利用不足。为了解决这个问题,现代实现使用辅助损失来鼓励平衡路由,例如Switch Transformer中引入的负载平衡损失。
与Transformer的集成
在基于Transformer (architecture)的模型中,MoE路由最常应用于前馈网络(FFN)子层。在标准transformer中,每个词元通过一个密集FFN。在MoE transformer中,FFN被一组专家FFN取代,路由器决定每个词元由哪些专家处理。这种设计由Google DeepMind的研究人员于2021年推出的Switch Transformer推广,该模型在训练大型模型方面实现了显著的加速。另一个有影响力的架构是GShard框架中的混合专家层,它实现了高效的多语言机器翻译。
这些MoE transformer已被许多大型语言模型采用,包括来自OpenAI、Anthropic和其他组织的模型。例如,GPT-4和Claude等模型据报道使用MoE架构,尽管具体细节通常是专有的。路由机制允许这些模型扩展到数万亿参数,同时保持合理的推理成本。
路由算法和负载平衡
已经开发了几种路由算法来提高MoE的效率和有效性。最常见的是top-k路由,其中路由器选择门控分数最高的k个专家。变体包括噪声top-k路由,它在训练期间向门控分数添加噪声以鼓励探索,以及专家选择路由,其中每个专家选择顶部词元而不是词元选择专家。后者由Google研究人员于2022年提出,可以改善负载平衡和训练稳定性。
负载平衡是一个关键挑战。如果没有显式机制,路由器可能崩溃为总是选择同一专家,导致利用率低下。Switch Transformer引入了一个辅助损失,惩罚词元分配中的不平衡。其他方法包括可微分哈希和分层路由,其中第一级路由器选择一组专家,第二级路由器在组内选择。
在大型语言模型中的应用
MoE路由已成为扩展大型语言模型的标准技术。它允许模型拥有大量参数(例如,1万亿),而每个词元仅使用其中一小部分,这对于在生产环境中服务模型至关重要。OpenAI、Anthropic和Google DeepMind等公司已将MoE集成到其旗舰模型中。例如,Mistral AI的Mixtral模型使用稀疏MoE架构,具有8个专家,每个词元激活2个,并实现了与更大密集模型竞争的性能。
除了语言模型,MoE路由还用于其他领域,如计算机视觉和语音识别。例如,V-MoE模型将MoE应用于视觉transformer,GShard架构已用于神经机器翻译。该技术也与Amazon Web Services和Google Cloud的产品相关,这些产品提供用于训练和服务MoE模型的基础设施。
挑战和未来方向
尽管有其优势,MoE路由仍面临几个挑战。一个主要问题是内存消耗:所有专家参数必须存储在内存中,即使只有少数被激活。这需要复杂的模型并行和内存管理,通常使用专家并行和卸载等技术。另一个挑战是训练不稳定性,因为路由器和专家可能进入导致振荡的反馈循环。研究人员提出了各种稳定技术,如梯度裁剪和仔细初始化。
未来方向包括更高效的路由算法、更好的负载平衡以及减少专家内存占用方法。还有正在进行的研究旨在使MoE更具可解释性,因为路由决策可以提供对模型如何专门化的见解。截至2025年,MoE路由仍是一个活跃的研究领域,新的架构和技术不断涌现。
结论
混合专家路由是一种强大的技术,通过选择性激活每个输入的专家子集来扩展神经网络。从其早期在集成学习中的根源到现代在transformer中的集成,MoE已经使得开发极其庞大且高效和强大的模型成为可能。随着对更大和更强大AI系统的需求增长,MoE路由可能将继续在人工智能的演变中发挥核心作用。