## 专家混合 **专家混合**(Mixture of Experts,简称MoE)是一种[[machine-learning|机器学习]]架构,它将多个独立的神经网络(称为“专家”)组合在一起,以解决复杂问题。该架构的核心思想是,通过一个门控网络(gating network)动态地选择最合适的专家来处理每个输入,从而在保持模型容量的同时,显著降低计算成本。 ### 工作原理 在专家混合模

译自英文

一种神经网络架构,将每个输入路由到大量专家中的一小部分专用子网络,使得总参数数量能够增长,而无需按比例增加每个词元的计算量。

混合专家(Mixture of experts,通常缩写为MoE)是一种神经网络架构,其中模型包含许多专门的子网络,称为专家,但对于任何给定输入,仅激活其中一小部分。路由机制(通常是一个小型的学习网络)检查每个输入(例如Transformer (architecture)层中的一个token),并决定应由哪些专家处理该输入。这种稀疏激活模式使得模型的总参数量可以增长到非常大,而处理每个token所需的计算量却保持小得多,因为对于任何特定输入,模型的大部分参数都处于空闲状态。

其核心思想可追溯至1990年代初关于自适应局部专家混合的早期研究,远早于深度学习时代,但随着大型基于Transformer (architecture)的模型的兴起,该方法被重新启用并大幅扩展。谷歌研究人员在2010年代末展示了将稀疏门控混合专家层集成到大型语言模型中的成果,该方法在2020年代初被广泛采用,作为扩展Large language model容量的一种方式。Mistral AI于2023年12月发布的Mixtral模型是大型实验室之外最突出的开放演示之一,而MoE架构也被广泛认为(尽管并非总是官方确认)是某些主要实验室最大前沿模型的基础,包括GPT-4设计中的相关报道。

工作原理

在典型的MoE transformer中,每个transformer块中的标准密集前馈层被替换为一组并行的专家子网络(通常数量从八个到数百个不等),以及一个门控或路由网络。对于通过该层的每个token,路由器计算每个专家的得分,并仅选择前几个(通常为一到两个)来实际处理该token;所选专家的输出随后被组合(通常按路由器的置信度加权)以产生该层的输出。由于每个token仅使用一部分专家,因此单次前向传播中的活跃(或“激活”)参数量可能远小于模型的总参数量,这使得总参数量达数千亿的模型在Inference (AI)时的计算成本大致相当于一个规模小得多的密集模型。

优势与权衡

MoE的主要优势在于将模型总容量与每token计算成本解耦,使模型能够在其众多专家中存储更多知识和专门能力,而无需按比例增加使用成本。这使得MoE在训练效率(因为在固定计算预算下可以达到更大的有效容量)和服务时的Inference (AI)效率方面都具有吸引力。然而,权衡也是实实在在的:MoE模型需要显著更多的总内存来容纳所有专家,尽管每个token仅使用其中少数几个,这使成本负担从原始计算转向内存和存储;路由在训练过程中可能不稳定或不平衡,除非使用特定的负载均衡技术,否则某些专家接收的流量可能远多于其他专家;并且与同等能力的密集模型相比,MoE模型在多个加速器上的训练和服务效率历来更为复杂。

采用情况

到2024年和2025年,混合专家已成为开放权重和封闭前沿模型中的常见架构选择,出现在包括DeepSeek-R1、多个Qwen变体和Grok在内的系统中,通常作为达到非常大总参数量(往往达数千亿)的一种方式,同时将每token的活跃计算保持在更为适中且可服务的范围内。该技术经常与QuantizationKnowledge distillation一起被讨论,是实验室在规模化服务大型语言模型时管理成本的主要手段之一。

分类:model-architecture·efficiency·deep-learning
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史