译自英文

路由器网络是混合专家模型中的门控组件,它为每个输入选择或加权专家网络,从而在大语言模型中实现稀疏激活。

路由器网络,也称为门控函数或加权函数,是混合专家(MoE)机器学习模型中的一个组件。它接收输入并产生一组权重,这些权重决定每个专家网络对输出的贡献程度。在现代大型语言模型中,路由器网络通常用于仅为每个输入令牌选择一小部分专家,这种技术称为稀疏激活,它在保持模型容量的同时降低了计算成本。

MoE中的路由概念可以追溯到早期关于委员会机器和自适应局部专家混合的研究。在典型的MoE架构中,有多个专家网络,每个网络可能专门处理输入空间的不同区域,以及一个路由器网络,它学习将输入分配给适当的专家。路由器的输出可以是专家上的概率分布,或一组非负权重,这些权重通过加权和与专家输出相结合。

基本架构

在标准的MoE设置中,路由器网络是一个函数 \( w(x) \),它将输入 \( x \) 映射到权重向量 \( (w(x)_1, ..., w(x)_n) \),其中 \( n \) 是专家数量。最终输出计算为 \( f(x) = \sum_{i=1}^n w(x)_i f_i(x) \),其中 \( f_i \) 是第 \( i \) 个专家。路由器和专家通常通过梯度下降在损失函数(如均方误差或交叉熵)上联合训练。

路由器网络本身通常是一个小型神经网络,例如线性层后接softmax激活函数。在稀疏MoE模型中,路由器可能使用top-k选择机制,其中仅激活权重最高的专家,其余被忽略。这种稀疏性是降低计算成本的关键,因为它允许模型对每个输入仅使用其总参数的一小部分。

历史发展

使用门控网络组合多个专家的想法在1990年代得到了探索。一个早期例子是meta-pi网络,由Hampshire和Waibel报告,它使用专家输出的加权和,并在音素分类任务上进行训练。在他们的实验中,他们训练了六个专家,每个都是时间延迟神经网络,用于对六位日语发言者的语音进行分类。他们观察到,路由器网络学会了将五个专家分配给五位单独的发言者,而第六位发言者的声音则由其他男性发言者的专家组合来处理。

另一个有影响力的早期模型是自适应局部专家混合,它使用高斯混合模型。在这种方法中,每个专家预测具有固定协方差的高斯分布,而路由器是一个线性softmax函数,根据输入分配权重。该模型表明,路由可以用于将输入空间划分为同质区域,每个专家专门处理一个局部区域。

在现代大型语言模型中的作用

在2020年代,路由器网络成为使用MoE层的大型语言模型(LLM)中的核心组件。诸如Google DeepMindOpenAI等公司开发的模型已采用稀疏MoE架构,以在不按比例增加推理成本的情况下扩展参数数量。在这些模型中,每个Transformer层可能包含多个专家,路由器网络为每个令牌选择几个专家。

例如,在基于Transformer的LLM中,输入令牌嵌入通过路由器网络,该网络计算专家上的概率分布。路由器然后选择top-k专家(例如,k=2或k=4),并将输出计算为这些专家输出的加权和。这允许模型拥有数十亿参数,同时仅为每个令牌激活一小部分,从而使训练和推理更加高效。

稀疏激活和负载均衡

稀疏激活是MoE模型中路由器网络的关键优势。通过仅为每个输入激活少数专家,模型可以拥有较大的总参数数量,但有效计算成本要小得多。然而,这引入了负载均衡的挑战:如果路由器始终选择相同的少数专家,这些专家会过载,而其他专家则利用不足。为了解决这个问题,现代MoE模型通常包含辅助损失函数,鼓励路由器更均匀地在专家之间分配令牌。

已经提出了各种技术来改善路由器性能,例如在训练期间向路由器的logits添加噪声以促进探索,或使用可微分的top-k选择。一些模型还使用分层路由方案,其中第一级路由器选择一组专家,第二级路由器在该组内进行选择。

与其他技术的关系

路由器网络与机器学习中的其他概念密切相关,例如多头注意力交叉注意力,它们也涉及基于输入对不同组件进行加权。然而,注意力机制对输入序列的不同部分进行加权,而路由器网络对不同的专家网络进行加权,这些专家网络通常是独立的函数逼近器。

路由器网络与模型剪枝也有相似之处,因为两者都旨在降低计算成本,但剪枝会永久移除参数,而路由则动态选择每个输入要使用的参数。此外,路由器网络可以被视为一种集成学习形式,因为它们组合多个模型的输出,但与传统的集成不同,专家与路由器是联合训练的。

实现和训练

在实践中,路由器网络实现为一个线性层,它接收输入表示并为每个专家输出logits。然后,logits通过softmax函数产生权重。在训练期间,路由器和专家通过反向传播联合更新。损失函数通常包括任务损失(例如,语言建模的交叉熵)和辅助负载均衡损失。

训练路由器网络的一个挑战是专家的离散选择(例如,top-k)是不可微分的。为了克服这一点,许多实现直接在训练期间使用softmax权重,或对top-k选择使用直通估计器。一些模型还为每一层使用单独的路由器网络,允许不同层专门处理不同类型的路由决策。

语言模型之外的应用

虽然路由器网络在LLM中最为突出,但它们也用于其他领域。例如,在计算机视觉中,带有路由器的MoE层已应用于图像分类和生成任务。在语音识别中,早期MoE模型使用路由器来划分声学空间。路由器网络也用于强化学习,其中不同的专家可以代表不同的策略,路由器根据状态选择适当的策略。

人工智能研究的背景下,路由器网络是一个活跃的研究领域,持续致力于提高路由效率、可解释性和可扩展性。斯坦福AI实验室伯克利AI研究等机构的研究人员为理解大规模模型中路由器的行为做出了贡献。

挑战和未来方向

尽管取得了成功,路由器网络仍面临几个挑战。一个问题是路由器可能成为瓶颈,因为它必须处理每个输入并快速做出路由决策。另一个挑战是路由器可能学习到对整体任务不是最优的路由输入方式,导致性能下降。此外,辅助负载均衡损失可能干扰主要任务损失,需要仔细调整。

未来的研究可能探索更复杂的路由机制,例如考虑输入内容更细致的学习路由策略,或减少每级考虑的专家数量的分层路由。还有兴趣使路由器更具可解释性,以便能够理解为什么特定输入被路由到某个专家。

总之,路由器网络是MoE模型中的基本组件,能够实现高效的扩展和专业化。它从早期的门控函数发展到现代LLM中的稀疏路由器,展示了机器学习技术几十年的演变过程。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·neural-networks·mixture-of-experts
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史