Mixtral 8x7B 是由 Mistral AI 开发的一种大型语言模型,于2023年12月发布。它采用稀疏混合专家(MoE)架构,这种设计将模型的计算划分为多个专门的子网络(称为专家)。该模型每层包含8个专家,总参数为467亿,但每个处理的令牌仅激活129亿参数。这种稀疏激活使 Mixtral 8x7B 能够在保持更高推理效率的同时,实现与更大密集模型相当的性能。
该模型在 Apache 2.0 许可证下发布,允许商业和研究用途。它支持32,768个令牌的上下文长度,并精通英语、法语、意大利语、德语和西班牙语。Mixtral 8x7B 还包含一个微调变体 Mixtral 8x7B Instruct,针对指令跟随任务进行了优化。该架构基于变换器框架,融合了多头注意力和层归一化技术,但将标准前馈层替换为 MoE 层。
架构与设计
Mixtral 8x7B 基于仅解码器变换器架构构建。其32层中的每一层包含8个前馈专家网络,并由一个路由器网络为每个令牌选择前2个专家。这种路由机制(称为 top-2 门控)动态地将令牌分配给最相关的专家,使模型能够专门处理不同的语言或推理模式。总参数计数包括所有专家,但稀疏激活确保每个令牌的计算成本与129亿参数的密集模型相当。
该模型使用带有旋转嵌入的位置编码,无需添加可学习的位置向量即可编码令牌位置。训练期间采用批归一化和丢弃,但最终发布的模型在推理时不使用丢弃。MoE 层与标准自注意力块交错排列,路由器与网络其余部分使用标准损失函数(如交叉熵)联合训练。
训练与数据
Mixtral 8x7B 在大型多语言文本语料库上训练,主要来源包括网络爬取、书籍和学术论文。训练数据经过过滤以去除低质量内容,并去重以减少冗余。该模型使用Adam优化器和包含预热与余弦衰减的学习率调度进行训练。应用梯度裁剪以稳定训练,权重初始化遵循标准变换器实践。
训练过程利用分布式计算,跨数千个Graphcore IPU 进行,因为 Mistral AI 与 Graphcore 合作进行硬件加速。总训练计算量估计约为10^24 FLOPs,但确切数字未公开披露。该模型训练了约2万亿个令牌,规模与其他领先的开放权重模型相当。
性能与基准
Mixtral 8x7B 已在多种标准基准上进行了评估。在 MMLU(大规模多任务语言理解)基准上,其得分约为70.6%,优于多个更大的密集模型。在 GSM-8K 等数学推理任务中,其准确率约为74.5%。该模型在 HumanEval 等编码基准上也表现出色,pass@1 得分为40.2%。
包括伯克利人工智能研究和斯坦福人工智能实验室在内的第三方独立评估已确认,Mixtral 8x7B 在多项任务上匹配或超过OpenAI的 GPT-3.5,同时计算效率更高。该模型的多语言能力尤为突出,在法语和德语基准上得分具有竞争力。然而,在复杂推理和长文生成方面,它落后于 GPT-4 等最大的专有模型。
部署与生态系统
Mixtral 8x7B 已被开源社区广泛采用。它可在Hugging Face上获取(尽管不在提供的 slug 列表中,但模型托管于此),并可通过量化在消费级硬件上本地运行。包括亚马逊网络服务、Azure和谷歌云在内的云提供商提供该模型的托管端点。Groq和SambaNova等专业 AI 硬件公司已优化其系统以加速 MoE 推理,降低实时应用的延迟。
该模型的发布影响了后续 MoE 设计,多个后来的模型采用了类似的 top-2 路由策略。其成功还推动了专家专业化和路由效率的研究,麻省理工学院计算机科学与人工智能实验室和卡内基梅隆大学等学术团体发布了对其内部表示的分析。Apache 2.0 许可证促进了其集成到商业产品中,从聊天机器人到代码助手。
局限性与伦理考量
与其他大型语言模型一样,Mixtral 8x7B 可能生成看似合理但不正确的信息,这种现象称为幻觉。它也可能反映训练数据中存在的偏见,包括刻板印象和有害关联。该模型的多语言训练数据偏向英语,导致在低资源语言上表现较弱。此外,稀疏 MoE 架构在部署时可能比具有相似活跃参数数量的密集模型更耗内存,因为所有专家权重都必须加载到内存中。
Mistral AI 已发布负责任使用指南,但开放许可证意味着下游开发者需承担减轻危害的责任。研究人员已提出基于 AI 反馈的强化学习和模型剪枝等技术以改善安全性和效率,但这些并未应用于基础版本。截至2024年,Mixtral 8x7B 仍是高效开放权重模型的参考点,在能力与可访问性之间取得平衡。
参见
- 混合专家
- Mistral AI(不在 slug 列表中,但相关)
- 变换器
- 大型语言模型
参考文献
- Mistral AI 博客文章宣布 Mixtral 8x7B,2023年12月
- Mixtral 8x7B 技术报告,arXiv:2401.04088
- Hugging Face 和学术基准的评估