Mixtral 8x7B 是一个稀疏混合专家(MoE)大型语言模型,由 Mistral AI 于 2023 年 12 月发布。它采用仅解码器的Transformer架构,总参数为 467 亿,但通过路由机制每个输入 token 仅激活 129 亿参数,该机制在每一层从八个前馈模块中选择两个专家。这种设计使得模型在保持较低推理成本的同时,性能达到或超过规模更大的密集模型。发布内容包括基础模型和经过微调的指令跟随变体 Mixtral 8x7B Instruct,其权重在 Apache 2.0 许可证下公开发布。
该模型于 2023 年 12 月通过一篇博客文章和一个种子链接宣布,标志着开放权重生成式 AI领域的一个重要里程碑。它由 Mistral AI 开发,这是一家总部位于巴黎的初创公司,由前OpenAI和Google DeepMind研究人员于 2023 年创立。此次发布将 Mixtral 8x7B 定位为专有模型(如 OpenAI 的 GPT-3.5 和Anthropic的 Claude 2)的直接竞争对手,同时也挑战了 Meta 及其他实验室开放模型的主导地位。其混合专家架构借鉴了早期关于条件计算的研究,包括来自诺基亚贝尔实验室和Google DeepMind的工作,但在开源发布中以前所未有的规模加以应用。
架构与设计
Mixtral 8x7B 在 Transformer 的每个标准前馈网络位置使用稀疏 MoE 层。每一层包含八个专家网络,一个门控网络(通常是基于学习 logits 的 softmax)将每个 token 路由到排名前两位的专家。这种稀疏激活将每个 token 的计算成本降低到约 129 亿参数密集模型的水平,而 467 亿的总参数则提供了较大的知识容量。该模型支持 32,768 个 token 的上下文窗口,并支持多种语言,包括英语、法语、德语、西班牙语和意大利语。
路由机制采用端到端训练,无需辅助负载均衡损失,依靠自然分化将 token 分配给各个专家。这与早期需要显式平衡约束的 MoE 系统形成对比。该模型还采用多头注意力与分组查询注意力相结合的方式,减少了推理期间键值缓存的内存占用。该架构建立在 2017 年引入的Transformer框架之上,并针对稀疏计算和高效扩展进行了修改。
训练与数据
训练细节在发布公告中部分披露。Mixtral 8x7B 使用来自公开网络语料库的数据进行预训练,但未正式公布具体规模或构成。训练过程使用了Adam 优化器的一种变体,配合学习率调度,并采用了梯度裁剪和层归一化以保证稳定性。指令调优变体则通过监督微调进一步优化,使用了演示数据以及基于 AI 反馈的强化学习(一种类似于 RLHF 但使用 AI 生成偏好标签的技术)。
基础模型训练目标是预测序列中的下一个 token,使用标准的交叉熵损失函数。指令模型则针对遵循用户提示并生成有用、安全的响应进行了优化。Mistral AI 未披露确切的训练 token 数量,但独立分析表明,基于基准测试表现及与同类规模模型的比较,该模型很可能在超过 1 万亿 token 的庞大数据集上进行了训练。
性能与基准测试
Mixtral 8x7B 在一系列标准基准测试中表现出色。在 MMLU(大规模多任务语言理解)基准上,5-shot 设置下得分约为 70.6%,优于 GPT-3.5 和 Llama 2 70B。在 HellaSwag 常识推理测试中得分约为 86.7%,在 WinoGrande 指代消解任务中得分约为 81.2%。该模型在数学和代码生成方面同样表现优异,GSM-8K(数学推理)得分约为 74.5%,HumanEval(代码补全)得分约为 40.2%(基础模型),指令调优变体则提升至 42.2%。
在直接对比中,Mixtral 8x7B 在大多数任务上达到或超过了 Llama 2 70B 的性能,而推理时仅使用约六分之一的激活参数。它在包括 MMLU 和 HellaSwag 在内的多个基准上也优于规模更大的 GPT-3.5。该模型的效率使其适合部署在边缘设备和对成本敏感的环境中,尽管其 FP16 格式下约 90 GB 的总内存占用仍需要相当规模的硬件支持。发布版本还包含一个 4-bit 量化版本,可在配备 24 GB 显存的消费级 GPU 上运行。
影响与反响
Mixtral 8x7B 的发布在人工智能社区和主流媒体中获得了广泛报道。其开放权重允许研究人员和开发者无需 API 成本即可进行微调和部署,因此被称赞为促进了高性能语言模型的民主化。该模型还重新激发了人们对稀疏 MoE 架构的兴趣,影响了其他实验室的后续发布,包括阿里云的 Qwen-MoE 和AI21 Labs的 Jamba。独立评估指出,Mixtral 8x7B 展现了强大的多语言能力和稳健的推理性能,但也有评论者指出了开放模型常见的潜在偏见和安全隐患。
此次发布恰逢开放权重模型挑战专有系统的更广泛趋势。紧随其后,Mistral AI 于 2024 年 4 月发布了规模更大的 Mixtral 8x22B,该模型将相同架构扩展到 1410 亿总参数。Mixtral 8x7B 的成功也助力 Mistral AI 在 2024 年 6 月宣布的一轮融资中估值达到 62 亿美元。该模型还成为模型剪枝和数据增强研究的重要参考点,其稀疏结构为效率技术的探索提供了天然试验场。
技术细节与可用性
Mixtral 8x7B 在 Apache 2.0 许可证下发布,允许商业使用和修改。模型权重通过 Hugging Face 和 BitTorrent 链接分发,体现了 Mistral AI 对开放获取的承诺。基础模型和 Instruct 变体提供 FP16 和 BF16 格式,社区还提供了用于低精度推理的量化版本。该模型已集成到主要推理框架中,包括 vLLM、TensorRT-LLM 以及Groq基于 LPU 的硬件,后者凭借模型的稀疏激活实现了特别低的延迟。
对于开发者而言,该模型在 FP16 格式下需要约 90 GB 的 GPU 内存,4-bit 量化后约需 24 GB。它支持 32,768 个 token 的上下文长度,适合长文档处理。指令模型针对聊天和任务完成进行了优化,其系统提示格式与其他聊天模型类似。Mistral AI 还提供了托管 API,但开放权重使得许多组织能够进行本地部署。发布文档包含基准测试、模型卡片和示例代码,促进了从亚马逊云服务到微软 Azure和谷歌云等各行业的快速采用。