DBRX是由Mosaic在其母公司Databricks旗下开发的大型语言模型(LLM)。该模型于2024年3月27日根据Databricks开放模型许可发布,是一个混合专家(MoE)Transformer模型,总参数为1320亿,其中每个令牌激活360亿参数。此次发布包括基础模型和指令调优变体,旨在与领先的开放和专有模型在语言理解、编程和数学方面竞争。
该模型的架构和训练方法反映了生成式人工智能领域向高效扩展的更广泛趋势,利用稀疏激活来降低计算成本,同时保持高容量。DBRX被定位为其他开放权重模型的直接挑战者,其发布时的性能为公开可用的系统设立了新的基准。
架构与设计
DBRX采用混合专家(MoE)架构,这是Transformer模型的一种变体,将每个令牌路由到专家网络的子集。该模型包含16个专家,每个令牌激活4个,在1320亿总参数中产生360亿激活参数。这种稀疏设计相对于类似规模的密集模型减少了推理和训练计算量。
该模型使用标准的仅解码器Transformer结构,具有多头注意力和位置编码,但结合了细粒度的专家路由以提高专业化程度。每个专家都是一个前馈网络,学习到的门控机制选择哪些专家处理每个令牌。这种方法允许模型动态分配容量,类似于Mixtral等其他MoE系统。
DBRX还包括架构改进,如层归一化和残差网络连接,这些改进在规模训练中稳定了训练过程。指令调优变体进一步通过监督微调和基于人工智能反馈的强化学习进行优化,使输出与人类在对话和任务完成方面的偏好保持一致。
训练与计算
训练DBRX大约耗时2.5个月,使用了3072块Nvidia H100 GPU,通过InfiniBand连接,带宽为每秒3.2太字节。总训练成本据报道为1000万美元,这一数字凸显了最先进LLM所需的大量计算资源。训练数据集包含多样化的文本和代码语料库,但Databricks未披露数据组成的全部细节。
训练过程利用了梯度裁剪和学习率调度技术,以确保在数千步中保持稳定性。使用Nvidia H100的硬件配置反映了英伟达类加速器在这一时期大规模深度学习中的主导作用,尽管AMD和AWS Trainium等竞争对手也在崛起。InfiniBand互连实现了专家之间的高效通信,这是MoE训练的关键因素。
发布与许可
DBRX根据Databricks开放模型许可发布,这是一种宽松许可,允许使用、修改和分发,但包含限制使用该模型与Databricks商业服务竞争的条款。此次发布包括模型权重、推理代码和评估脚本,使研究人员和企业能够访问。
开放发布与OpenAI和Anthropic等公司的专有模型形成对比,后者通过API提供有限访问。Databricks将DBRX定位为企业寻求控制其人工智能基础设施的工具,与其在亚马逊网络服务、Azure和谷歌云上的数据工程和机器学习更广泛平台保持一致。
性能基准
在发布时,DBRX在语言理解、编程和数学基准测试中超越了多个知名开放模型,包括Meta的Llama 2、Mistral AI的Mixtral和xAI的Grok-1。例如,DBRX在标准推理任务和代码生成测试中取得了更高分数,尽管具体数字因基准而异。
指令调优变体在遵循复杂指令和生成连贯的多轮响应方面表现出特别强的能力,这归功于其基于人工智能反馈的强化学习训练。第三方独立评估普遍证实了这些结果,但一些评估指出,DBRX在需要广泛世界知识或低资源语言支持的任务上优势较小。
与当代模型的比较
DBRX进入了一个由开放和封闭模型主导的竞争格局。与Mixtral相比,DBRX使用更多专家(16个对8个)和更大的总参数数量,这有助于其更高的基准分数。与Llama 2相比,DBRX的MoE设计在每个激活参数上提供了更好的效率,尽管Llama 2使用更成熟的密集架构进行训练。
相对于OpenAI的GPT-4或谷歌DeepMind的Gemini等专有系统,DBRX在复杂推理和创造性任务上通常被认为能力较弱,但它提供了本地部署和定制的优势。该模型的开放许可支持针对特定领域用例的微调,这对受监管行业的企业来说是一个关键卖点。
生态系统与采用
Databricks将DBRX集成到其平台中,允许客户通过其托管服务或自有基础设施部署该模型。该模型也通过Azure和谷歌云市场提供,扩大了其覆盖范围。多家初创公司和研究团队采用DBRX用于代码生成、文档分析和客户支持等应用。
此次发布激发了人们对MoE架构作为密集模型成本效益替代方案的兴趣,影响了其他实验室的后续工作。然而,DBRX的影响在一定程度上被该领域的快速进展所掩盖,Llama 3和Qwen 2等新模型在几个月内实现了相当或更好的性能。
局限性与批评
尽管有诸多优势,DBRX仍有显著局限性。其1320亿总参数需要大量内存进行推理,通常需要多块GPU或量化。该模型还表现出LLM常见的偏见和事实错误,其训练数据截止时间限制了对2024年初之后事件的了解。
批评者指出训练数据缺乏透明度以及训练的环境成本,尽管训练周期相对较短,但消耗了大量能源。Databricks开放模型许可也因其非标准条款而受到批评,一些人认为这些条款不如传统开源许可开放。
遗产与未来方向
DBRX证明了MoE模型可以以密集模型训练成本的一小部分实现竞争性能,鼓励了对稀疏架构的进一步研究。Databricks继续开发后续模型,但DBRX在2024年仍然是开放权重LLM的参考点。
该模型的发布为更广泛的人工智能关于开放与封闭系统的讨论做出了贡献,支持者引用DBRX作为高质量模型可以公开提供的证据。截至2024年底,DBRX仍在各种研究和生产环境中使用,尽管新模型在基准排名中已基本取代了它。
参见
- 大型语言模型
- 混合专家
- Databricks
- Mosaic
参考文献
- Databricks新闻稿,2024年3月27日
- DBRX架构和训练技术报告
- 学术和行业来源的独立基准评估