DBRX是由Databricks开发的开源大型语言模型,于2024年3月发布。它采用混合专家(MoE)架构,这种设计仅对每个输入激活其参数的一部分,从而在保持高性能的同时实现高效推理。该模型被定位为OpenAI和Anthropic专有系统的竞争性替代品,Databricks强调其开放可用性和经济高效的运营。
DBRX的发布标志着Databricks将生成式AI能力整合到其数据平台战略中的重要一步。此前,该公司推出了较小的开源模型Dolly,并于2023年收购了MosaicML。DBRX基于公司现有的基础设施构建,该基础设施包括一个用于数据分析和人工智能的云平台,原生运行于Amazon Web Services、Microsoft Azure和Google Cloud之上。
架构与设计
DBRX采用混合专家架构,这种技术在大语言模型中因其能够在不按比例增加计算成本的情况下扩展参数而日益受到重视。该模型总共有1320亿个参数,但在任何一次前向传播中只有360亿个处于激活状态。这种稀疏激活通过一个路由器网络实现,该网络为每个令牌选择最相关的专家,这一机制与多头注意力及Transformer架构的其他组件相关。
MoE设计使DBRX能够实现与更小模型相当的推理速度,同时保留更大网络的知识容量。Databricks报告称,DBRX在多项基准测试中优于现有的开源模型,包括衡量语言理解、推理和代码生成的测试。该模型在大量文本和代码语料库上进行了训练,Databricks强调使用高质量的数据整理和过滤技术。
训练与开发
DBRX由Databricks开发,该公司由加州大学伯克利分校的Apache Spark原始创建者于2013年创立。训练过程利用了Databricks自身的基础设施,包括其机器学习平台和2023年收购的MosaicML训练工具包。该公司未披露确切的计算资源,但表示与类似模型相比,训练在相对较短的时间内完成。
DBRX的开发是生成式AI领域开源模型与专有产品竞争这一更广泛趋势的一部分。Databricks将DBRX定位为组织可以在其自身环境中部署的模型,从而避免将数据发送到外部API的需求。这种方法与该公司专注于在安全边界内提供托管AI基础设施的战略一致,这一特性也适用于其与第三方模型的集成。
性能与基准测试
Databricks在发布时公布了DBRX的基准测试结果,显示其在开源和专有模型中的竞争性表现。在测试57个学科广泛知识的MMLU基准测试中,DBRX得分73.7%,超过了多个现有的开源模型。在代码生成的HumanEval基准测试中,DBRX的pass@1得分达到70.1%,这在当时对于开源模型来说是一个强劲的结果。
该模型在推理任务中也表现出色,例如针对小学数学问题的GSM8K基准测试,得分72.8%。Databricks将这些结果归因于MoE架构和训练数据的质量。然而,该公司未提供与Google DeepMind或OpenAI最先进专有模型的直接比较,发布后的几个月内独立评估也有限。
开源发布与可用性
DBRX在开源许可下发布,允许研究人员和开发者自由下载、修改和部署该模型。权重通过Hugging Face等平台提供,Databricks提供了微调和推理的文档及示例。此次发布因其规模而引人注目,因为当时大多数开源模型明显更小,同时其性能接近专有系统。
DBRX的开源性质是Databricks的刻意选择,与OpenAI和Anthropic的封闭方法形成对比。该公司认为,开放模型为企业提供了更大的透明度和控制力,尤其是对于受监管行业的企业。DBRX还作为Databricks自身产品的基础,包括其数据智能平台和用于构建AI代理的工具。
与Databricks平台的集成
DBRX已集成到Databricks平台中,该平台为数据工程、数据科学和AI提供了统一环境。用户可以通过平台的模型服务功能访问DBRX,该功能支持批处理和实时推理。这种集成使组织能够将DBRX与其存储在湖仓架构中的数据相结合,湖仓架构是Databricks开创的数据仓库和数据湖的混合体。
该平台还提供了使用基于AI反馈的强化学习和课程学习等技术在自定义数据集上微调DBRX的工具。Databricks将这些能力定位为企业构建领域特定模型的方式,而无需从头训练的成本。公司的更广泛战略涉及提供一系列模型,包括来自合作伙伴的专有模型,以及其自身的开源发布。
市场背景与反响
DBRX的发布发生在大语言模型领域竞争激烈的时期。OpenAI于2023年3月发布了GPT-4,Anthropic于2024年3月推出了Claude 3,就在DBRX发布前几周。此次发布的时间点也与其财务增长相关,该公司报告2023财年收入为16亿美元,并筹集了大量资金。
对DBRX的反响总体积极,评论者称赞其相对于规模的性能和开放许可。一些分析师指出,MoE架构使其对成本敏感的部署特别有吸引力,因为稀疏激活减少了计算需求。然而,该模型在生态系统采用方面面临挑战,因为它与更成熟的开源模型以及日益流行的小型高效模型竞争。
影响与遗产
DBRX推动了开源模型缩小与专有系统差距的更广泛趋势。其发布表明MoE架构可以有效地大规模训练和部署,影响了其他组织后续的模型设计。Databricks继续发展其AI能力,后来推出了额外的模型和工具,包括用于构建AI代理的Agent Bricks套件和专为AI应用设计的数据库Lakebase。
该模型还凸显了开源AI对企业软件公司的战略重要性。通过发布DBRX,Databricks将自己定位为基础设施和模型的提供者,与云提供商和AI初创公司竞争。该公司随后在2025年与OpenAI和Anthropic的合作,将其模型集成到Databricks平台中,表明它继续支持多模型方法,同时保留自身产品。
技术规格
DBRX的技术细节在Databricks发布的技术报告和博客文章中披露。该模型使用标准的Transformer解码器架构,其中混合专家层替代了前馈网络。它总共有1320亿个参数,推理期间有360亿个处于激活状态。该模型在12万亿个文本和代码令牌上进行了训练,这是一个需要大量计算资源的数据集。
该模型支持32,768个令牌的上下文长度,使其能够处理长文档和对话。它使用词汇量为100,000个令牌的分词器,能够高效编码多样化文本。Databricks还发布了微调版本DBRX Instruct,针对指令遵循和基于聊天的交互进行了优化。微调过程使用了监督学习和基于人类反馈的强化学习,这是现代语言模型开发中常见的技术。
与同期模型的比较
在发布时,DBRX与多个其他开源模型进行了比较,包括Meta的Llama 2和Mistral的Mixtral 8x7B。DBRX在标准基准测试中通常优于这些模型,特别是在代码生成和推理任务中。该模型的性能也优于一些专有模型,但未达到OpenAI或Google最先进系统的水平。
MoE架构赋予DBRX在推理效率方面的明显优势。由于只有360亿个激活参数,它每个令牌所需的计算量少于总规模相似的密集模型。这使其适合部署在各种硬件上,包括AMD和Intel处理器,以及专用加速器。Databricks未提供具体的延迟测量,但架构设计表明其性能具有竞争力。
未来发展
DBRX发布后,Databricks继续投资于AI研发。公司后续的收购和合作,包括2025年与OpenAI的合作以及2026年收购Electric,表明其专注于扩展AI能力。虽然Databricks未宣布DBRX的直接继任者,但该模型的架构和开源理念影响了公司后续的产品。
DBRX发布后,更广泛的AI格局迅速演变,新模型和技术不断涌现。DBRX所体现的对效率和开放可用性的强调仍然是行业的关键主题,因为组织寻求以经济高效和透明的方式部署AI。Databricks作为模型开发者和基础设施提供者的双重角色使其能够从这些趋势中受益。