DBRXは、Databricksによって開発され、2024年3月にリリースされたオープンソースの大規模言語モデルである。これは、混合専門家(MoE)アーキテクチャを採用しており、各入力に対してパラメータの一部のみを活性化する設計により、高パフォーマンスを維持しながら効率的な推論を可能にしている。このモデルは、OpenAIやAnthropicのプロプライエタリなシステムに対する競争力のある代替手段として位置づけられ、Databricksはそのオープンな利用可能性とコスト効率の高い運用を強調した。
DBRXのリリースは、Databricksが生成AI機能をデータプラットフォームに統合する戦略における重要な一歩となった。これは、同社が以前に導入した小規模なオープンソースモデルであるDollyや、2023年のMosaicML買収に続くものである。DBRXは、データ分析と人工知能のためのクラウドベースのプラットフォームを含む同社の既存インフラストラクチャ上に構築され、Amazon Web Services、Microsoft Azure、Google Cloud上でネイティブに動作する。
アーキテクチャと設計
DBRXは、混合専門家アーキテクチャを利用している。これは、計算コストを比例的に増加させることなくパラメータをスケーリングする能力から、大規模言語モデルで注目を集めている技術である。このモデルは合計1320億のパラメータを含むが、任意のフォワードパス中に活性化されるのは360億のみである。このスパースな活性化は、各トークンに対して最も関連性の高い専門家を選択するルーターネットワークを通じて達成され、これはマルチヘッドアテンションやトランスフォーマーアーキテクチャの他のコンポーネントに関連するメカニズムである。
MoE設計により、DBRXははるかに小さいモデルに匹敵する推論速度を達成しつつ、より大きなネットワークの知識容量を保持することができる。Databricksは、DBRXが言語理解、推論、コード生成を測定するものを含むいくつかのベンチマークで既存のオープンソースモデルを上回ったと報告した。このモデルは大規模なテキストとコードのコーパスでトレーニングされ、Databricksは高品質なデータキュレーションとフィルタリング技術の使用を強調した。
トレーニングと開発
DBRXは、2013年にカリフォルニア大学バークレー校でApache Sparkのオリジナル作成者によって設立されたDatabricksによって開発された。トレーニングプロセスは、同社の機械学習プラットフォームや2023年に買収したMosaicMLトレーニングツールキットを含むDatabricks自身のインフラストラクチャを活用した。同社は正確な計算リソースを開示しなかったが、トレーニングは類似のモデルと比較して比較的短い期間で完了したと述べた。
DBRXの開発は、プロプライエタリな製品と競合するオープンソースモデルへの生成AIにおける広範なトレンドの一部であった。DatabricksはDBRXを、組織が自社環境にデプロイでき、外部APIにデータを送信する必要を回避できるモデルとして位置づけた。このアプローチは、セキュアな境界内でマネージドAIインフラストラクチャを提供するという同社の焦点と一致しており、この機能はサードパーティモデルとの統合にも適用される。
パフォーマンスとベンチマーク
Databricksは、DBRXのローンチ時にベンチマーク結果を公開し、オープンソースとプロプライエタリの両方のモデルに対して競争力のあるパフォーマンスを示した。57の科目にわたる広範な知識をテストするMMLUベンチマークでは、DBRXは73.7%をスコアし、既存のいくつかのオープンソースモデルを上回った。コード生成のためのHumanEvalベンチマークでは、DBRXはpass@1スコア70.1%を達成し、当時のオープンソースモデルとしては強い結果であった。
このモデルは、小学校レベルの数学問題のためのGSM8Kベンチマークなどの推論タスクでも強いパフォーマンスを示し、72.8%をスコアした。Databricksはこれらの結果をMoEアーキテクチャとトレーニングデータの品質に帰した。しかし、同社はGoogle DeepMindやOpenAIの最も先進的なプロプライエタリモデルとの直接比較を提供せず、独立した評価はリリース後の数ヶ月間限られていた。
オープンソースリリースと利用可能性
DBRXはオープンソースライセンスの下でリリースされ、研究者や開発者がモデルを自由にダウンロード、変更、デプロイできるようにした。ウェイトはHugging Faceなどのプラットフォームを通じて利用可能になり、Databricksはファインチューニングと推論のためのドキュメントと例を提供した。このリリースは、当時のほとんどのオープンソースモデルが大幅に小さかったため、そのサイズと、プロプライエタリなシステムに近づくパフォーマンスで注目に値した。
DBRXのオープンソースの性質は、OpenAIやAnthropicのクローズドなアプローチとは対照的に、Databricksによる意図的な選択であった。同社は、オープンモデルが企業、特に規制産業の企業に対してより大きな透明性と制御を提供すると主張した。DBRXはまた、データインテリジェンスプラットフォームやAIエージェントを構築するためのツールを含む、Databricks自身の製品提供の基盤としても機能した。
Databricksプラットフォームとの統合
DBRXは、データエンジニアリング、データサイエンス、AIのための統合環境を提供するDatabricksのプラットフォームに統合された。ユーザーは、バッチとリアルタイムの両方の推論をサポートするプラットフォームのモデルサービング機能を通じてDBRXにアクセスできた。この統合により、組織はDBRXを、Databricksが先駆けたデータウェアハウスとデータレイクのハイブリッドであるレイクハウスアーキテクチャに保存された自社データと組み合わせることができた。
プラットフォームはまた、AIフィードバックからの強化学習やカリキュラム学習などの技術を使用して、カスタムデータセットでDBRXをファインチューニングするためのツールを提供した。Databricksはこれらの機能を、ゼロからトレーニングするコストなしでドメイン固有のモデルを構築する方法として位置づけた。同社のより広範な戦略には、自社のオープンソースリリースに加えて、パートナーからのプロプライエタリなモデルを含む一連のモデルを提供することが含まれていた。
市場コンテキストと受容
DBRXのローンチは、大規模言語モデル分野での激しい競争の時期に行われた。OpenAIは2023年3月にGPT-4をリリースし、AnthropicはDBRXのわずか数週間前の2024年3月にClaude 3を導入していた。このリリースは、Databricksが2023会計年度に16億ドルの収益を報告し、重要な資金調達ラウンドを実施したことから、同社の財務成長に対するタイミングでも注目に値した。
DBRXへの受容は概ね肯定的であり、レビュアーはそのサイズに対するパフォーマンスとオープンライセンスを賞賛した。一部のアナリストは、MoEアーキテクチャがスパースな活性化により計算要件を削減するため、コストに敏感なデプロイメントにとって特に魅力的であると指摘した。しかし、このモデルは、より確立されたオープンソースモデルや、より小さく効率的なモデルの人気の高まりと競合するため、エコシステム採用の面で課題に直面した。
影響と遺産
DBRXは、オープンソースモデルがプロプライエタリなシステムとのギャップを縮めるという広範なトレンドに貢献した。そのリリースは、MoEアーキテクチャが大規模で効果的にトレーニングおよびデプロイできることを実証し、他の組織からのその後のモデル設計に影響を与えた。DatabricksはAI機能の開発を継続し、後にAIエージェントを構築するためのAgent Bricksスイートや、AIアプリケーション用に設計されたデータベースであるLakebaseを含む追加のモデルとツールを導入した。
このモデルはまた、エンタープライズソフトウェア企業にとってのオープンソースAIの戦略的重要性を浮き彫りにした。DBRXをリリースすることで、Databricksはインフラストラクチャとモデルの両方のプロバイダーとして自らを位置づけ、クラウドプロバイダーやAIスタートアップと競合した。2025年にOpenAIやAnthropicとのその後のパートナーシップは、彼らのモデルをDatabricksプラットフォームに統合し、同社が自社の提供物に加えてマルチモデルアプローチを引き続きサポートしていることを示した。
技術仕様
DBRXの技術詳細は、Databricksが公開した技術レポートとブログ投稿で開示された。このモデルは、フィードフォワードネットワークを混合専門家層に置き換えた標準のトランスフォーマーデコーダーアーキテクチャを使用している。合計1320億のパラメータを持ち、推論中に360億が活性化される。このモデルは、かなりの計算リソースを必要とする実質的なデータセットである12兆トークンのテキストとコードでトレーニングされた。
このモデルは、32,768トークンのコンテキスト長をサポートし、長いドキュメントや会話を処理できる。100,000トークンの語彙を持つトークナイザーを使用し、多様なテキストの効率的なエンコーディングを可能にする。Databricksはまた、指示に従うことやチャットベースのインタラクションに最適化されたファインチューニング版であるDBRX Instructもリリースした。ファインチューニングプロセスは、現代の言語モデル開発で一般的な技術である教師あり学習と人間のフィードバックからの強化学習を使用した。
現代のモデルとの比較
リリース時点で、DBRXはMetaのLlama 2やMistralのMixtral 8x7Bを含むいくつかの他のオープンソースモデルと比較された。DBRXは、特にコード生成と推論タスクにおいて、標準ベンチマークでこれらのモデルを概ね上回った。このモデルのパフォーマンスは、一部のプロプライエタリモデルと好意的に比較されたが、OpenAIやGoogleの最も先進的なシステムには及ばなかった。
MoEアーキテクチャは、DBRXに推論効率の明確な利点を与えた。活性化されたパラメータがわずか360億であるため、同様の総サイズのデンスモデルよりもトークンあたりの計算が少なくて済んだ。これにより、AMDやIntelプロセッサ、および専用アクセラレータを含むさまざまなハードウェアでのデプロイメントに適していた。Databricksは具体的なレイテンシ測定を提供しなかったが、アーキテクチャの設計は競争力のあるパフォーマンスを示唆していた。
将来の開発
DBRXのリリース後、DatabricksはAI研究開発への投資を継続した。2025年のOpenAIとのパートナーシップや2026年のElectricの買収を含む同社のその後の買収とパートナーシップは、AI機能の拡大に焦点を当てていることを示した。DatabricksはDBRXの直接の後継を発表しなかったが、このモデルのアーキテクチャとオープンソース哲学は同社のその後の製品に影響を与えた。
DBRXのローンチ後、AIの広範な状況は急速に進化し、新しいモデルと技術が定期的に登場した。DBRXが例示した効率性とオープンな利用可能性への強調は、組織がコスト効率が高く透明な方法でAIをデプロイしようとする中で、業界の重要なテーマであり続けた。モデル開発者とインフラストラクチャプロバイダーの両方としてのDatabricksの役割は、これらのトレンドから利益を得る位置にあった。