英語からの翻訳

DBRXは、Mosaicによって開発され、Databricksが2024年3月27日に公開したオープンソースの混合専門家大規模言語モデルであり、総パラメータ数は1320億、トークンごとのアクティブパラメータ数は360億である。

DBRXは、Databricks傘下のMosaicによって開発され、2024年3月27日にDatabricks Open Model Licenseの下でリリースされた大規模言語モデルである。これは混合専門家(mixture-of-experts)Transformer (architecture)モデルであり、合計1,320億のパラメータを持つが、各トークンに対しては16の専門家のうち4つが活性化され、360億のパラメータが使用される。リリースされたモデルには、ベースとなる基盤モデルと、指示調整済みのバリアントの2つのバージョンがある。

リリース当時、DBRXは言語理解、プログラミング能力、数学の複数のベンチマークにおいて、MetaのLlama 2、Mistral AIのMixtral、xAIのGrok-1などの著名なモデルを上回る性能を示した。そのアーキテクチャとトレーニング手法は、急速に進化するGenerative AIの状況において、競争力のあるオープンウェイトの代替手段として位置づけられた。

アーキテクチャと設計

DBRXは混合専門家(MoE)アーキテクチャを採用しており、これはモデルのパラメータを複数の専門化された「専門家」ネットワークに分割する設計である。各入力トークンに対して、ゲーティング機構が処理する専門家のサブセットを選択し、総パラメータ数を拡大しながらも、トークンあたりの計算コストを管理可能に保つことを可能にする。DBRXでは16の専門家が利用可能だが、トークンごとに4つだけが活性化され、合計1,320億のうち360億のパラメータが活性化される。このスパースな活性化により、同規模の高密度モデルと比較して、推論とトレーニングの効率が向上する。

このモデルはTransformer (architecture)アーキテクチャに基づいて構築されており、Multi-Head Attention機構を使用してシーケンシャルデータを処理する。DBRXは、現代のLLMで一般的なLayer NormalizationPositional Encodingなどの技術を組み込んでおり、トレーニングの安定化とトークン順序の捕捉を実現している。混合専門家アプローチは、Model Pruningの逆の形態であり、パラメータを削除する代わりに、その一部を選択的に使用して計算オーバーヘッドを削減する。

トレーニングと開発

DBRXは、InfiniBandを介して毎秒3.2テラバイトの帯域幅で接続された3,072基のNvidia H100 GPUを使用して、2.5か月間トレーニングされた。報告されたトレーニングコストは1,000万米ドルであり、これは一部の現代のモデルと比較して比較的控えめな数字であり、MoE設計の効率性とトレーニングパイプラインの最適化を反映している。トレーニングデータは、テキストとコードの多様なコーパスで構成されていたが、具体的な詳細は完全には開示されなかった。

開発は、2023年にDatabricksに買収されたMosaicが主導し、Machine learningモデルの効率的なトレーニングを専門としていた。Mosaicの分散トレーニングと最適化に関する専門知識は、比較的短いトレーニング期間とコストに貢献した。モデルは、安定性を確保するためにGradient ClippingLearning Rate Schedulingの調整などの技術を使用してトレーニングされた。

パフォーマンスとベンチマーク

リリース時、DBRXはさまざまなベンチマークで強力なパフォーマンスを示した。言語理解タスクでは、Llama 2とMixtralを上回り、推論と理解力の向上を示した。プログラミングベンチマークでは、DBRXはコード生成とデバッグに優れ、Grok-1を上回った。数学的推論もDBRXが競争力のある結果を示した分野であり、より大きな活性化パラメータ数を持つモデルと同等かそれ以上の結果を出すことが多かった。

これらの結果は、混合専門家アプローチの有効性を強調しており、これによりDBRXは高密度の1,320億パラメータモデルの完全な計算コストなしで高い精度を達成できる。指示調整済みのバリアントは、会話型およびタスク指向のアプリケーション向けに最適化されており、人間の好みに合わせたタスクでのパフォーマンスをさらに向上させた。

リリースとライセンス

DBRXはDatabricks Open Model Licenseの下でリリースされ、商用アプリケーションを含む広範な使用を許可するが、特定の制限がある。オープンリリースにより、研究者や開発者はモデルの重みにアクセスでき、さらなる実験やファインチューニングが容易になった。この動きは、OpenAIAnthropicなどの組織からの他のリリースに見られるように、Artificial intelligenceコミュニティにおけるオープンウェイトモデルへのトレンドと一致しているが、これらはしばしばプロプライエタリのままである。

ベースと指示調整済みの両方のバージョンが利用可能であることで、研究から本番環境への展開まで、さまざまなユースケースに柔軟性が提供された。DatabricksはDBRXを企業向けのツールとして位置づけ、データプラットフォームやAmazon Web ServicesMicrosoft Azureなどのクラウドサービスと統合した。

影響と遺産

DBRXはオープンソースLLMの競争環境に貢献し、効率的なMoEアーキテクチャがより大きなプロプライエタリモデルに対抗できることを実証した。その比較的低いトレーニングコストと高いパフォーマンスは、その後のモデル開発の参照点となった。DBRXの成功は、その後他の主要プレーヤーによって採用されたMoE設計へのさらなる投資を促進した。

Deep learningのより広い文脈では、DBRXは計算予算を管理しながらモデル容量を拡大するトレンドを例示した。そのリリースはまた、NvidiaのH100 GPUなどの専門ハードウェアの役割と、大規模モデルのトレーニングにおける高帯域幅インターコネクトの重要性を強調した。2025年初頭の時点で、DBRXはオープンウェイトMoEモデルの注目すべき例であり続けているが、その後、改善された機能を持つ新しいモデルが登場している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·mixture-of-experts·open-source-ai·databricks
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴