DBRXは、Mosaicが親会社であるDatabricksの下で開発した大規模言語モデル(LLM)である。2024年3月27日にDatabricks Open Model Licenseの下でリリースされ、1320億の総パラメータを持つ混合専門家(mixture-of-experts)トランスフォーマーモデルであり、各トークンに対して360億のパラメータがアクティブとなる。リリースには、ベースとなる基盤モデルと指示調整済みバリアントの両方が含まれ、言語理解、プログラミング、数学において、主要なオープンおよびプロプライエタリモデルと競合するように設計されている。
このモデルのアーキテクチャとトレーニング手法は、Generative AIにおける効率的なスケーリングへの広範な傾向を反映しており、スパース活性化を使用して計算コストを削減しつつ、高い容量を維持している。DBRXは、他のオープンウェイトモデルへの直接的な挑戦者として位置づけられ、リリース時の性能は、公開されているシステムの新たなベンチマークを打ち立てた。
アーキテクチャと設計
DBRXは、混合専門家(MoE)アーキチャクチャを採用しており、これはTransformer (architecture)モデルの変種で、各トークンを専門家ネットワークのサブセットにルーティングする。モデルには16の専門家が含まれ、トークンごとに4つが活性化され、1320億の総パラメータのうち360億がアクティブとなる。このスパース設計は、同規模の高密度モデルと比較して、推論およびトレーニングの計算量を削減する。
モデルは、標準的なデコーダーのみのトランスフォーマー構造をMulti-Head AttentionとPositional Encodingとともに使用するが、専門化を向上させるために細粒度の専門家ルーティングを組み込んでいる。各専門家はフィードフォワードネットワークであり、学習されたゲーティングメカニズムが各トークンを処理する専門家を選択する。このアプローチにより、モデルは容量を動的に割り当てることができ、Mixtralなどの他のMoEシステムと類似している。
DBRXには、Layer NormalizationやResidual Network (ResNet)接続などのアーキテクチャ上の改良も含まれており、大規模でのトレーニングを安定させる。指示調整済みバリアントは、さらに教師あり微調整とReinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)を使用して洗練され、対話やタスク完了における人間の好みに出力を合わせている。
トレーニングと計算
DBRXのトレーニングには、InfiniBandで接続された3,072基のNvidia H100 GPUを使用し、帯域幅は毎秒3.2テラバイトで、約2.5か月かかった。総トレーニングコストは1,000万米ドルと報告され、これは最先端のLLMに必要な多大な計算量を浮き彫りにする数字である。トレーニングデータセットは、テキストとコードの多様なコーパスで構成されていたが、Databricksはデータ構成の詳細を完全には開示しなかった。
トレーニングプロセスでは、Gradient ClippingやLearning Rate Scheduling技術を活用して、数千ステップにわたる安定性を確保した。Nvidia H100を使用したハードウェア構成は、この時期の大規模Deep learningにおけるNVIDIAクラスのアクセラレータの支配的な役割を反映しているが、AMDやAWS Trainiumなどの競合も台頭していた。InfiniBand相互接続により、専門家間の効率的な通信が可能となり、これはMoEトレーニングの重要な要素である。
リリースとライセンス
DBRXは、Databricks Open Model Licenseの下でリリースされた。これは、使用、変更、配布を許可する寛容なライセンスであるが、Databricksの商用サービスと競合するためにモデルを使用することに関する制限が含まれている。リリースには、モデルの重み、推論コード、評価スクリプトが含まれており、研究者や企業がアクセスできるようにした。
このオープンなリリースは、OpenAIやAnthropicなどの企業からのプロプライエタリモデルとは対照的であり、これらはAPIを通じて限定的なアクセスを提供している。Databricksは、DBRXをAIインフラストラクチャを制御したい企業向けのツールとして位置づけ、Amazon Web Services、Microsoft Azure、Google CloudでのデータエンジニアリングとMachine learningのための広範なプラットフォームと整合させた。
性能ベンチマーク
リリース時、DBRXは、言語理解、プログラミング、数学のベンチマークにおいて、MetaのLlama 2、Mistral AIのMixtral、xAIのGrok-1など、いくつかの著名なオープンモデルを上回った。例えば、DBRXは標準的な推論タスクやコード生成テストで高いスコアを達成したが、正確な数値はベンチマークによって異なった。
指示調整済みバリアントは、複雑な指示に従い、一貫性のあるマルチターン応答を生成する点で特に強みを示し、これはReinforcement Learning from AI Feedback (RLAIF)トレーニングに起因する。第三者による独立した評価は一般的にこれらの結果を確認したが、広範な世界知識や低リソース言語のサポートを必要とするタスクでは、DBRXの利点が狭いと指摘する者もいた。
同時代のモデルとの比較
DBRXは、オープンおよびクローズドモデルの両方が支配する競争の激しい環境に参入した。Mixtralと比較して、DBRXはより多くの専門家(16対8)とより大きな総パラメータ数を使用し、これが高いベンチマークスコアに貢献した。Llama 2と比較して、DBRXのMoE設計はアクティブパラメータあたりの効率が優れていたが、Llama 2はより確立された高密度アーキテクチャでトレーニングされていた。
OpenAIのGPT-4やGoogle DeepMindのGeminiなどのプロプライエタリシステムと比較して、DBRXは複雑な推論や創造的なタスクでは一般的に能力が低いと考えられていたが、ローカル展開とカスタマイズの利点を提供した。モデルのオープンライセンスにより、ドメイン固有のユースケース向けの微調整が可能となり、規制産業の企業にとって重要なセールスポイントとなった。
エコシステムと採用
DatabricksはDBRXをプラットフォームに統合し、顧客がマネージドサービスまたは自社インフラストラクチャを通じてモデルを展開できるようにした。モデルはMicrosoft AzureやGoogle Cloudのマーケットプレイスでも利用可能となり、そのリーチを拡大した。いくつかのスタートアップや研究グループは、コード生成、文書分析、カスタマーサポートなどのアプリケーションでDBRXを採用した。
このリリースは、高密度モデルに対するコスト効率の高い代替としてのMoEアーキテクチャへの関心を刺激し、他の研究所でのその後の研究に影響を与えた。しかし、DBRXの影響は、分野の急速な進歩によって部分的に影を潜め、Llama 3やQwen 2などの新しいモデルが数か月以内に同等またはそれ以上の性能を達成した。
制限と批判
その強みにもかかわらず、DBRXには顕著な制限があった。1320億の総パラメータは、推論にかなりのメモリを必要とし、しばしば複数のGPUまたは量子化が必要となった。モデルはまた、LLMに共通するバイアスや事実誤認を示し、トレーニングデータのカットオフにより、2024年初頭以降の出来事に関する知識が制限された。
批評家は、トレーニングデータに関する透明性の欠如と、比較的短いトレーニング期間にもかかわらずかなりのエネルギーを消費したトレーニングの環境コストを指摘した。Databricks Open Model Licenseは、その非標準的な条件についても批判され、伝統的なオープンソースライセンスよりもオープンではないと主張する者もいた。
遺産と将来の方向性
DBRXは、MoEモデルが高密度モデルのトレーニングコストの一部で競争力のある性能を達成できることを実証し、スパースアーキテクチャへのさらなる研究を促進した。Databricksはその後も後続モデルの開発を続けたが、DBRXは2024年のオープンウェイトLLMの参照点であり続けた。
モデルのリリースは、オープン対クローズドシステムに関する広範なArtificial intelligenceの議論に貢献し、支持者はDBRXを高品質モデルが公開利用可能になり得る証拠として挙げた。2024年後半の時点で、DBRXはさまざまな研究および本番環境で依然として使用されていたが、新しいモデルがベンチマークランキングで大部分を追い越していた。
関連項目
- 大規模言語モデル
- 混合専門家
- Databricks
- mosaic
参考文献
- Databricksプレスリリース、2024年3月27日
- DBRXのアーキテクチャとトレーニングに関する技術レポート
- 学術および業界ソースからの独立したベンチマーク評価