MPT(MosaicML Pretrained Transformer)は、MosaicML(後にDatabricksに買収された企業)によって開発された、オープンソースの大規模言語モデルのファミリーです。これらのモデルは商業利用が可能なように設計されており、ビジネスや研究の文脈で幅広く応用できる寛容なライセンスのもとで公開されています。MPTモデルはTransformer (architecture)アーキテクチャに基づいて構築されており、効率的な訓練方法と長いコンテキストウィンドウで知られ、OpenAIやGoogle DeepMindなどの組織が提供するプロプライエタリなモデルに対する実用的な代替手段となっています。
最初のMPTモデルであるMPT-7Bは2023年5月に公開され、続いてMPT-30Bが2023年6月に公開されました。これらのモデルは、MosaicMLプラットフォームを使用して訓練され、Gradient ClippingやLayer Normalizationなどの最適化された訓練技術を活用して、少ない計算資源で高性能を実現しています。MPTモデルはGenerative AIエコシステムで広く採用され、特にテキスト生成、要約、コード補完などのタスクで活用されています。
アーキテクチャと訓練
MPTモデルは、他の最新のLLMと同様のデコーダーのみのトランスフォーマーアーキテクチャを使用しています。ただし、効率と能力を向上させるためにいくつかの革新を取り入れています。特筆すべき点として、MPTモデルはMulti-Head Attentionを使用し、ALiBi(Attention with Linear Biases)などの技術により長いシーケンスをサポートします。これにより、モデルは訓練中に見られる文脈を超えてより長いコンテキストに外挿できます。これは従来のPositional Encoding手法からの内容の変化であり、MPT-7Bが一部の構成で最大84,000トークンを取り扱えるようにしています。
訓練は、公開されているテキストとコードの大規模なデータセットで行われ、データの質と多様性に焦点を当てていました。MosaicMLは、MPT-7Bが1兆トークン、MPT-30Bが1.2兆トークンで訓練されたと報告しています。訓練プロセスではAdam (Optimizer)とワームアップとコサイン減衰を含むLearning Rate Schedulingを使用しました。さらに、Weight Initializationは、大規模での訓練を安定させるために慎重に調整されました。
商用利用とライセンス
MPTモデルの主な差別化ポイントは、そのライセンスです。MPT-7BはApache 2.0ライセンスのもとで公開されており、商用目的を含む、使用、変更、配布が無制限に許可されています。MPT-30Bは、同等に商用利用が寛容だが、他の大規模言語モデルの改善にこのモデルを使用することに対する制限を含むカスタムライセンスで公開されています。このライセンス戦略は、採用を促進しながらMosaicMLの競争上の要件を保護するように設計されました。
MPTモデルの商用有用性は、APIコストや閉じられたモデルに関連するデータプライバシーの問題を避けたいスタートアップやエンタープライズに魅力を与えました。企業はMPTモデルを独自のインフラストラクチャに展開し、Amazon Web Services、Microsoft Azure、Google Cloudなどのクラウドサービスや、AWS TrainiumやGroqアクセラレータなどの特別なハードウェアを使用することができます。
パフォーマンスとベンチマーク
MPTモデルは、標準ベンチマークで競争力のある性能を実証しています。MPT-7Bは、例えば、MMLU(Massive Multitask Language Understanding)とHellaSwagなどのタスクで強い結果を達成し、公開時の類似サイズの他のオープンソースモデルを上回ることが多々ありましたでした。MPT-30Bはさらにこれらのスコアを向上させ、特定のドメインで大型のプロプライタリモデルの性能に近づいています。
コード生成タスクでは、MPTモデルは、コード過多なデータセットでの訓練のおかげで、HumanEvalなどのベンチマークで優れた性能を発揮しました。モデルはまた、Reinforcement Learning from AI Feedback (RLAIF)(Reinforcement Learning from AI Feedback)などの技術や、キュレーションされたインストラクションデータセットでの不要のない微調整後の指示などの指示フォローにおいても堅牢な能力を示しました。
エコシステムと影響
MPTモデルは多くの変化した作品の基本となりました。開発者は、チャット、要約、ドメイン固有のアプリケーションなど、特定のタスクのために微調整されたバリアントを作成しました。これらのモデルはHugging Faceなどのプラットフォームに統合され、実験と展開が容易となりました。
MPTの公開は、オープンソースLLMがプロプライタリの優位性に挑戦する、より広いトレンドに貢献しました。これにより、効率的な訓練技術がテックジャイアンツの巨大な予算なしで高品質のモデルを生み出せることを実証しました。MPTはまた、訓練の効率とロングコンテキストの能力の重要性を強調した役割を果たし、Llamaシリーズなどの以降のモデル開発に影響を与えました。
限界と将来の方向性
その強みにもかかわらず、MPTモデルには限界があります。訓練データに存在する偏見が現れることがあり、その事実上の一部を保持せず、事実の精度達成率性は、LLMに共通する問題ではないですが、常に信頼できるものではありません。また、これらのモデルは推論にかなりの計算資源を必要とし、量子化やその他の最適化手法で緩和できます。
MosaicMLが2023年にDatabricksに取得された後、MPTラインの開発は、最終的にDBRXなどの、MPTから得られた教訓を取り入れたモデルに取って代わられました。しかしながら、MPTは、商用可能なLLMをオープンに構築し共有できることを示した重要なマイルストーン占有として、オープンソースAIの歴史の中で重要な位置を占めています。
関連項目
参考文献
MosaicML technical reportとブログ投稿(2023年)。
外部リンク
(提供された外部リンクはない。)