Cerebras-GPTは、ウェハースケールのニューラルネットワークアクセラレータで知られる企業Cerebras Systemsによって開発された、オープンソースの大規模言語モデルファミリーである。これらのモデルは、計算最適な性能を達成するように設計され、つまりChinchillaスケーリング則に従ってモデルサイズとトレーニングデータ量のバランスを取るよう訓練された。Chinchilla則は、与えられた計算予算に対して、比例的に多くのデータを持つより大きなモデルがより良い性能をもたらすと述べている。Cerebras-GPTは2023年3月にリリースされ、大規模での最先端モデル訓練におけるCerebrasのCS-2システムの効率性を実証することを目指した。
このファミリーには、1億1100万から130億のパラメータ数を持つモデルが含まれており、具体的には111M、256M、590M、1.3B、2.7B、6.7B、そして13Bである。すべてのモデルは同じ公開データセットであるThe Pileで訓練されており、これは書籍、学術論文、ウェブコンテンツからの多様なテキストコレクションである。訓練にはモデルごとに固定した計算予算を使用し、Chinchilla最適比であるパラメータあたり約20トークンを踏襲し、各モデルがサイズに応じた性能を最大化するために適切な量のデータで訓練されることを保証した。モデルはAdamオプティマイザー、コサイン学習率スケジュール、そして勾配クリッピングを使用して訓練され、訓練を安定化した。
アーキテクチャと訓練
Cerebras-GPTモデルは標準的なTransformerアーキテクチャ、具体的にはジェネレーティブな言語モデルで一般的なデコーダーのみの変種を使用している。各モデルはマルチヘッドアテンション、層正規化、そして学習された位置埋め込みを採用している。モデルはCS-2システム上で訓練され、これは85万コア以上を備えた単一のシリコンウェハーを統合し、複数のGPUにわたる分散訓練なしに高スループットの訓練を可能にする。このアーキテクチャにより、CerebrasはGPUクラスターと比べて、通信オーバーヘッドを削減することで時間とエネルギーのほんの一部でモデルを訓練できた。
訓練はbfloat16精度で行われ、モデルは既存のチェックポイントなしでゼロから訓練された。訓練プロセスではバッチサイズ256シーケンス、各シーケンス長2048トークンを使用し、各モデルの合計トレーニングトークはChinchilla式で決定された。例えば、13Bモデルは約2,600億トークンで訓練された一方、111Mモデルは約22億トークンで訓練された。トレーニングデータはシャッフルおよび処理されて多様性を確保し、モデルは標準的なベンチマークである言語モデリングの困惑度や下流タスクで評価された。
性能とベンチマーク
Cerebras-GPTモデルは、LAMBADA、HellaSwag、Winograndeなどのいくつかのベンチマークで評価され、これらは言語理解と推論をテストする。結果は、OpenAIやAnthropicなどの類似サイズの他のオープンソースモデルに対して、より単純なレシピで訓練されたにもかかわらず競争力のある性能を示した。例えば、13BモデルはLAMBADA精度72.3%を達成し、これは当時利用可能だった他の13Bモデルと同等だった。モデルはまた、The Pileのホールドアウト検証セットで、モデルサイズが増加するにつれてパープレキシティが減少し、強い性能を示した、これは予想通りである。
Cerebras-GPTの特筆すべき点の1つは、計算効率への焦点である。同社はCS-2での13Bモデル訓練が約10日間かかったと報告し、一方、512NVIDIA A100 GPUsのクラスタでの主要な訓練ランは約30日間とであった。この効率性は、ウェハースケール設計がモデル並列性を排除し、チップ間通信を削減することによるものである。モデルをApache 2.0ライセンスでリリースし、制限なしで使用および改変を許可しており、これはオープンソースコミュニティでの研究開発を促進するための意図的な動きである。
他のモデルとの比較
リリース当時、Cerebras-GPTはChinchillaスケール法則への忠実性でオープンソースモデルの中で際立っていた。GPT-3など多くの初期モデルは計算最適より多くのデータで訓練され、非効率をもたらしていた。Cerebras-GPTは、明示的に計算最適アプローチを踏襲した最初のファミリーの1つであり、これにより各モデルがパラメータ数に正確に合ったデータ量で訓練された。このアプローチは、データとパラメータの比率が最適以下で訓練されたモデルと同等もしくは良い性能を達成したことで検証された。
後のモデルであるLLaMA(2023年にリリース)と比較して、Cerebras-GPTは最大サイズも小さいが、より体系的なスケーリングの研究を提供した。モデルの特徴は再現性もあり24よしいて"The act":トレーニングコードと設定がオープンソース化され、研究者\(( researcher)\) が結果を再現できるようにしたからである。しかし、モデルはインストラクション調整やチャット向けのファインチューニングはされず、主一一上的にスケール則と効率的なトレーニングに関する研究用であり、アプリケーション展開用ではなかった。
影響と遺産
Cerebras-GPTは、オープンソースの大規模言語モデルを民主化する広義のトレンドに20``"for the research"。最小モデル(11億1千万の物)は単一GPUでファインチューニングでき、最大モデル(13B使った)は複数GPUを必要とするが、多くの研究用ラボでも容易にアクセスで来る``。このリリースは、ウェハー型集市場などの代替ハードウェアアーキテクチャが、ラージモデルのトレーニングコストやエネルギーを削減するポテンシャルを強調された。
モデルは、オープンソースの性質を生かし、後のカリキュラム学習やデータ拡張技術の研究に使用された。Cerebras社はCerebras-GPT 7Bベースをなど、その後もより大きなモデルを開発してき*9” which、CS-3など、2024年に発表され、次の世代のハードウェアの開発に活用した。元のファミリーは、計算最適なトレーニングのリファレンスポイントを維持 。
入手と用途
Cerebras-GPTのモデルは、Hugging FaceとCerebras Model Zooから入手でき、ここに事前学習済みチェックポイントと推論のスクリプトが提供されている。これらモデルはPyTorchなどの標準的な機械学習フレームワークで使用することができ、トレーニングコードはGitHubで公開されています。Apache 2.0ライセンスにより商業的使用が許可されており、ライセンス費用なしで言語モデルを展開しようとするスタートアップやエンタープライズに魅力的なモデルとなっています。ただし、これらのモデルは人間の好みに合わせた学習がされていないため、偏ったまたは有害な出力を生成する可能性があり、導入には適切な対策が推奨されます。
要約すると、Cerebras-GPTは、計算最適なトレーニングが専門化したハードウェアで達成可能であることを示し、スケール法則やモデル効率を研究するための貴重なリソースを提供することで、人工知能分野に重要な貢献をもたらした。