BLOOM-176Bは、BigScienceコラボレーションによって開発され、2022年7月に公開されたBLOOM(BigScience Large Open-science Open-access Multilingual)言語モデルの最大規模の変種です。1760億のパラメータを持つこのモデルは、Transformer (architecture)ベースの高密度なLarge language modelであり、数十の自然言語とプログラミング言語でテキストを生成するように設計されています。このモデルは、1.6テラバイト以上のテキストからなる厳選されたデータセットであるROOTSコーパスでトレーニングされ、有害な用途を防ぐための使用制限を含むオープンライセンスであるResponsible AI Licenseの下で公開されました。
BLOOM-176Bは、独自モデルに代わる大規模で多言語対応の選択肢を提供するために作成され、透明性と再現性を重視しています。そのアーキテクチャは、標準的なデコーダーのみのトランスフォーマーに従い、Multi-Head Attention、Layer Normalization、Positional Encodingを備えていますが、より長いシーケンスへの外挿を改善するALiBi(Attention with Linear Biases)位置エンコーディング方式など、いくつかの革新を取り入れています。このモデルは46の自然言語と13のプログラミング言語をサポートしており、当時の大規模モデルの中でも最も言語的に多様なものの一つとなっています。
トレーニングと計算
BLOOM-176Bのトレーニングには、かなりの計算リソースが必要でした。このモデルは、フランスのJean Zayスーパーコンピューターで、それぞれ80GBのメモリを備えた384基のNVIDIA A100 GPUを使用してトレーニングされました。トレーニングプロセスには約3.5か月かかり、約1,082,990計算時間を消費しました。チームは、Adam (Optimizer)と、ウォームアップフェーズとコサイン減衰を含むLearning Rate Schedulingを含む、Deep learning最適化手法の組み合わせを使用しました。トレーニングを安定させるためにGradient Clippingが適用され、メモリ使用量を削減するためにbfloat16混合精度が使用されました。
トレーニングデータであるROOTSは、BigScienceコミュニティによって収集され、書籍、ニュース記事、ウェブコンテンツなど、多様なソースからの1.6テラバイトのテキストで構成されていました。データセットは、品質を確保しバイアスを減らすためにフィルタリングおよび重複排除されました。モデルは2048トークンのコンテキスト長でトレーニングされ、ALiBiメカニズムにより、追加のトレーニングなしで推論時に長いシーケンスを処理できました。
機能とパフォーマンス
BLOOM-176Bは、サポートされている言語でのテキスト生成、翻訳、要約に優れています。他の大規模モデルと同様に、強力な少数ショット学習能力を示し、質問応答やコード生成などのタスクを実行できます。評価では、SuperGLUEや多言語タスクなどのベンチマークで競争力のある結果を達成しましたが、多言語に焦点を当てているため、英語のみのタスクではGPT-3などのモデルに遅れを取ることがありました。
注目すべき特徴の一つは、他のモデルでは過小評価されることが多いアフリカや東南アジア地域の低リソース言語でテキストを生成できることです。このモデルは、Python、Java、C++などのプログラミング言語もサポートしており、コード補完と生成を可能にします。ただし、すべてのGenerative AIモデルと同様に、偏った出力や事実と異なる出力を生成する可能性があり、ライセンスには高リスク領域での使用制限が含まれています。
公開とアクセス
BLOOM-176Bは、2022年7月にHugging Face Hubを通じて公開され、重みをダウンロードできるようになりました。公開には、トレーニングプロセスと意図された用途を文書化した詳細なモデルカードとテクニカルレポートが付随していました。このモデルはハイエンドハードウェアで実行できますが、そのサイズのため、複数のGPUまたは大容量メモリを備えたAmazon Web Servicesインスタンスが必要です。BigScienceコラボレーションは、性能の低いハードウェアでの研究を容易にするために、BLOOM-7BやBLOOM-3Bなどの小規模バージョンも公開しました。
BLOOM-176Bのオープンアクセス性は、特に独自モデルへのアクセスが限られている学界や地域の研究者や開発者にとって貴重なリソースとなりました。これは、バイアス、解釈可能性、多言語NLPに関する研究に使用され、Artificial intelligence研究のより広い分野に貢献しています。
影響と遺産
BLOOM-176Bは、大規模言語モデルが企業リソースに頼らずに協力的かつ透明性を持って開発できることを実証しました。その公開は、FalconやLlamaなどのその後のオープンソースの取り組みに影響を与え、同様のライセンスと透明性の原則を採用しました。このモデルはまた、Machine learningにおける多言語表現の重要性を強調し、他のプロジェクトに言語的多様性を優先するよう促しました。
その成功にもかかわらず、BLOOM-176Bは、推論の高コストや特定タスクへのファインチューニングの難しさなど、課題に直面しました。2025年時点では、オープンアクセスモデルの参照点であり続けていますが、新しいモデルが性能と効率でそれを上回っています。その遺産は、コミュニティ主導のAI開発が倫理的ガイドラインを守りながら最先端の結果を生み出せることを証明したことにあります。