Metaは2024年4月18日、進行中のLlamaシリーズの一環として、大規模言語モデル(LLM)のファミリーであるLlama 3をリリースした。このリリースには、80億パラメータと700億パラメータの2つのモデルサイズが含まれ、いずれも公開ソースからの約15兆トークンのテキストで事前学習された。命令チューニングされたバリアントは、公開の命令データセットと1000万以上の人間が注釈を付けた例で微調整された。MetaはLlama 3をオープンウェイトAIにおける重要な一歩と位置づけ、リリース時点で70Bモデルは標準ベンチマークでいくつかの商用競合他社を上回った。
Llamaシリーズは2023年2月にLlama 1で始まり、当初は非商用ライセンスの下で研究者にのみリリースされた。2023年3月にBitTorrent経由で無許可のリークが発生した後、Metaは2023年7月にLlama 2で戦略を転換し、カスタムライセンスの下でより広範な商用利用向けにウェイトを提供した。Llama 3はこの軌跡を継続し、アクセシビリティとパフォーマンスを強調した。このリリースは、Llama上に構築されたアシスタントであるMeta AIと同時期に行われ、専用ウェブサイトから利用可能で、FacebookとWhatsAppに統合された。
モデルアーキテクチャとトレーニング
Llama 3モデルは、以前のバージョンから改善された標準的なトランスフォーマーアーキテクチャを使用している。8Bおよび70Bモデルは15兆トークンでトレーニングされ、これは8BサイズのChinchilla最適量(2000億トークン)の75倍のデータセットである。最適なデータポイントを超えたにもかかわらず、パフォーマンスは対数線形的にスケーリングし続け、従来のスケーリング則に挑戦した。Metaは、70Bモデルがトレーニング終了時点でもまだ改善していたが、チームはGPUリソースを他の場所に割り当てるために停止することを選択したと報告した。
トレーニングデータは公開ソースからキュレーションされ、品質と多様性が重視された。命令の微調整には、公開データセットと人間が注釈を付けた例の組み合わせが使用され、モデルの複雑な命令に従う能力が強化された。Metaはまた、将来のバージョンを多言語、マルチモーダルにし、コーディングと推論を改善し、コンテキストウィンドウを拡大する計画を発表した。
パフォーマンスとベンチマーク
2024年4月、Metaの内部テストでは、Llama 3 70Bが、推論、コーディング、一般的な知識タスクを含むほとんどのベンチマークでGemini Pro 1.5とClaude 3 Sonnetを上回った。8Bモデルは、Mark Zuckerbergによると、最大のLlama 2モデル(70B)とほぼ同等の性能であり、大幅な効率向上を示した。これらの結果は、Llama 3をOpenAI、Anthropic、Google DeepMindなどの企業によるプロプライエタリモデルに対する競争力のある代替手段として位置づけた。
モデルは標準的なNLPベンチマークで評価され、70Bバリアントは当時のオープンウェイトモデルの中で最先端の結果を達成した。観察されたスケーリング挙動(Chinchilla最適データを超えた継続的な改善)は、より大きなデータセットがさらなる向上をもたらす可能性を示唆し、その後のMachine learningおよびDeep learningの研究に影響を与えた。
リリースとエコシステム
Llama 3は商用利用を許可するカスタムライセンスの下でリリースされたが、特定のアプリケーションを制限する利用許容ポリシーがあり、オープンソースとしての資格について議論を引き起こした。ウェイトはダウンロード可能になり、モデルはAmazon Web Services、Microsoft Azure、Google Cloud、Oracle Cloud Infrastructureを含むさまざまなプラットフォームに統合された。GroqやSambaNovaなどの専門ハードウェアプロバイダーは、Llama 3の推論を最適化し、より高速なデプロイを可能にした。
このリリースは、Llama 2の周りに出現したエコシステムと同様に、微調整されたバリアントとツールの波を促進した。開発者は、Reinforcement Learning from AI Feedback (RLAIF)やCurriculum Learningなどの技術を使用して、特定のドメイン向けにモデルを適応させた。オープンウェイトのアプローチは、競合他社のクローズドモデルとは対照的であり、Generative AIアプリケーションの革新を促進した。
その後の展開
Llama 3.1は2024年7月23日にリリースされ、405Bパラメータモデルを導入し、コンテキストウィンドウを拡大した。このバージョンは、AIの状況におけるLlamaの地位をさらに強化した。シリーズは2025年4月にLlama 4で継続され、2026年4月にはMeta Superintelligence LabsがMuse Sparkを後継としてリリースした。Llamaの進化はより広い分野に影響を与え、研究者はTransformer (architecture)アーキテクチャやLoss Functionsに関する研究に見られるように、スケーリング則とトレーニング効率を研究した。
このリリースはまた、大規模コンピューティングの役割を浮き彫りにし、MetaはAMD、Intel、TSMCなどのチップメーカーとのパートナーシップを活用してモデルを効率的にトレーニングした。Llama 3の成功は、Artificial intelligenceの未来と、オープン開発とプロプライエタリ開発のバランスに関する議論に貢献した。