Meta Llama 3は、2024年4月18日にMeta AIがリリースした大規模言語モデルのファミリーである。初期リリースには、80億パラメータと700億パラメータの2つのモデルサイズが含まれ、それぞれ基盤モデルと命令チューニング済みモデルの両方が提供された。Llama 3は、公開テキスト約15兆トークンでの大規模な事前学習と、当時のプロプライエタリなモデルに対する競争力のある性能で注目された。その後のバージョンであるLlama 3.1は、2024年7月23日にリリースされ、4050億パラメータのモデルを追加した。Llama 3シリーズは、初期のLlama 1およびLlama 2のリリースに基づく、MetaのオープンウェイトAI開発戦略における重要な一歩となった。
Llama 3モデルは広くアクセス可能なように設計され、商用利用を許可するコミュニティライセンスの下でウェイトが公開された。これは、当初のLlamaのより制限的なライセンスからの転換を示すものである。このリリースには、FacebookやWhatsAppに統合されたアシスタントであるMeta AIの展開も伴い、モデルの実用的な応用を示した。モデルは多様なデータセットで訓練され、推論、コーディング、一般知識のベンチマークで強い性能を示し、OpenAI、Anthropic、Google DeepMindのモデルに対する競争力のある代替手段として位置づけられた。
背景と文脈
Llama 3の開発は、2022年末のChatGPTの成功に触発されたLarge language model研究の急速な進歩を背景に行われた。OpenAIのGPT-3のリリースとその後のChatGPTの人気に続き、モデルのスケールアップへの取り組みが急増し、一部では推論や指示追従における創発的な能力が示された。Metaの初期の対応であるLlama 1は、2023年2月に研究重視のモデルとしてリリースされ、ウェイトは承認された学術研究者のみが利用可能だった。2023年3月にBitTorrentを介して拡散されたモデルのリークは、オープンアクセスへの需要を浮き彫りにし、AI開発におけるオープンモデルの役割についての広範な議論につながった。
2023年7月にMicrosoftとの提携でリリースされたLlama 2は、商用利用を許可する寛容なライセンスの下でのよりオープンなアクセスへの移行を示した。これがLlama 3の舞台を整え、スケールと能力の点でオープンウェイトモデルの限界を押し広げることを目指した。Llama 3のリリースはまた、Generative AIが主流の焦点となり、クラウドプロバイダーやハードウェア企業からの大規模な投資が行われていた時期と重なった。
モデルアーキテクチャとトレーニング
Llama 3モデルは、現代の大規模言語モデルの支配的な設計であるTransformer (architecture)アーキテクチャに基づいている。アーキテクチャには、以前のLlamaバージョンからの改善が組み込まれており、より大きな語彙サイズ(128,256トークン)と、その後の更新で拡張された8,192トークンのコンテキスト長が含まれる。モデルは標準的なデコーダーのみの設計で、Multi-Head AttentionとPositional Encodingを使用し、次トークン予測の目的で訓練された。
Llama 3のトレーニングの重要な特徴は、データの規模である。モデルは、公開ソースからのテキスト約15兆トークンで事前学習され、Llama 2で使用された2兆トークンから大幅に増加した。トレーニングデータは、高品質のソースを重視してキュレーションされ、ウェブページ、書籍、科学記事が含まれ、多言語およびコードコンテンツに焦点が当てられた。命令チューニング済みバージョンは、公開の命令データセットと1000万以上の人間が注釈した例でさらに微調整され、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)や教師あり微調整などの技術が使用された。
スケーリング則に関して、Llama 3チームは、Chinchilla最適トークン数を大幅に超えて訓練しても、性能が対数線形的に向上し続けることを観察した。8Bモデルでは、Chinchilla最適データセットサイズは2000億トークンと推定されたが、モデルは完全な15兆トークンでの訓練から引き続き恩恵を受け、従来の推奨を超える大規模データセットが利益をもたらす可能性を示した。
性能とベンチマーク
2024年4月に実施されたMetaの内部評価では、Llama 3 70Bモデルは、さまざまなベンチマークで主要なプロプライエタリモデルを上回った。具体的には、Google DeepMindのGemini Pro 1.5とAnthropicのClaude 3 Sonnetを、推論、コーディング、一般知識を含むほとんどの標準的なNLPタスクで上回った。8Bモデルは、より小さいものの、Meta CEOのマーク・ザッカーバーグによると、最大のLlama 2モデル(70B)とほぼ同等の性能を持ち、より大きなトレーニングデータセットによる効率向上を示した。
モデルは、実用的なアプリケーションにとって重要なコード生成と数学的推論で特に強い性能を示した。後にLlama 3.1の一部としてリリースされた405Bモデルは、これらの結果をさらに改善し、多くのベンチマークで最先端の性能を達成し、GPT-4やClaude 3.5 Sonnetなどのモデルに匹敵した。
リリースと入手可能性
2024年4月18日の初期Llama 3リリースには、8Bおよび70Bモデルが含まれ、ベースモデルと命令チューニング済みモデルの両方が提供された。モデルは、MetaのウェブサイトおよびHugging Faceなどのパートナープラットフォームを通じてダウンロード可能になった。ウェイトはLlama 3コミュニティライセンスの下で公開され、商用利用を許可するが、軍事利用や有害なコンテンツの生成など特定の用途を制限する利用許容ポリシーが含まれる。このライセンスは、オープンソースイニシアチブによってオープンソースとは見なされないが、多くのプロプライエタリモデルと比較して寛容である。
Metaはまた、Llama 3をAIアシスタントであるMeta AIに統合し、Facebook、WhatsApp、および専用ウェブサイトで利用可能にした。この統合により、ユーザーはモデルと直接対話し、チャット、執筆、コーディングタスクでの能力を確認できた。リリースには、Amazon Web Services、Microsoft Azure、Google Cloud、Oracle Cloud Infrastructureなどのクラウドプロバイダーとの提携も伴い、マネージドサービスを介してモデルにアクセスできるようになった。
エコシステムとハードウェアサポート
Llama 3のオープンウェイトな性質は、AIエコシステム全体での迅速な採用を促進した。ハードウェアベンダーは、AMD、Intel、NVIDIAを含むLlama 3推論用にプラットフォームを最適化した。GroqやSambaNovaなどの専門AIチップ企業は高速推論ソリューションを提供し、QualcommやArm Holdingsはエッジ展開に焦点を当てた。クラウドプロバイダーは事前構成済み環境を提供し、AWS Trainiumやその他のカスタムシリコンが微調整とトレーニングに使用された。
モデルはまた、さまざまなソフトウェアフレームワークやツールに統合され、開発者が最小限の労力でアプリケーションを構築できるようにした。複数のモデルサイズが利用可能なことで、エッジデバイスからデータセンターまで、さまざまなハードウェアでの展開が可能になり、Llama 3は研究と本番の両方で多用途な選択肢となった。
影響と評価
Llama 3のリリースは、AIコミュニティから大きな関心を集め、多くの人々がモデルの性能とウェイトのオープン性を賞賛した。これは、OpenAIやAnthropicのクローズドなアプローチへの対抗手段と見なされ、透明性と制御を好む研究者や開発者に代替手段を提供した。モデルのベンチマークでの強い性能は、オープンウェイトモデルの基準を引き上げ、他の組織が独自の開発努力を加速させるきっかけとなった。
しかし、リリースはまた、偽情報、スパム、その他の悪意のある用途を含む、オープンモデルの潜在的な悪用についての議論を引き起こした。Metaが利用許容ポリシーを含めたのは、これらのリスクを軽減する試みだったが、批評家は、ウェイトが公開されるとそのようなポリシーを執行することは困難だと主張した。この議論は、Llama 1のリーク後の初期の議論を反映したものだった。
今後の展開
初期リリース後、MetaはLlama 3ファミリーの反復を続けた。2024年7月23日にリリースされたLlama 3.1は、405Bモデルを導入し、コンテキスト長を128,000トークンに拡張し、より長い形式の推論とドキュメント処理を可能にした。405Bモデルは、データプルーニングとModel Pruning技術の組み合わせを使用して効率を改善した。Metaはまた、Llama 3を多言語およびマルチモーダルにし、画像とビデオの理解をサポートし、コーディングと推論の能力を改善する計画を発表した。
2025年4月、Metaはファミリーの次世代であるLlama 4をリリースし、モデルサイズをさらに拡大し、mixture-of-expertsアーキテクチャを導入した。将来を見据えて、Meta Superintelligence Labsは2026年4月にLlamaの後継としてMuse Sparkをリリースし、同社のAI戦略の転換を示した。それにもかかわらず、Llama 3はオープンな大規模言語モデルの進化における重要なマイルストーンであり続け、その後の分野全体の研究と開発に影響を与えている。
結論
Meta Llama 3は、大規模なトレーニングと競争力のある性能、広範なアクセス可能性を組み合わせた、オープンウェイト大規模言語モデルにおける大きな進歩を表した。そのリリースは、研究と産業の両方でのオープンモデルの採用を促進し、その影響はArtificial intelligence技術の継続的な開発に今も感じられている。モデルの成功は、プロプライエタリシステムが支配する分野におけるオープンアプローチの実現可能性を強調し、将来のリリースの先例を設定した。