LLaMA 3は、2024年4月18日にMeta AIが公開した大規模言語モデルのファミリーである。Llamaシリーズの第3世代であり、Llama 2の後継にあたり、当初は80億パラメータと700億パラメータの2つのモデルサイズが含まれる。これらのモデルは、公開ソースから得られた約15兆トークンのテキストで事前学習され、指示チューニング版は公開の指示データセットと1,000万件以上の人間による注釈付きサンプルで微調整された。LLaMA 3は、多くのベンチマークでGemini Pro 1.5やClaude 3 Sonnetなどのプロプライエタリモデルと競合する性能を示し、Metaは多言語対応、マルチモーダル化、コーディングと推論の向上を計画していると発表した。
背景
LLaMA 3の開発は、生成AIの急速な進歩の中で行われ、OpenAIのChatGPTの成功と、それ以前のLlamaモデルの公開が続いた時期にあたる。MetaのチーフAI科学者であるYann LeCunは、大規模言語モデルは文章作成の補助に最も適していると述べており、Metaが実用的な応用に焦点を当てていることを反映している。Llamaシリーズは2023年2月に最初のLLaMAとして始まり、当初は非商用ライセンスのもとで研究者のみが利用できた。BitTorrentを介した重みの不正な流出後、Llama 2を含むその後のバージョンは、商用利用が許可され、よりアクセスしやすくなった。
モデルアーキテクチャと学習
LLaMA 3は、以前のLlamaモデルで使用されたトランスフォーマーアーキテクチャを維持しつつ、学習データの規模と品質を改善している。モデルは15兆トークンで学習され、これはモデルサイズに対するChinchilla最適量を大幅に上回る。例えば、8Bモデルに対するChinchilla最適データセットは2,000億トークンであるが、性能はその75倍まで対数線形的にスケールし続けた。この経験的発見は、従来最適とされていたよりも大規模なデータセットで学習することの利点を浮き彫りにした。70Bモデルは学習終了時点でもまだ学習途中であったが、MetaはGPUリソースを他の場所に割り当てるために学習を停止することを決定した。モデルはAdamオプティマイザや深層学習で一般的なその他の手法を用いて学習された。
公開と入手可能性
LLaMA 3は2024年4月18日に公開され、基盤モデルと指示チューニング版の両方の重みが利用可能となった。元のLLaMAがケースバイケースの承認を必要としたのとは異なり、LLaMA 3は商用利用を許可するライセンスのもとで公開されたが、一部の論者は、これが真のオープンソースを妨げる許容利用ポリシーを含むと主張している。公開には、LLaMA 3を基盤とするアシスタントであるMeta AI専用ウェブサイトの開設や、FacebookとWhatsAppへの統合も含まれていた。Metaはまた、より大規模なモデルと拡張された機能に関する将来計画も発表した。
性能と評価
Metaの内部テストでは、LLaMA 3 70Bは、ほとんどのベンチマークでGoogle DeepMindのGemini Pro 1.5とAnthropicのClaude 3 Sonnetを上回った。8Bモデルは、Mark Zuckerbergによると、最大のLlama 2モデルとほぼ同等の性能を持つと報告された。この公開はAIコミュニティで好意的に受け止められ、高性能モデルがオープンに利用できることを多くの人が称賛した。しかし、一部の評論家は、ライセンスの制限により完全なオープンソースではないと指摘し、この点はOpen Source Initiativeも提起した。LLaMA 3の成功は、オープンウェイトモデルの普及に貢献し、2024年7月のLlama 3.1や2025年4月のLlama 4など、その後の公開に影響を与えた。
影響と遺産
LLaMA 3の公開は、オープンウェイトモデルがプロプライエタリシステムに挑戦するというトレンドを強化した。その学習データの規模と性能は、モデル開発におけるデータ量の重要性を示した。Hugging Faceなどのプラットフォームや、AWSやAzureなどのクラウドサービスを通じたモデルの入手可能性は、広範な採用を促進した。2026年4月、Meta Superintelligence LabsはLlamaの後継としてMuse Sparkを公開し、Llamaシリーズの終焉を告げた。それでもなお、LLaMA 3は人工知能と機械学習の進化における重要なマイルストーンであり続けている。