Llama 3は、Meta AIによって開発され、2024年4月18日にリリースされた大規模言語モデルのファミリーである。これは2023年2月に始まったLlamaシリーズの一部であり、オープンウェイトモデルの性能における重要な進歩を表している。初期リリースには、80億(8B)および700億(70B)パラメータの2つのモデルサイズが含まれ、基盤モデルと指示調整済みバージョンの両方が提供された。Llama 3モデルは、公開ソースからの約15兆トークンのテキストで事前学習され、指示調整済みバリアントは、公開指示データセットと1000万以上の人間による注釈付き例でさらに微調整された。
Llama 3は、前身のアーキテクチャ原則に基づいているが、トレーニングデータの規模と性能において顕著な改善を導入している。Meta AIの2024年4月のテストによると、70Bモデルは、Gemini Pro 1.5やClaude 3 Sonnetなどの競合モデルを、ほとんどのベンチマークで上回った。このリリースはまた、Llamaに基づくAIアシスタントであるMeta AIの展開も示し、専用ウェブサイトとFacebookおよびWhatsAppへの統合を通じて利用可能となった。
背景
Llama 3の開発は、特に2022年末のChatGPTのリリース後の生成AIにおける急速な進歩を背景に行われた。ChatGPTの成功は大規模言語モデルへの関心を高め、企業がこれらのシステムのスケーリングと改良に多額の投資をするよう促した。Metaの最高AI科学者であるYann LeCunは以前、大規模言語モデルは執筆支援に最も適していると述べており、この見解がLlamaモデルの設計に影響を与えた。
Llama 3はまた、モデル配布におけるMetaのアプローチの変化を反映している。元のLlamaは非商用ライセンスの下で学術研究者に限定されていたが、Llama 3を含むその後のバージョンは、商用利用を一部許可するライセンスの下でより広いオーディエンスにアクセス可能となった。この開放性は革新を促進したが、AIコミュニティにおける「オープンソース」の定義に関する議論も引き起こした。
アーキテクチャとトレーニング
Llama 3モデルは、以前のLlamaバージョンと同様の標準的なTransformer (architecture)アーキテクチャを使用しているが、トレーニング方法論に強化が加えられている。モデルは15兆トークンのデータセットでトレーニングされ、Llama 2で使用された1.4兆トークンから大幅に増加した。この規模により、モデルは幅広いタスクでより良い性能を達成できた。
Llama 3トレーニングからの重要な発見は、スケーリング則に関連していた。モデルは、トレーニングデータが「Chinchilla最適」量を超えても、性能が対数線形的に向上し続けることを経験的に示した。例えば、8BモデルのChinchilla最適データセットは2000億トークンであるが、性能は使用された15兆トークン(75倍大きい)までスケーリングし続けた。この観察は、将来のモデルトレーニング戦略に影響を与える。
Dwarkesh Patelとのインタビューで、Meta CEOのMark Zuckerbergは、Llama 3の8Bバージョンが最大のLlama 2モデルとほぼ同等の性能を持つと述べた。また、70Bモデルは15兆トークンのトレーニング終了時点でもまだ学習中だったが、GPUリソースを他の場所に割り当てるためにトレーニングを停止する決定が下されたと述べた。
性能とベンチマーク
Llama 3モデルは、リリース時点で多くの自然言語処理ベンチマークで最先端の結果を達成した。特に70Bモデルは、推論、コーディング、一般的な知識などのタスクで、Gemini Pro 1.5やClaude 3 Sonnetを含むいくつかのプロプライエタリモデルを上回った。8Bモデルは、その小さなサイズにもかかわらず競争力のある性能を発揮し、それほど強力でないハードウェアでの展開に適していた。
Meta AIの評価では、Llama 3 70Bが数学的推論やコード生成などの分野で優れていることが示され、8Bモデルは効率と能力の強力なバランスを提供した。これらの結果は、Llama 3を主要なオープンウェイトモデルとして位置づけ、クローズドソースシステムの優位性に挑戦した。
可用性とエコシステム
Llama 3は、商用利用を許可するライセンスの下でリリースされ、特定のアプリケーションを制限する許容使用ポリシーが付随している。モデルはMetaのウェブサイトからダウンロード可能であり、Amazon Web Services、Azure、Google Cloudを含むさまざまなクラウドプラットフォームを通じて利用できる。このアクセス可能性は、研究と産業における広範な採用を促進した。
Llama 3のリリースはまた、モデルの能力を活用するアシスタントであるMeta AIの立ち上げと同時期に行われた。Meta AIはFacebook、WhatsApp、および専用ウェブサイトに統合され、ユーザーに会話型AIサービスを提供している。Llama 3の周辺エコシステムには、微調整、量子化、展開のためのツールが含まれており、開発者が特定のユースケースに合わせてモデルをカスタマイズできるようにしている。
遺産と未来
Llama 3は、オープンウェイト大規模言語モデルの進化におけるマイルストーンを示し、そのようなモデルがプロプライエタリな対応物に匹敵できることを実証した。その成功は、2024年7月23日にリリースされたLlama 3.1を含むその後の開発に影響を与え、さらなる改善を導入した。Llamaシリーズは2025年4月にLlama 4で継続され、2026年4月にはMeta Superintelligence LabsがLlamaの後継としてMuse Sparkをリリースした。
Llama 3の影響は技術的な成果を超えて広がり、AIの安全性、アクセス可能性、および高度なAI技術の民主化に関する議論に貢献した。そのオープンウェイトな性質により、世界中の研究者や開発者がモデルを実験し、その上に構築することが可能となり、活気ある革新のエコシステムを育んだ。