LLaMA 2は、2023年7月18日にMeta AIがMicrosoftと提携してリリースした大規模言語モデル(LLM)のファミリーである。これは、2023年2月の初回リリースに続くLLaMA(Large Language Model Meta AI)シリーズの第2世代を表す。モデルは70億、130億、700億の3つのパラメータサイズで提供され、基盤モデルとチャット用途向けに微調整されたバージョンの両方が含まれていた。前身からの重要な変更点はライセンスであり、すべてのLLaMA 2モデルは重み付きでリリースされ、多くの商用利用ケースが許可されたが、ライセンスの利用許容ポリシーにより、Open Source Initiativeによってオープンソースとは見なされなかった。
このリリースは、AIモデル配布におけるMetaのアプローチの大きな転換を示した。最初のLLaMAモデルは学術研究者に限定されケースバイケースで提供されていたが、LLaMA 2は商用エンティティを含むより広いオーディエンスにアクセス可能となった。この動きは、よりオープンなモデルリリースへの業界全体のトレンドの一部であり、AIの文脈におけるオープンソースの定義に関する議論も引き起こした。モデルアーキテクチャはLLaMA 1からほぼ変更されなかったが、トレーニングデータは40%増加し、さまざまなベンチマークでのパフォーマンスが向上した。
背景と文脈
LLaMA 2の開発は、大規模言語モデルの急速な進歩を背景に行われた。GPT-3のようなモデルの成功とChatGPTの予想外の人気に続き、テック企業間で高性能なLLMを生み出すための激しい競争があった。MetaのチーフAI科学者であるYann LeCunは、大規模言語モデルは文章作成タスクの支援に最も適していると公に述べており、AI能力に関する広範な議論の中でMetaのアプローチを位置づけていた。
最初のLLaMAモデルは2023年2月24日に発表され、すでに小規模なモデルがはるかに大きなモデルと競争できることを実証していた。130億パラメータ版は、ほとんどのNLPベンチマークでGPT-3(1750億パラメータ)を上回り、650億モデルはPaLMやChinchillaのような最先端システムと競争力があった。この効率性は、公開データでのトレーニングと、深層学習およびニューラルネットワーク設計における高度な技術の使用に一部起因していた。
モデルアーキテクチャとトレーニング
LLaMA 2のアーキテクチャは、大規模言語モデルの標準となっていたTransformer (architecture)フレームワークに基づいていた。モデルは、LLaMA 1の設計と一貫して、マルチヘッドアテンションメカニズムと位置エンコーディングを使用してトレーニングされた。トレーニングプロセスでは、最初のバージョンと比較してデータセットを40%スケールアップし、モデルがより広範なテキストコーパスから学習できるようにした。
700億パラメータモデルはファミリー内で最大であり、高性能アプリケーション向けに設計され、70億および130億バージョンは、計算リソースが限られた研究者や開発者にとってよりアクセスしやすいオプションを提供した。すべてのモデルは基盤モデルと指示チューニング版の両方としてリリースされ、後者はチャットおよび会話タスク向けに微調整された。この二重リリースは、当初は基盤モデルのみであったLLaMAシリーズにとって初めてのことであった。
ライセンスと商用利用可能性
LLaMA 2の特徴的な側面はそのライセンスモデルであった。非商用ライセンスの下で学術研究者に限定されていたLLaMA 1とは異なり、LLaMA 2は商用利用を許可するライセンスの下でリリースされ、利用許容ポリシーが適用された。このポリシーは、違法行為や害を伴うアプリケーションなど特定の用途を禁止したが、幅広い正当な用途を許可した。
MetaによるLLaMA 2の「オープンソース」という特徴づけは、The Open Source Definitionを維持するOpen Source Initiativeによって異議が唱えられた。批評家は、利用許容ポリシーやその他の制限により、ライセンスが真のオープンソースの基準を満たしていないと主張した。この議論は、モデルリリースにおけるオープン性の構成要素に関するAIコミュニティ内の継続的な緊張を浮き彫りにした。
LLaMA 2の商用利用可能性は、企業やスタートアップにとって重要であり、プロプライエタリなプロバイダーからの高額なライセンス料なしにモデルを製品に統合することを可能にした。これは、OpenAIやAnthropicのような企業からのクローズドモデルの支配に対する対抗手段と見なされた。
影響と評価
LLaMA 2のリリースは、AIコミュニティでかなりの関心を集めた。特に700億モデルのパフォーマンスは、当時の他の主要モデルと競争力があり、寛容なライセンスは研究と商用展開の両方にとって魅力的な選択肢となった。複数のサイズが利用可能だったことで、ユーザーはエッジデバイスから大規模サーバーまで、ハードウェア能力に一致するモデルを選択できた。
LLaMA 2に続き、Metaはシリーズの開発を継続し、2023年8月にコード特化タスク向けのCode Llamaをリリースし、その後2024年4月に改善されたパフォーマンスとより大きなトレーニングデータセットを持つLLaMA 3をリリースした。LLaMAファミリーはMetaのAI戦略の基盤となり、LLaMA上に構築されたアシスタントであるMeta AIの開発、そして2025年4月のLLaMA 4の最終リリースへと至った。2026年4月、Meta Superintelligence LabsはLLaMAの後継としてMuse Sparkを導入し、MetaのAIモデルの次の進化を示した。
技術的詳細とバリアント
LLaMA 2モデルは、Adamオプティマイザーや学習率スケジュールなど、現代のLLM開発で一般的な技術を使用してトレーニングされた。トレーニングプロセスでは、トレーニングを安定させ収束を改善するために勾配クリッピングとレイヤー正規化も採用された。これらの方法はこの分野で標準的であり、当時の機械学習の最先端を反映していた。
LLaMA 2の専門バリアントであるCode Llamaは、コード特化データセットで微調整された。70億、130億、340億バージョンが2023年8月24日にリリースされ、700億バージョンが2024年1月29日に続いた。トレーニングには、追加の5000億トークンのコードデータ、続いて200億トークンの長文脈データが含まれ、一般的なコード生成用の基盤モデルが作成された。さらに50億トークンの指示追従データでの微調整により指示バージョンが生成され、別のPython特化モデルは1000億トークンのPythonコードでトレーニングされた。
これらの技術的発展により、LLaMA 2は自然言語処理からソフトウェア開発まで、さまざまなアプリケーション向けの多用途プラットフォームとして位置づけられた。リリースはまた、Amazon Web ServicesやAzureなどの企業がクラウドプラットフォームでLLaMA 2を提供し、より広いユーザー層にアクセス可能にすることで、より広範なエコシステムでの革新を促進した。