LLaMA 2(様式化された表記:LLaMa 2)は、2023年7月18日にMeta AIがMicrosoftと提携してリリースした大規模言語モデルのファミリーである。これは元のLLaMAモデルの後継であり、モデルの重みを商用利用可能にしたことで注目され、以前のバージョンの学術研究限定アクセスからの転換を示した。リリースには、基盤モデルと命令チューニングされたチャットバリアントの両方が含まれ、サイズは70億、130億、700億パラメータであった。
モデルアーキテクチャはLLaMA 1からほぼ変更されなかったが、トレーニングデータは40%増加した。LLaMA 2は公開データでトレーニングされ、チャットバージョンはRLHF(人間のフィードバックからの強化学習)などの技術を用いてファインチューニングされた。モデルは商用利用を許可するカスタムライセンスの下で配布されたが、利用に関する許容ポリシーが課され、オープンソースソフトウェアとしての資格を巡る論争を引き起こした。
背景
2022年末のChatGPTのリリースとその急速な人気は、生成AIと大規模言語モデルへの関心を高めた。Metaの主任AI科学者であるYann LeCunは、以前からそのようなモデルは文章作成の補助に最も適していると述べており、Metaのアプローチをより広いAIの状況に位置づけていた。
2023年2月24日に発表されたLLaMA 1は、10億から650億パラメータの範囲の基盤モデルファミリーであった。その重みは当初、非商用ライセンスの下で研究者にケースバイケースでのみ利用可能であった。2023年3月、LLaMA 1の無許可コピーがBitTorrentとHuggingFaceを通じてリークされ、Metaは削除要求を提出した。このリークは、急速なコミュニティ革新を促進したStable Diffusionのオープン配布に例えられた。
リリースと特徴
LLaMA 2は2023年7月18日に発表され、3つのパラメータサイズ(7B、13B、70B)が提供された。基盤モデルは、LLaMA 1より40%多い2兆トークンの公開データでトレーニングされた。チャットモデルは100万以上の人間のアノテーションでファインチューニングされ、RLHFを用いて応答をユーザーの意図に合わせた。
LLaMA 2のライセンスは商用利用を許可したが、他の大規模言語モデルの改善に使用することを禁止するなどの制限を含んでいた。これにより、Open Source Initiativeは、Metaがその用語を使用したにもかかわらず、LLaMA 2は真のオープンソースではないと主張した。
商用およびエコシステムへの影響
LLaMA 2の商用利用可能性は、OpenAIやAnthropicのプロプライエタリモデルに代わるものを求めるスタートアップや企業にとって人気のある選択肢となった。これはAmazon Web Services(AWS)、Azure、Google Cloudプラットフォームに統合され、マネージドサービスを介した展開を可能にした。70Bモデルは特にベンチマークでの性能で注目され、より大きなプロプライエタリモデルに匹敵することが多かった。
2023年8月、Metaはコード生成に特化したLLaMA 2のファインチューニング版であるCode Llamaをリリースし、サイズは7B、13B、34B、後に70Bが追加された。これにより、LLaMA 2のソフトウェア開発タスクへの適用範囲が拡大した。
後継と遺産
LLaMA 2は2024年4月18日にLLaMA 3によって後継され、15兆トークンでトレーニングされた8Bおよび70Bモデルが導入された。LLaMA 3は、Chinchilla最適なトレーニングデータ量を超えても性能が向上し続けることを実証し、その発見はスケーリング慣行に影響を与えた。LLaMA 3.1は2024年7月23日に続き、405Bパラメータモデルが導入され、LLaMA 4は2025年4月にリリースされた。
2026年4月、Meta Superintelligence LabsはLLaMAの代替としてMuse Sparkを導入し、MetaのAIモデル戦略の転換を示した。LLaMA 2は、商用アクセシビリティの先例を設定し、生成AIのエコシステムを形成したことで、オープンウェイトの大規模言語モデルの歴史における重要なマイルストーンであり続けている。