Llama 2は、Meta AIが開発した大規模言語モデル(LLM)のファミリーであり、2023年7月18日にマイクロソフトとの提携で公開された。これは元のLlamaモデルの後継であり、基盤モデルと指示調整済みのチャット版の両方を含む。前身とは異なり、Llama 2は許容使用ポリシーの下で広範な商用利用に重みが提供され、オープンソースAIエコシステムに大きな影響を与えた。
Llama 2モデルは、より広範なLarge language modelの景観の一部であり、Transformer (architecture)アーキテクチャとDeep learning技術の進歩に基づいている。この公開は、強力なAIへのアクセスを民主化する大きな一歩と見なされ、OpenAIやGoogle DeepMindなどの企業による独自モデルへの競争力のある代替手段を提供した。
背景
2020年代初頭の大規模言語モデルの急速な進歩は、Llamaの舞台を設定し、Generative AIツールの成功と絡み合っている。GPT-3の公開は、モデルサイズの拡大が能力の劇的な向上をもたらすことを実証した。2022年11月、OpenAIはChatGPTを発表し、広範な注目を集め、AI研究と投資の急増を引き起こした。
MetaのAI研究部門であるMeta AIは、Google DeepMindなどの研究者によって開発されたTransformer (architecture)アーキテクチャなどの顕著な貢献で、この分野で活動していた。Metaの主任AI科学者であるYann LeCunは、大規模言語モデルに関する誇大広告に懐疑的な見解を公に示し、それらは執筆タスクの支援に最も適していると述べ、MetaがAIをより実用的でアクセスしやすくすることに焦点を当てていることを反映した。
初期公開とリーク
元のLlamaファミリー(Llama 1、LLaMAと表記)は、2023年2月24日にブログ投稿と技術論文を通じて発表された。10億から650億パラメータのサイズで利用可能であり、公開データで訓練された。当初、モデルの重みは非商用ライセンスの下で、研究者にケースバイケースでのみアクセス可能だった。
しかし、重みはすぐにオンラインでリークされた。2023年3月、重みのトレントが4chanで共有され、急速に広まった。MetaはモデルをホストするリポジトリについてHuggingFaceとGitHubに削除要求を送ったが、リークにより広範な私的利用と研究が可能になった。多くの人々がこのリークをオープンAIの転換点と見なし、Stable Diffusionが革新を加速したのと比較された。
Llama 2の公開
2023年7月18日、マイクロソフトとの提携で、MetaはLlamaファミリーの次世代であるLlama 2を発表した。同社は3つのパラメータサイズ(70億、130億、700億パラメータ)を公開した。Metaはまた、基盤モデルと微調整済みのバリアントの両方を公開した。具体的には、チャット用の微調整は会話用途向けに設計された。
モデルは元のLlamaよりも40%多いデータで訓練されたが、アーキテクチャはほぼ変更されなかった。Llama 2モデルは、Residual Network (ResNet)ブロックと注意機構を使用し、Layer Normalizationやその他の革新の恩恵を受けた。指示微調整にはRLAIFスタイルの技術が使用され、教師あり微調整と人間のフィードバックを組み合わせた。
商用利用可能性とライセンス
Llama 2の公開の最も注目すべき側面は、多くの商用アプリケーションに対して重みを無料で提供する決定だった。Metaは、商用および研究目的での使用、複製、変更を許可するカスタムライセンスの下でモデルを公開したが、ポリシーで定義された使用ケースにはいくつかの制限があった。
許容使用ポリシーやその他の条件のため、多くの批評家はLlama 2がOpen Source Initiative(OSI)の基準による真のオープンソースではないと主張した。それでも、商用利用に開放された強力な言語モデルの利用可能性は画期的であり、小規模な組織や個人が有料APIに依存せずに技術を基盤に構築することを可能にした。
マイクロソフトの提携は注目に値し、公開をMicrosoft Azureインフラストラクチャと統合した。モデルはAzure AIモデルカタログで利用可能になったが、直接ダウンロードも可能であり、アクセシビリティが向上した。
モデルアーキテクチャと訓練
Llama 2は前身と同様のアーキテクチャを採用したが、スケーリングに調整が加えられた。モデルサイズは700億パラメータに達し、より複雑なパターンを捉えることができた。訓練には、Webページ、書籍、その他の公開データを含む多様なソースが使用され、品質フィルタリングに焦点が当てられた。
訓練プロセスの重要な側面は、Learning Rate SchedulingやModel Pruningなどの原則を使用したクロスエントロピー損失の最適化を含む。Metaはまた、DropoutやWeight Initializationなどの技術を組み込んでパフォーマンスを向上させた。
7B、13B、70Bモデルが利用可能であり、70Bモデルは複数のGPUで実行するように設計されている。Llama 2は、GPT-3やChinchillaなどの現代のモデルと評価され、推論やコーディングを含むさまざまなベンチマークタスクで競争力のある結果を達成した。
オープンソースAIエコシステムへの影響
Llama 2の公開は、商用アクセスを伴い、オープンソースAIエコシステムの成長を大幅に加速させた。独自モデルへの代替手段を提供し、開発者、研究者、スタートアップのコミュニティを育成した。AI21-LabsやInflection AIなどの多くの企業が、Llama 2を自社モデルの基盤として使用した。
さらに、公開にはAmazon Web Services、Google Cloud、Oracle Cloud Infrastructureなどのクラウドサービスへの統合が伴い、展開がアクセスしやすくなった。さらに、ハードウェアベンダーであるAMD、Intel、Qualcommは、Llamaを効率的に実行するためにチップを最適化した。
派生モデルと微調整
Llama 2モデルは、さまざまなアプリケーション向けに頻繁に微調整された。注目すべき例はCode Llamaであり、専門のコードデータセットで微調整された。2023年8月24日に公開され、当初は7B、13B、34Bバージョンで、後に2024年1月29日に70Bバージョンが公開された。Code Llamaは、基盤モデルに続いて5000億トークンのコードデータで訓練された。Generative AIコミュニティは、クリエイティブライティング、法的支援、医療アドバイス用のモデルなど、他の多くの微調整を生み出した。
モデルの重みへのアクセス可能性により、研究者はModel Pruning、Quantizationなどの技術を適用でき、小規模なAI企業や教育機関が技術を研究し適応することが可能になった。
反応と批判
Llama 2への反応は概ね肯定的だったが、懸念もあった。支持者は、AIの民主化と革新の促進の可能性を賞賛し、GPT-3.5などの商用モデルと競争できると指摘した。しかし、一部の批評家は、ライセンスの制限が定義された「オープン」ではないと指摘し、自由の範囲を制限していると述べた。
許容使用ポリシーは、監視、スパム、マルウェアなどの分野でのアプリケーションを制限した。これは悪用を防ぐ努力として議論されたが、柔軟性も制限した。
一部の研究者はまた、Llama 2のような大規模モデルの訓練に関する環境的およびリソース上の懸念を指摘した。訓練にはかなりの計算能力が必要であり、倫理的および実用的な問題を引き起こした。
遺産と未来
Llama 2はオープンAIの新しい基準を設定し、2024年4月のLlama 3の後の公開につながった。この公開は業界に永続的な影響を与え、主要な商用ラボがモデルの共有方法を再考することを促した。また、他の製品の基盤としてのオープンAIコレクションの成長を奨励した。
Llama 2の制限付きで重みを提供するアプローチは、Meta AIなどのAIアシスタントを構築するために他の開発者に採用され、現在はLlama 3に基づいている。2025年後半の時点で、Llamaはモデルのファミリーであり、新しいモデルの出現にもかかわらず、Llama 2は基礎的なマイルストーンであり続けている。
まとめ
要約すると、Meta Llama 2の発表は生成AIの進歩における重要な出来事だった。強力なパフォーマンスと寛容な重みを組み合わせることで、Metaの決定はオープンAIエコシステムの形成に役立った。この出来事は、商用AIの関心を高めたエッジの1つとしてしばしば引用される。
公開時点で、Llama 2は他のAIモデルのより制限的な慣行からの脱却を示し、その影響は広範囲に及んだ。