LLaMA(大语言模型系列)

英語からの翻訳

LLaMA(Large Language Model Meta AI)は、Meta AIが2023年2月からリリースした大規模言語モデルのファミリーであり、10億から2兆パラメータにわたり、Llama 1、2、3、4などのバージョンが含まれます。

LLaMA(Large Language Model Meta AI、逆頭字語として機能)は、Meta AIが2023年2月からリリースした大規模言語モデル(LLM)のファミリーである。モデルは10億から2兆パラメータまでの様々なサイズで提供されている。当初は基盤モデルとしてリリースされたが、Llama 2以降、Meta AIは基盤モデルに加えて命令微調整版もリリースした。最新版は2025年4月にリリースされたLlama 4である。2026年4月、Meta Superintelligence LabsはLlamaの後継としてMuse Sparkをリリースした。

背景

GPT-3などの大規模言語モデルのリリース後、研究の焦点はモデルのスケールアップに置かれ、一部の事例では創発的能力の大幅な向上が見られた。ChatGPTのリリースとその驚異的な成功は、大規模言語モデルへの関心を高めた。ChatGPTへの他の対応と比較して、Metaの最高AI科学者であるYann LeCunは、大規模言語モデルは文章作成の補助に最適であると述べた。

バージョン

初期リリース

Llamaの最初のバージョン(LLaMAとして様式化され、時にはLlama 1とも呼ばれる)は、2023年2月24日にブログ投稿と、モデルのトレーニング、アーキテクチャ、パフォーマンスを説明する論文を通じて発表された。モデルを実行するための推論コードは、オープンソースのGPLv3ライセンスの下で公開された。モデルの重みへのアクセスは申請プロセスによって管理され、アクセスは「学術研究者、政府、市民社会、学界の組織に所属する者、および世界中の産業研究ラボに対してケースバイケースで付与される」とされた。

Llamaは公開情報のみを使用してトレーニングされ、様々なモデルサイズでトレーニングされた。これは、異なるハードウェアへのアクセスを容易にすることを意図していた。モデルは専ら基盤モデルであったが、論文には命令微調整版のモデルの例が含まれていた。Meta AIは、13BパラメータモデルのほとんどのNLPベンチマークでのパフォーマンスが、はるかに大きなGPT-3(175Bパラメータ)を上回り、最大の65BモデルはPaLMやChinchillaなどの最先端モデルと競合すると報告した。

#### リーク

2023年3月3日、Llamaの重みを含むトレントがアップロードされ、トレントへのリンクは4chanの画像掲示板で共有され、その後オンラインのAIコミュニティに広まった。同日、メインのLlamaリポジトリに、公式ドキュメントへのマグネットリンクの追加を要求するプルリクエストが開かれた。3月4日には、モデルを含むHuggingFaceリポジトリへのリンクを追加するプルリクエストが開かれた。3月6日、MetaはプルリクエストでリンクされたHuggingFaceリポジトリの削除要求を提出し、これをモデルの「無許可配布」と特徴付けた。HuggingFaceは要求に応じた。3月20日、MetaはミラーからLlamaをダウンロードするスクリプトを含むリポジトリに対して著作権侵害のDMCA削除要求を提出し、GitHubは翌日に応じた。

リークへの反応は様々であった。一部は、モデルがより洗練されたスパムなどの悪意のある目的に使用されるだろうと推測した。一部は、モデルのアクセス可能性と、モデルの小さなバージョンを比較的安価に実行できるという事実を祝し、これが追加の研究開発の繁栄を促進するだろうと示唆した。Simon Willisonなどの複数のコメンテーターは、LlamaをStable Diffusionと比較した。Stable Diffusionは、先行する同等の洗練されたモデルとは異なり、公開配布されたテキストから画像へのモデルであり、関連するツール、技術、ソフトウェアの急速な普及につながった。

Llama 2

2023年7月18日、Microsoftとの提携により、Metaは次世代のLlamaであるLlama 2(LLaMa 2として様式化)を発表した。MetaはLlama 2を7、13、70億パラメータの3つのモデルサイズでトレーニングし、リリースした。モデルアーキテクチャはLlama 1モデルからほぼ変更されていないが、基盤モデルのトレーニングには40%多いデータが使用された。

Llama 2には基盤モデルとチャット用に微調整されたモデルが含まれる。元のバージョンのLlamaからのさらなる逸脱として、すべてのモデルは重み付きでリリースされ、多くの商用ユースケースで使用できる。Llamaのライセンスは、Llamaの一部の目的での使用を禁止する利用許諾ポリシーを強制するため、オープンソースではない。Llamaを説明するためのMetaのオープンソースという用語の使用は、Open Source Initiative(The Open Source Definitionを維持する組織)や他の組織によって異議が唱えられている。

Code Llamaは、コード固有のデータセットを使用したLlama 2の微調整版である。7B、13B、34Bバージョンが2023年8月24日にリリースされ、70Bバージョンが2024年1月29日にリリースされた。Llama 2の基盤モデルから始めて、Meta AIは追加の500Bトークンのコードデータセットをトレーニングし、その後追加の20Bトークンの長文脈データをトレーニングして、Code Llama基盤モデルを作成した。この基盤モデルはさらに5Bトークンの命令追従データでトレーニングされ、命令微調整版が作成された。Pythonコード用の別の基盤モデルも作成され、長文脈データの前に100BトークンのPython専用コードでトレーニングされた。

Llama 3

2024年4月18日、MetaはLlama 3を8Bと70Bパラメータの2つのサイズでリリースした。モデルは「公開ソース」から収集された約15兆トークンのテキストで事前トレーニングされ、命令モデルは「公開の命令データセット、および1000万以上の人間による注釈付き例」で微調整された。Meta AIのテストでは、2024年4月時点でLlama 3 70BがほとんどのベンチマークでGemini Pro 1.5とClaude 3 Sonnetを上回っていた。Metaはまた、Llama 3を多言語かつマルチモーダルにし、コーディングと推論を改善し、コンテキストウィンドウを増やす計画を発表した。

スケーリング則に関して、Llama 3モデルは、「Chinchilla最適」量を超えるデータでトレーニングされた場合、パフォーマンスが対数線形でスケールし続けることを経験的に示した。例えば、Llama 3 8BのChinchilla最適データセットは2000億トークンであるが、パフォーマンスは15兆トークンの75倍大きいデータセットまで対数線形でスケールし続けた。Dwarkesh Patelとのインタビューで、Mark ZuckerbergはLlama 3の8Bバージョンが最大のLlama 2とほぼ同等の能力を持つと述べた。以前のモデルと比較して、Zuckerbergはチームが15Tトークンのトレーニングの終了時でも70Bモデルがまだ学習していることに驚いたと述べた。トレーニングを終了する決定は、GPUパワーを他の場所に集中させるためになされた。

Llama 3.1は2024年7月23日にリリースされ、サイズは8B、70B、405Bパラメータである。405BモデルはLlamaとして初めての混合専門家モデルであり、再配布と変更を許可するライセンスの下でリリースされたが、他の大規模言語モデルの改善に使用することには制限があった。Llama 3.2は2024年9月25日にリリースされ、エッジデバイス用の1Bと3B、ビジョンタスク用の11Bと90Bのサイズがあった。Llama 3.3は2024年12月6日にリリースされ、効率性のために最適化された70Bモデルがあった。

Llama 4

Llama 4は2025年4月にリリースされた。初期リリースにはLlama 4 Scout、Maverick、Behemothが含まれた。ScoutとMaverickはオープンウェイトモデルとしてリリースされ、Behemothはプレビューとしてリリースされた。Scoutは1000万トークンのコンテキストウィンドウを持つ17Bパラメータモデルであり、Maverickは100万トークンのコンテキストウィンドウを持つ400Bパラメータの混合専門家モデルである。Behemothはリリース時点でまだトレーニング中であった2兆パラメータの混合専門家モデルである。

評価と影響

Llamaの初期リリース、特にリークは、AIコミュニティに大きな影響を与えた。小さなモデルのアクセス可能性は、消費者向けハードウェアでの研究開発を可能にし、微調整されたバリアントとツールの普及を促進した。Llamaモデルは学術研究や商用アプリケーションで広く使用されており、他の組織からのその後のオープンウェイトモデルのリリースに影響を与えた。Llama 3とLlama 4のリリースはこの傾向を継続し、MetaはLlamaをOpenAIAnthropicGoogle DeepMindのプロプライエタリモデルに対する主要なオープンウェイトの代替として位置付けた。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·meta-ai·artificial-intelligence·open-source-software
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴