Meta Llama 4は、Meta AIによって開発された大規模言語モデルのファミリーであり、2025年4月にLlama 3の後継としてリリースされた。テキストと画像の処理および生成が可能なネイティブなマルチモーダルモデルであること、そして1000万トークンの拡張コンテキストウィンドウを備え、非常に長いドキュメントやマルチモーダル入力を一度に処理できることが特徴である。このリリースは、Metaのオープンウェイト配布戦略を継続し、多くのアプリケーションを許可するライセンスの下で研究および商用利用にモデルを提供したが、Open Source Initiativeの定義による完全なオープンソースではない。
Llamaシリーズは2023年2月にLlama 1の初期リリースで始まり、当初は非商用ライセンスの下で研究者のみが利用可能だったが、その重みはすぐにBitTorrent経由で公開リークされた。2023年7月のLlama 2から始まる後続バージョンは、商用利用を許可するより寛容なライセンスでリリースされた。2024年4月にリリースされたLlama 3は、最大700億パラメータのモデルを導入し、15兆トークンでトレーニングされた。Llama 4はこの基盤の上に構築され、ネイティブなマルチモダリティと劇的に大きなコンテキストウィンドウを追加し、OpenAI、Anthropic、Google DeepMindのモデルに対する競争力のある対応として位置づけられた。
背景
Llama 4の開発は、Large language modelの能力における急速な進歩の文脈で行われた。2022年11月のChatGPTのリリースは、生成AIへの関心と投資の急増を引き起こし、テクノロジー企業間でより強力で効率的なモデルを生み出す競争につながった。Metaの最高AI科学者であるYann LeCunは、以前から大規模言語モデルの究極の可能性について懐疑的な見解を表明し、それらは一般的な知能を達成するよりも、文章作成の支援に最適であると示唆していた。それにもかかわらず、MetaはLlamaシリーズへの多額の投資を継続し、オープンウェイトの代替品を提供することでプロプライエタリモデルと競争することを目指した。
2025年までに、OpenAIのGPT-4、AnthropicのClaude、Google DeepMindのGeminiなどのモデルが含まれる状況があり、これらはすべてTransformer (architecture)アーキテクチャで可能なことの限界を押し広げていた。MetaのLlama 4へのアプローチは、オープンアクセスと技術革新、例えばネイティブなマルチモダリティと非常に長いコンテキストウィンドウを通じて差別化することであり、これによりドキュメント分析、コード生成、マルチモーダル推論における新しいアプリケーションが可能になる可能性があった。
アーキテクチャと能力
Llama 4はネイティブなマルチモーダルモデルとして設計され、テキストと画像データの両方で最初からトレーニングされ、視覚能力を後付けで追加するのではなく、モデルがモダリティを横断してコンテンツを理解および生成できるようにした。このアプローチにより、画像キャプション、視覚的質問応答、インターリーブされたテキスト画像生成などのタスクが可能になる。モデルのアーキテクチャはTransformer (architecture)フレームワークに基づいており、マルチモーダル入出力をサポートするための変更が加えられている。
Llama 4の最も重要な特徴の1つは、1000万トークンのコンテキストウィンドウである。これは、以前のモデルが通常128,000トークン以下のコンテキストウィンドウをサポートしていたことと比較して、大幅な増加である。より大きなコンテキストウィンドウにより、モデルは本全体、長いコードベース、または広範なマルチモーダルドキュメントを一度に処理でき、一貫性を向上させ、チャンキングや要約の必要性を減らす。この能力は、長いシーケンスの効率的な処理を可能にするPositional EncodingとMulti-Head Attentionの進歩によって実現された。
Llama 4は複数のサイズでリリースされ、エッジデバイスに適した小さなモデルからクラウド展開用の大きなモデルまでを含む。正確なパラメータ数は完全には開示されなかったが、ファミリーには数十億から数百億のパラメータを持つモデルが含まれ、以前のバージョンで観察されたスケーリングトレンドに従った。モデルは、公開されているテキストと画像の多様なデータセットでトレーニングされ、パフォーマンスを向上させるために高品質なデータに焦点を当てた。
トレーニングとデータ
Meta AIは、ウェブテキスト、書籍、コード、画像を含む公開データの大規模なコーパスでLlama 4をトレーニングした。トレーニングプロセスには、Adam (Optimizer)やLearning Rate SchedulingなどのDeep learning技術が含まれ、モデルのパラメータを最適化した。Data AugmentationとCurriculum Learningの使用は、一般化と堅牢性を向上させるのに役立った。モデルは基盤モデルとして事前トレーニングされ、その後、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)などの方法を使用して指示追従データで微調整され、ユーザーの意図に合わせた。
トレーニングデータは、幅広い言語とドメインを含むようにキュレーションされ、Llama 4を多言語対応にし、多様なタスクを処理できるようにした。画像データの包含には、Cross-Attentionメカニズムを使用して異なるモダリティからの情報を融合する、マルチモーダル入力を処理するための新しいトレーニングパイプラインの開発が必要だった。Metaはまた、大規模クラスターでのトレーニングを安定させるために、Gradient ClippingやBatch Normalizationなどの技術を採用した。
リリースと利用可能性
Llama 4は2025年4月に発表され、モデルはMetaのウェブサイトおよびパートナープラットフォームからダウンロード可能になった。リリースには、以前のLlamaリリースと同様に、基盤モデルと指示チューニング済みバージョンの両方が含まれていた。重みは商用利用を許可するライセンスの下で配布されたが、スパム生成や監視などの特定のアプリケーションを制限する許容使用ポリシーが付随していた。これにより、OpenPanelなどの組織がライセンスがOpen Source Definitionを満たしていないと指摘したため、モデルが真にオープンソースと見なせるかどうかについての議論が続いた。
Metaはまた、Llama 4をFacebook、WhatsApp、および専用ウェブサイトで利用可能なMeta AIアシスタントに統合した。これにより、ユーザーは質問への回答、コンテンツ生成、画像分析などのタスクでモデルと対話できた。リリースには、Llama 4がさまざまな自然言語処理およびマルチモーダルタスクでOpenAI、Anthropic、Google DeepMindの主要モデルと競争力のあるパフォーマンスを示すベンチマークが伴っていた。
受容と影響
Llama 4のローンチは、特にネイティブなマルチモダリティと長いコンテキストウィンドウのために、AIコミュニティから大きな関心を集めた。研究者や開発者は、AMDやIntelチップ、およびAmazon Web Services、Microsoft Azure、Google Cloudなどのクラウドプラットフォームを含むカスタムハードウェアでの微調整と展開を可能にするオープンウェイトアプローチを賞賛した。モデルの1000万トークンを処理する能力は、法的文書レビュー、科学研究、ソフトウェアエンジニアリングにおけるアプリケーションの新しい可能性を開いた。
しかし、一部の批評家は、特定のベンチマークでのモデルのパフォーマンスが常に小さくより専門的なモデルより優れているわけではなく、そのような大きなコンテキストウィンドウでの推論に必要な計算リソースが法外になる可能性があると指摘した。リリースはまた、モデルのマルチモーダル能力を考慮して、誤解を招くコンテンツやディープフェイクの生成などの悪用の可能性についての懸念を引き起こした。Metaは、安全フィルターを実装し、責任ある使用のためのガイドラインを提供することで、これらの懸念に対処した。
競合他社との比較
Llama 4は、OpenAIのGPT-4、AnthropicのClaude 3、Google DeepMindのGeminiがすでに確立されている競争の激しい市場に参入した。これらのモデルにはそれぞれ独自の強みがあった。GPT-4は一般的な推論とコーディング能力で知られ、Claude 3は長いコンテキストと安全機能で、Geminiはマルチモーダル統合で知られていた。Llama 4の主な差別化要因は、カスタマイズとローカル展開を可能にするオープンウェイト配布と、当時のほとんどの競合他社を上回る1000万トークンのコンテキストウィンドウだった。
パフォーマンスの面では、Llama 4のベンチマークは、Machine learningベンチマークなどのタスクで競争力があることを示したが、常にトップスコアラーではないことを示した。モデルのオープンウェイトの性質は、モデルを研究または微調整したい研究者や、ベンダーロックインを避けたい企業にとって魅力的だった。リリースはまた、開発者が限られたハードウェアで大規模モデルを実行しようとしたため、効率的な推論技術の革新を促進した。
将来の方向性
Llama 4のリリース後、MetaはAI研究への投資を継続し、モデルの推論、コーディング、多言語能力を改善する計画を立てた。同社はまた、AWS TrainiumやGroqアクセラレータなどの専門ハードウェアを潜在的に使用して、トレーニングと推論の計算コストを削減する方法を模索した。2026年4月、Meta Superintelligence LabsはLlamaの後継としてMuse Sparkをリリースし、さらに高度な能力を持つより高度なモデルへの移行を示した。Muse Sparkは、Llama 4から学んだ教訓に基づいて構築され、新しいアーキテクチャとトレーニング技術を組み込んで、AIで可能なことの限界を押し広げることが期待された。
Llama 4の遺産は、オープンウェイトモデルがプロプライエタリモデルと競争できること、そしてネイティブなマルチモダリティと長いコンテキストウィンドウが大規模で実現可能であることを実証したことにある。また、AI開発におけるオープン性と安全性の間の継続的な緊張を浮き彫りにし、この議論は分野を形成し続けている。