Llama 3.2は、Meta AIによって開発され、2024年9月25日にリリースされた大規模言語モデルのファミリーである。このファミリーには、デバイス上でのアプリケーション向けに設計された高密度モデル(1Bおよび3Bパラメータ)と、テキストおよび画像入力をサポートするマルチモーダル機能を備えたより大規模なモデル(11Bおよび90Bパラメータ)の両方が含まれる。これらのモデルは、研究および商業利用の両方に対して寛容なライセンスの下で利用可能であり、小型のバリアントはスマートフォンやラップトップなどのエッジデバイス向けに最適化されている。
Llama 3.2のリリースは、以前のLlama 3.1モデルに続くLlamaシリーズの大幅な拡張を示すものであった。11Bおよび90Bのバリアントには視覚理解が統合されており、テキストに加えて画像を処理することが可能で、これは以前のLlamaバージョンにはない特徴である。特に1Bおよび3Bモデルは、コンシューマーハードウェア上で効率的に実行されるように設計されており、3Bモデルは特定のベンチマークにおいてより大規模なモデルに匹敵するパフォーマンスを達成している。
アーキテクチャとトレーニング
Llama 3.2モデルはTransformer (architecture)アーキテクチャに基づいて構築されており、推論効率を向上させるためにグループ化クエリ注意(GQA)を利用したデコーダーのみの設計を採用している。視覚言語モデル(11Bおよび90B)には、画像をトークンに処理する視覚エンコーダーが組み込まれており、これらのトークンはテキスト埋め込みと融合される。トレーニングにはテキストのみおよびマルチモーダルデータの組み合わせが含まれ、高品質な命令チューニングとRLHFや教師あり微調整などのアライメント技術に重点が置かれている。
小型モデル(1Bおよび3B)は128,000トークンのコンテキスト長でトレーニングされ、大型モデルはテキスト用に最大128,000トークン、画像入力用に個別の視覚タワーをサポートする。モデルは128,000トークンの語彙サイズを使用し、安定性のために層正規化とDropoutを採用している。
パフォーマンスとベンチマーク
Llama 3.2モデルは、MMLU、GSM8K、HumanEvalを含むさまざまな公開ベンチマークで評価されている。90Bモデルは、一般的な知識、推論、コーディングなどのタスクにおいて、OpenAIのGPT-4やAnthropicのClaude 3.5 Sonnetなどの主要モデルに対して競争力のある結果を達成している。3Bモデルは、その小型サイズにもかかわらず、命令追従および要約タスクにおいて多くの大規模モデルを上回り、デバイス上のアプリケーションに適している。
内部評価では、90BモデルはMMLUで86.0、GSM8Kで94.1、HumanEvalで89.1をスコアし、11BモデルはMMLUで83.0、GSM8Kで88.4、HumanEvalで84.9を達成した。これらの結果はアーキテクチャの効率性を強調しており、90Bモデルは一部のタスクでmixture-of-experts(MoE)設計を使用しているが、標準の高密度バージョンも利用可能である。
展開とエコシステム
Llama 3.2モデルは、AWS、Microsoft Azure、Google Cloud、Oracle Cloudなどの主要なクラウドプラットフォームに統合されている。また、Groq、SambaNova、Intelなどのハードウェアプロバイダーによってもサポートされており、低遅延の推論を可能にしている。小型モデルはエッジ展開向けに最適化されており、メモリフットプリントを削減するための量子化およびプルーニング技術をサポートしている。
Meta AIはQualcommおよびSamsungと提携して、スマートフォンでのデバイス上のAI機能を可能にしており、要約やテキスト生成などのタスクに1Bおよび3Bモデルを活用している。モデルはHugging Faceハブを通じて利用可能であり、PyTorchやTensorFlowなどの標準的なフレームワークを使用して微調整できる。
評価と影響
Llama 3.2はGenerative AIコミュニティで広く採用されており、多くの開発者がプロトタイピングやエッジアプリケーションに小型モデルを使用している。90B視覚モデルのリリースは、ドキュメント理解や視覚的質問応答などの複雑なマルチモーダルタスクを処理する能力で注目されている。しかし、一部の批評家は、他の大規模言語モデルと同様に、事実の正確性やバイアスに関して課題が残っていると指摘している。
Llama 3.2のオープンウェイトアプローチは、高度なAIへのアクセスを民主化したとして賞賛されているが、悪用の可能性についての懸念も引き起こしている。Metaはリスクを軽減するために、レッドチーミングやコンテンツフィルタリングを含む安全対策を実施している。
将来の方向性
Metaは、Llama 3.2が継続的な開発サイクルの一部であり、推論、多言語サポート、効率性のさらなる改善を計画していることを示している。同社はまた、Stanford AI LabやBerkeley AI Researchなどの学術機関からのニューラルネットワーク研究との統合も模索している。2025年現在、モデルはオープンウェイトAIのベンチマークであり続け、他の組織からのその後のリリースに影響を与えている。