Llama 3.1 Nemotronは、NVIDIAによって開発された大規模言語モデルのファミリーであり、MetaのLlama 3.1のアーキテクチャに基づいて構築されている。これらのモデルは、推論能力、指示追従、および人間の好みとの整合性を高めるように設計されている。オープンウェイトモデルとして公開されており、研究者や開発者は様々なアプリケーションにファインチューニングして展開することができる。このファミリーには複数のパラメータサイズが含まれており、公開ベンチマークのスナップショットには3つのバリアントが登場している。
開発とリリース
NVIDIAは、MetaのLlama 3.1モデルが2024年7月にリリースされた後、2024年後半にLlama 3.1 Nemotronファミリーを発表した。初期リリースにはNemotron-70Bバリアントが含まれており、推論ベンチマークでの性能によりすぐに注目を集めた。NVIDIAはこれらのモデルをオープンソースAIエコシステムへの貢献として位置づけ、高度なアライメント技術の使用を強調した。モデルはHugging Faceなどのプラットフォームで公開され、ウェイトは許容的なライセンスの下で研究用と商用の両方でアクセス可能となっている。
アーキテクチャとトレーニング
これらのモデルはトランスフォーマーアーキテクチャ、具体的にはLlama 3.1で使用されているデコーダーのみの設計に基づいている。マルチヘッドアテンションや回転位置エンコーディングなどの技術を組み込んでいる。NVIDIAは、報酬モデルを使用して出力を人間の好みに合わせる、教師ありファインチューニングとAIフィードバックからの強化学習(RLAIF)を含むトレーニングパイプラインを採用した。トレーニングデータは、公開されているコーパスと他の大規模モデルによって生成された合成データの混合で構成されていた。NVIDIAは、正確なデータセット構成やトレーニングに使用された総計算量を開示していない。
性能とベンチマーク
Llama 3.1 Nemotronモデルは、MMLU(Massive Multitask Language Understanding)、GSM8K(小学校レベルの数学)、HumanEval(コード生成)など、標準的なベンチマークの範囲で評価されている。70Bバリアントは、特定の推論タスクにおいて、より大規模なプロプライエタリモデルと同等かそれを上回るスコアを達成したと報告されている。LMArena(旧Chatbot Arena)などの公開リーダーボードでは、モデルは上位層のEloレーティングでリストされているが、具体的な数値はスナップショットによって異なる。ベンチマークスナップショットの3つのバリアントは異なるパラメータサイズに対応しており、おそらく8B、70B、およびより大きな構成であるが、すべてのバリアントの正確な仕様は一様に公開されていない。
アプリケーションとエコシステム
NVIDIAはLlama 3.1 NemotronをNVIDIA AI Enterpriseソフトウェアスタックに統合し、それぞれのマーケットプレイスを通じてAzure、Google Cloud、AWSでの展開を可能にしている。また、これらのモデルは低遅延推論のためにGroqやSambaNovaでもサポートされている。開発者は、コード生成、数学的推論、会話エージェントなどのタスクにモデルを使用している。モデルのオープンウェイトな性質により、ヘルスケアや金融などのドメイン固有のアプリケーション向けのファインチューニングが容易になっている。
受け止められ方と影響
Llama 3.1 Nemotronのリリースは、機械学習コミュニティから関心を持って迎えられた。特に、従来のRLHFに代わる選択肢を提供するRLAIFの使用が注目された。一部の研究者は、これらのモデルが推論ベンチマークで強い性能を示し、オープンモデルとクローズドモデルの間のギャップを縮めたと指摘した。しかし、一部の評価では、タスクによって性能に一貫性がないことも強調され、モデルは普遍的にトップランクではなかった。NVIDIAはNemotronラインの反復を継続し、機能を改善した後続バージョンをリリースしている。
ライセンスと利用可能性
Llama 3.1 Nemotronモデルは、NVIDIAオープンモデルライセンスの下で配布されており、商用利用、変更、再配布が許可されているが、派生作品には同様のライセンス条項を含めることが要求される。ウェイトはHugging Faceからダウンロードでき、モデルは互換性のあるハードウェア上でローカルに実行できる。これにはAMDやIntel GPU、およびNVIDIA GPUが含まれる。ライセンスは研究目的でのモデルの使用を制限しておらず、NVIDIAはファインチューニングと展開のためのドキュメントとサンプルコードを提供している。