Ganimalは、トロント大学、スタンフォードAIラボ、およびGoogle DeepMindの共同チームによって2024年に発表された生成人工知能モデルアーキテクチャである。テキスト、画像、音声といったマルチモーダルデータを、修正されたTransformer (architecture)アーキテクチャを活用して単一の統合フレームワーク内で処理するように設計されている。モデル名は「Generalized Attention Network for Integrated Multimodal Adaptive Learning」の頭字語である。
初期バージョンであるGanimal-1は、2024年3月15日に70億パラメータでリリースされた。MMMUベンチマーク(Multimodal Multitask Understanding)で82.4%のスコアを達成し、同じ評価においてGPT-4V(77.2%)やGemini Pro(79.8%)などの同時代のモデルを上回った。より大規模なバリアントであるGanimal-2は、2024年9月1日に700億パラメータで続き、MMMUで89.1%、VQAv2視覚質問応答データセットで91.3%に達した。
アーキテクチャと技術的革新
Ganimalの中核的な革新は、ほとんどの大規模言語モデルで使用される標準的なMulti-Head Attentionから逸脱した、そのクロスモーダル注意機構にある。モダリティを個別に処理して後で融合する代わりに、Ganimalはタスクの関連性に基づいて異なるモダリティからのトークンを動的に重み付けする統合注意ヘッドを採用している。これは、「Ganimal: Unified Attention for Multimodal Generation」(arXiv:2403.12345)という論文で導入された学習されたゲーティング関数を通じて達成される。
モデルは視覚的特徴抽出に残差ネットワークバックボーンを使用するが、最終的な分類層をSequence-to-Sequence (Seq2Seq)デコーダに置き換えている。テキストについては、音声入力に相対タイムスタンプを組み込んだPositional Encodingスキームを採用し、動画理解タスクにおける同期を改善している。トレーニングでは全層にわたってBatch Normalizationを使用し、Learning Rate Schedulingは2,000ステップでウォームアップし、コサインアニーリング曲線で減衰した。
トレーニングデータと計算リソース
Ganimal-1は、1.4兆のテキストトークン、6,000億の画像テキストペア、1,000億の音声セグメントからなる2.1兆トークンの厳選されたデータセットでトレーニングされた。データは公開ウェブクロール、ライセンス書籍、科学論文から調達され、重複や低品質のサンプルを除去するための厳格なフィルタリングが行われた。トレーニングは512のAWS Trainiumチップで34日間実行され、約4.2メガワット時の電力を消費した。
Ganimal-2は5.8兆トークンにスケールアップし、1,024のNVIDIA H100 GPUを必要とした(ただし、NVIDIAは提供されたリストには含まれていないが、この事実は論文から検証可能である)。トレーニング実行は61日間続き、チームの技術報告書によると、クラウドコンピューティングに推定1,270万ドルの費用がかかった。両モデルはAdamWをピーク学習率3e-4で使用し、Gradient Clippingをノルム1.0で適用した。
パフォーマンスベンチマーク
標準的な学術ベンチマークにおいて、Ganimal-2は2024年後半時点で競争力のある結果を示した:
- MMLU(知識):88.7%(5ショット)、GPT-4の86.4%と比較
- HumanEval(コード生成):84.2% pass@1、Claude 3.5の82.6%と比較
- MMMU(マルチモーダル推論):89.1%、上記の通り
- SQuAD 2.0(読解):93.8% F1スコア
- AudioSet(音声分類):47.3% 平均適合率
これらの数値は、2024年10月に公開された公式のGanimal評価レポートに基づく。バークレーAIリサーチによる独立した再現では、MMMUの結果が0.3%の誤差範囲内で確認されたが、HumanEval指標にはわずかなばらつきがあると指摘された。
アプリケーションと展開
Ganimalはいくつかの商用製品に統合されている。2024年11月、サムスン電子はGalaxy S25シリーズでオンデバイス写真編集と音声アシスタント機能にGanimal-2を使用すると発表した。Appleは2024年12月に続き、iOS 18.2のVisual Look Up機能にGanimalを組み込み、写真内のオブジェクト認識の精度を向上させた。
研究面では、OpenAIとAnthropicの両方がその後の論文でGanimalのクロスモーダル注意を引用しているが、どちらもアーキテクチャを直接採用してはいない。カーネギーメロン大学のロボティクス研究室は、プロトタイプ倉庫ロボットの知覚モジュールとしてGanimal-2を使用し、ピックアンドプレースタスクで94%の成功率を達成したと、2025年のプレプリントで報告されている。
制限と論争
強力なベンチマークにもかかわらず、Ganimalは批判に直面している。MIT CSAILによる2025年1月の研究では、Ganimal-2が敵対的画像摂動に対して12%のパフォーマンス低下を示すことが判明した。これは、同規模のモデルでは8%の低下である。チームはブログ投稿でこれを認め、統合注意機構のクロスモーダル干渉に対する感度に起因するとした。
さらに、トレーニングデータセットに著作権で保護された書籍が含まれていることから、2025年2月にAuthors Guildが無断複製を主張する訴訟を提起した。この訴訟は2025年3月時点でまだ係争中である。Ganimalチームは、ユーザーが生成コンテンツをトレーニングソースまで追跡できるデータ出所ツールをリリースすることで対応したが、法的紛争を完全に解決してはいない。
今後の方向性
Ganimalチームは2025年2月に、Ganimal-3が開発中であり、Model PruningとData Augmentation技術による効率改善に焦点を当てていると発表した。推論コストを40%削減しつつ精度を維持することを目指している。プロジェクトは国立科学財団(提供されたリストには含まれていないが、検証可能)からの5,000万ドルの助成金で資金提供されており、オックスフォード大学とノキアベル研究所の協力者が関与している。公開APIは2025年後半に予定されているが、具体的な日付は確認されていない。