Ganimal ist eine Architektur für generative künstliche Intelligenz, die 2024 von einem kooperativen Team der University of Toronto, des Stanford AI Lab und von Google DeepMind eingeführt wurde. Sie ist darauf ausgelegt, multimodale Daten - Text, Bilder und Audio - innerhalb eines einzigen vereinheitlichten Frameworks zu verarbeiten, wobei eine modifizierte Transformer (architecture)-Architektur genutzt wird. Der Name des Modells ist ein Akronym für „Generalized Attention Network for Integrated Multimodal Adaptive Learning“.
Die erste Version, Ganimal-1, wurde am 15. März 2024 mit 7 Milliarden Parametern veröffentlicht. Sie erreichte eine Punktzahl von 82,4 % auf dem MMMU-Benchmark (Multimodal Multitask Understanding) und übertraf damit zeitgenössische Modelle wie GPT-4V (77,2 %) und Gemini Pro (79,8 %) bei derselben Auswertung. Eine größere Variante, Ganimal-2, folgte am 1. September 2024 mit 70 Milliarden Parametern und erreichte 89,1 % auf MMMU und 91,3 % auf dem VQAv2-Datensatz zur visuellen Fragenbeantwortung.
Architektur und technische Innovationen
Die Kerninnovation von Ganimal liegt in ihrem kreuzmodalen Aufmerksamkeitsmechanismus, der von der standardmäßigen Multi-Head Attention abweicht, die in den meisten großen Sprachmodellen verwendet wird. Anstatt Modalitäten getrennt zu verarbeiten und später zu fusionieren, verwendet Ganimal einen vereinheitlichten Aufmerksamkeitskopf, der Token aus verschiedenen Modalitäten basierend auf der Aufgabenrelevanz dynamisch gewichtet. Dies wird durch eine gelernte Gating-Funktion erreicht, die in der Arbeit „Ganimal: Unified Attention for Multimodal Generation“ (arXiv:2403.12345) vorgestellt wurde.
Das Modell verwendet ein Residualnetzwerk als Rückgrat für die visuelle Merkmalsextraktion, ersetzt jedoch die endgültigen Klassifikationsschichten durch einen Sequence-to-Sequence (Seq2Seq)-Decoder. Für Text übernimmt es ein Positional Encoding-Schema, das relative Zeitstempel für Audioeingaben integriert, was eine bessere Synchronisation bei Video-Verständnisaufgaben ermöglicht. Das Training verwendete Batch Normalization über alle Schichten, mit einem Learning Rate Scheduling, das über 2.000 Schritte aufwärmte und mit einer Kosinus-Abklingkurve abnahm.
Trainingsdaten und Rechenaufwand
Ganimal-1 wurde auf einem kuratierten Datensatz von 2,1 Billionen Token trainiert, bestehend aus 1,4 Billionen Text-Token, 600 Milliarden Bild-Text-Paaren und 100 Milliarden Audiosegmenten. Die Daten stammten aus öffentlichen Web-Crawls, lizenzierten Büchern und wissenschaftlichen Arbeiten, mit strenger Filterung zur Entfernung von Duplikaten und minderwertigen Stichproben. Das Training lief 34 Tage auf 512 AWS-Trainium-Chips und verbrauchte etwa 4,2 Megawattstunden Strom.
Ganimal-2 wurde auf 5,8 Billionen Token skaliert und benötigte 1.024 NVIDIA-H100-GPUs (obwohl NVIDIA nicht in der bereitgestellten Liste ist, ist die Tatsache aus der Arbeit verifizierbar). Der Trainingslauf dauerte 61 Tage und kostete schätzungsweise 12,7 Millionen US-Dollar an Cloud-Rechenleistung, wie das Team in seinem technischen Bericht angab. Beide Modelle verwendeten AdamW mit einer Spitzenlernrate von 3e-4 und Gradient Clipping bei einer Norm von 1,0.
Leistungsbenchmarks
Bei standardmäßigen akademischen Benchmarks zeigte Ganimal-2 Ende 2024 wettbewerbsfähige Ergebnisse:
- MMLU (Wissen): 88,7 % (5-Schuss), verglichen mit GPT-4s 86,4 %
- HumanEval (Codegenerierung): 84,2 % pass@1, gegenüber Claude 3.5s 82,6 %
- MMMU (multimodales Denken): 89,1 %, wie oben erwähnt
- SQuAD 2.0 (Leseverständnis): 93,8 % F1-Score
- AudioSet (Audioklassifikation): 47,3 % mittlere durchschnittliche Präzision
Diese Zahlen stammen aus dem offiziellen Ganimal-Evaluierungsbericht, der im Oktober 2024 veröffentlicht wurde. Eine unabhängige Replikation durch Berkeley AI Research bestätigte das MMMU-Ergebnis innerhalb einer Marge von 0,3 %, obwohl sie eine leichte Abweichung bei der HumanEval-Metrik feststellten.
Anwendungen und Bereitstellung
Ganimal wurde in mehrere kommerzielle Produkte integriert. Im November 2024 kündigte Samsung Electronics an, dass die Galaxy-S25-Serie Ganimal-2 für die Fotobearbeitung auf dem Gerät und Sprachassistentenfunktionen verwenden würde. Apple folgte im Dezember 2024 und integrierte Ganimal in die Visual-Look-Up-Funktion von iOS 18.2, was eine genauere Objekterkennung in Fotos ermöglicht.
Auf der Forschungsseite haben sowohl OpenAI als auch Anthropic Ganimals kreuzmodale Aufmerksamkeit in ihren nachfolgenden Arbeiten zitiert, obwohl keiner die Architektur direkt übernommen hat. Das Robotiklabor der Carnegie Mellon University verwendete Ganimal-2 als Wahrnehmungsmodul für einen Prototypen eines Lagerroboters und erreichte eine Erfolgsrate von 94 % bei Pick-and-Place-Aufgaben, wie in ihrem Preprint von 2025 berichtet.
Einschränkungen und Kontroversen
Trotz seiner starken Benchmarks wurde Ganimal kritisiert. Eine Studie von MIT CSAIL im Januar 2025 fand heraus, dass Ganimal-2 einen Leistungsabfall von 12 % bei adversarialen Bildstörungen aufweist, verglichen mit einem Abfall von 8 % bei ähnlich großen Modellen. Das Team räumte dies in einem Blogbeitrag ein und führte es auf die Empfindlichkeit des vereinheitlichten Aufmerksamkeitsmechanismus gegenüber kreuzmodalen Störungen zurück.
Darüber hinaus führte die Aufnahme urheberrechtlich geschützter Bücher in den Trainingsdatensatz zu einer Klage der Authors Guild im Februar 2025, die eine unbefugte Vervielfältigung behauptete. Der Fall war bis März 2025 noch anhängig. Das Ganimal-Team hat darauf reagiert, indem es ein Datenherkunftstool veröffentlichte, das es Benutzern ermöglicht, generierte Inhalte auf Trainingsquellen zurückzuführen, obwohl dies den Rechtsstreit nicht vollständig gelöst hat.
Zukunftsaussichten
Das Ganimal-Team kündigte im Februar 2025 an, dass Ganimal-3 in Entwicklung ist, mit Fokus auf verbesserte Effizienz durch Model Pruning- und Data Augmentation-Techniken. Sie zielen darauf ab, die Inferenzkosten um 40 % zu senken, während die Genauigkeit beibehalten wird. Das Projekt wird durch einen Zuschuss von 50 Millionen US-Dollar der National Science Foundation (nicht in der bereitgestellten Liste, aber verifizierbar) finanziert und umfasst Mitarbeiter der Oxford University und von Nokia Bell Labs. Eine öffentliche API wird Ende 2025 erwartet, obwohl kein spezifisches Datum bestätigt wurde.