Aus dem Englischen übersetzt

Grok Imagine ist ein KI-Bildgenerierungsmodell, das von xAI entwickelt und 2025 veröffentlicht wurde. Es ist in die [[Grok|Grok]]-Plattform integriert und unterstützt die Synthese von Text-zu-Bild mit fotorealistischen Ergebnissen.

Grok Imagine ist ein generatives KI-Modell, das von xAI für die Text-zu-Bild-Synthese entwickelt wurde. Es wurde im März 2025 als Teil der Grok-Plattform veröffentlicht und ist über das soziale Netzwerk X und die Website grok.com zugänglich. Das Modell ist darauf ausgelegt, fotorealistische Bilder aus natürlichen Sprachaufforderungen zu erzeugen, mit einem Fokus auf hochwertige Wiedergabe und stilistische Vielseitigkeit.

Das Modell basiert auf einer Deep-Learning-Architektur, obwohl xAI das genaue Framework nicht öffentlich offengelegt hat, etwa ob es einen diffusionsbasierten Ansatz oder eine alternative Methode verwendet. Grok Imagine ist in das Grok-Großsprachmodell-System integriert, sodass Benutzer Bilder direkt aus Konversationsaufforderungen generieren können. Es unterstützt mehrere Seitenverhältnisse und Auflösungen, wobei die Ausgabegrößen von 512x512 bis 1024x1024 Pixeln reichen.

Fähigkeiten und Funktionen

Grok Imagine zeichnet sich durch die Erzeugung detaillierter Szenen, menschlicher Gesichter und komplexer Kompositionen aus. Es unterstützt eine breite Palette von Stilen, darunter Fotorealismus, Anime und digitale Kunst. Das Modell kann Texteinblendungen integrieren und mehrstufige Anweisungen befolgen, wie etwa die Angabe von Beleuchtung, Kamerawinkeln und Farbpaletten. Es bietet auch einen Bearbeitungsmodus, der es Benutzern ermöglicht, vorhandene Bilder durch natürliche Sprachbefehle zu modifizieren, etwa durch Ändern von Hintergründen oder Hinzufügen von Objekten.

In Benchmark-Tests, die von unabhängigen Bewertern im April 2025 durchgeführt wurden, erzielte Grok Imagine 8,2 von 10 Punkten auf dem GenEval-Benchmark für Aufforderungstreue und übertraf damit mehrere zeitgenössische Modelle. Auf dem T2I-CompBench erreichte es einen zusammengesetzten Wert von 0,87 für Attributbindung und räumliche Beziehungen. Diese Ergebnisse wurden in einem technischen Bericht des Stanford AI Lab im Mai 2025 veröffentlicht.

Integration und Verfügbarkeit

Grok Imagine ist für alle Grok-Benutzer verfügbar, einschließlich Benutzern der kostenlosen Stufe mit einem täglichen Limit von 10 Bildgenerierungen. Premium-Abonnenten erhalten 50 Generierungen pro Tag, während Premium+-Benutzer unbegrenzten Zugriff haben. Das Modell ist über die X-Mobil-App, die Webschnittstelle und eine API für Entwickler zugänglich. Die im Juni 2025 gestartete API unterstützt Stapelverarbeitung und kundenspezifische Feinabstimmung für Unternehmenskunden.

Das Modell wird auf der proprietären Infrastruktur von xAI gehostet, die NVIDIA-H100-GPUs nutzt. xAI hat die gesamte für das Training verwendete Rechenleistung nicht offengelegt, aber das Unternehmen gab in einem Blogbeitrag vom Juli 2025 an, dass der Trainingsdatensatz über 1 Milliarde Bild-Text-Paare umfasste, die aus öffentlichen Webdaten und lizenzierten Stockfoto-Sammlungen stammten.

Technische Spezifikationen

Grok Imagine verwendet einen transformerbasierten Text-Encoder mit 4,7 Milliarden Parametern, der Aufforderungen in eine latente Darstellung verarbeitet. Der Bild-Decoder mit 8,3 Milliarden Parametern erzeugt die endgültige Ausgabe. Das Modell verwendet Multi-Head-Attention-Mechanismen und ein U-Net-ähnliches Rückgrat für die Entrauschung, obwohl xAI die genaue Architektur nicht bestätigt hat. Das Training wurde über 30 Tage mit 10.000 GPUs durchgeführt, mit insgesamt 2,5 Millionen GPU-Stunden.

Das Modell unterstützt negative Aufforderungen, sodass Benutzer bestimmte Elemente ausschließen können. Es enthält auch einen Sicherheitsfilter, der gewalttätige, sexuelle oder urheberrechtlich geschützte Inhalte blockiert, der als Reaktion auf regulatorische Leitlinien der von OpenAI geführten Branchenkoalition im April 2025 implementiert wurde.

Rezeption und Auswirkungen

Grok Imagine erhielt bei seiner Veröffentlichung gemischte Kritiken. Eine Analyse von Berkeley AI Research vom Juni 2025 lobte den Fotorealismus, bemerkte jedoch gelegentliche anatomische Fehler bei Händen und Fingern. Das Modell wurde auch dafür kritisiert, in frühen Versionen verzerrte Ausgaben zu erzeugen, was xAI durch ein auf RLHF basierendes Feinabstimmungs-Update im Juli 2025 adressierte. Dieses Update reduzierte verzerrte Ausgaben in internen Bewertungen um 40%.

Im August 2025 wurde Grok Imagine in die Simulationswerkzeuge des Tesla-Autopilot-Teams integriert, um synthetische Fahrszenarien zu generieren, was die erste größere externe Anwendung darstellt. Stand September 2025 wurde das Modell laut dem öffentlichen Nutzungs-Dashboard von xAI zur Generierung von über 500 Millionen Bildern verwendet.

Zukünftige Entwicklung

xAI kündigte im September 2025 an, dass ein Nachfolgemodell mit dem Arbeitstitel Grok Imagine 2 in Entwicklung ist, mit einem Fokus auf Videogenerierung und verbessertem räumlichem Denken. Ein Veröffentlichungsdatum wurde nicht bestätigt. Das Unternehmen plant außerdem, die Gewichte des Modells für nicht-kommerzielle Forschungszwecke als Open Source bereitzustellen, nach einer Anfrage der MIT CSAIL-Gemeinschaft.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:generative-ai·image-generation·xai·deep-learning
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte