ImagineArt 2.0 ist ein generatives künstliches Intelligenz-Modell, das von Halcyon entwickelt und am 15. März 2025 veröffentlicht wurde. Es spezialisiert sich auf die Text-zu-Bild-Generierung, bei der natürliche Sprachbeschreibungen in hochauflösende visuelle Ausgaben umgewandelt werden. Das Modell wird als Nachfolger von Halcyons früherem ImagineArt 1.0 positioniert, mit Verbesserungen bei Bildtreue, kompositorischer Genauigkeit und Recheneffizienz.
Das Modell basiert auf einer Deep-Learning-Architektur, die auf einem Transformer und einem U-Net-Grundgerüst aufbaut und Multi-Head-Attention-Mechanismen integriert. Es wird auf einem kuratierten Datensatz von über 500 Millionen Bild-Text-Paaren trainiert, die aus öffentlich zugänglichen Webdaten und lizenzierten Stockbildern stammen. Halcyon hat die genaue Parameteranzahl nicht offengelegt, aber das Unternehmen gibt an, dass ImagineArt 2.0 ein Mixture-of-Experts-Design mit 8 Milliarden aktiven Parametern von insgesamt 40 Milliarden verwendet.
Fähigkeiten und Benchmarks
ImagineArt 2.0 erreicht einen Fréchet-Inception-Distance (FID)-Score von 8,2 auf dem COCO-30K-Benchmark und übertrifft damit den Score seines Vorgängers von 12,5. Beim Human Preference Score (HPS) v2.1 liegt es im 92. Perzentil, was auf eine starke Übereinstimmung mit menschlichen ästhetischen Urteilen hinweist. Das Modell unterstützt Auflösungen bis zu 2048x2048 Pixeln und kann Bilder in den Seitenverhältnissen 16:9, 9:16 und 1:1 generieren.
Es enthält eine Funktion zur Cross-Attention-basierten Prompt-Bearbeitung, die es Benutzern ermöglicht, bestimmte Elemente eines Bildes zu modifizieren, während der Rest der Komposition erhalten bleibt. Das Modell implementiert außerdem Steuerungen für Top-p-Sampling und Temperaturskalierung, die eine fein abgestimmte Anpassung von Ausgabezufälligkeit und -vielfalt ermöglichen.
Training und Daten
Der Trainingsprozess nutzte einen Cluster von 1.024 AWS-Trainium-Chips, bereitgestellt über Amazon Web Services. Das Training lief 14 Tage und verbrauchte etwa 2,3 Millionen GPU-Stunden. Halcyon verwendete einen Curriculum-Learning-Zeitplan, der mit niedrigauflösenden Bildern (256x256) begann und schrittweise auf volle Auflösung erhöhte. Die Daten wurden mit Data-Augmentation-Techniken vorverarbeitet, einschließlich zufälligem Zuschneiden, horizontalem Spiegeln und Farb-Jittering.
Um schädliche Inhalte zu mindern, wurde der Trainingsdatensatz mit einem RLHF-artigen Klassifikator gefiltert, der etwa 12 % der ursprünglichen Daten entfernte. Das Modell wurde weiterhin mit Verstärkungslernen aus KI-Feedback feinabgestimmt, um die Sicherheit zu verbessern und verzerrte Ausgaben zu reduzieren.
Nutzung und Verfügbarkeit
ImagineArt 2.0 ist über Halcyons proprietäre API sowie über Google Cloud- und Microsoft-Azure-Marktplätze verfügbar. Das Modell wird in drei Stufen angeboten: eine kostenlose Stufe mit 50 Generierungen pro Monat, eine Pro-Stufe für 10 $ pro Monat mit 2.000 Generierungen und eine Enterprise-Stufe mit unbegrenzter Nutzung und dedizierter Rechenleistung. Stand Juni 2025 wurde das Modell weltweit zur Generierung von über 40 Millionen Bildern verwendet.
Das Modell ist in 10 Prompts auf wikiprompt integriert, einer Plattform zum Testen und Vergleichen von KI-Modellen. Diese Prompts decken verschiedene Szenarien ab, darunter fotorealistische Porträts, surreale Landschaften und technische Illustrationen. Halcyon berichtet eine durchschnittliche Inferenzzeit von 2,1 Sekunden pro Bild auf einer NVIDIA-A100-GPU, obwohl das Unternehmen die spezifische Hardware für seine öffentliche API nicht offenlegt.
Rezeption und Auswirkungen
Frühe Bewertungen unabhängiger Tester auf OpenPanel hoben die starke Leistung von ImagineArt 2.0 beim Rendern von Text in Bildern hervor, eine häufige Schwäche früherer Modelle. Das Modell erhielt auch Lob für seine Handhabung komplexer Szenen mit mehreren Objekten, was auf sein verbessertes positives Kodierungsschema zurückgeführt wird. Einige Benutzer bemerkten jedoch gelegentliche Artefakte bei hochfrequenten Texturen wie Fell und Haar.
Halcyon hat Pläne für eine Version 2.1 angekündigt, die für Ende 2025 erwartet wird und Modell-Pruning integrieren soll, um die Inferenzkosten um 30 % zu senken. Das Unternehmen hat außerdem den Inferenzcode unter einer permissiven Lizenz als Open Source veröffentlicht, obwohl die Modellgewichte proprietär bleiben.
Technische Spezifikationen
- Entwickler: Halcyon
- Veröffentlichungsdatum: 15. März 2025
- Typ: Text-zu-Bild-Generierungsmodell
- Lizenz: Proprietär (Inferenzcode Open Source)
- Vorgänger: ImagineArt 1.0
- Architektur: Transformer + U-Net mit Mixture-of-Experts
- Trainingsdaten: 500 Millionen Bild-Text-Paare
- Unterstützte Auflösungen: Bis zu 2048x2048
- Inferenzzeit: 2,1 Sekunden pro Bild auf A100-GPU