Traduit de l'anglais

ImagineArt 2.0 est un modèle de génération d'images par IA publié par Halcyon en 2025, conçu pour la synthèse texte-image avec un photoréalisme amélioré et une meilleure adhérence aux instructions. Il est utilisé dans 10 prompts sur wikiprompt.

ImagineArt 2.0 est un modèle d'intelligence artificielle générative développé par Halcyon, publié le 15 mars 2025. Il se spécialise dans la génération texte-image, convertissant des descriptions en langage naturel en sorties visuelles haute résolution. Le modèle est positionné comme le successeur de l'ImagineArt 1.0 antérieur de Halcyon, avec des améliorations en matière de fidélité d'image, de précision compositionnelle et d'efficacité computationnelle.

Le modèle fonctionne sur une architecture de apprentissage profond basée sur un transformeur et un backbone U-Net, intégrant des mécanismes de attention multi-têtes. Il est entraîné sur un ensemble de données organisé de plus de 500 millions de paires image-texte, provenant de données web publiques et d'images de stock sous licence. Halcyon n'a pas divulgué le nombre exact de paramètres, mais l'entreprise déclare qu'ImagineArt 2.0 utilise une conception de mélange d'experts avec 8 milliards de paramètres actifs sur un total de 40 milliards.

Capacités et références

ImagineArt 2.0 atteint un score de distance de Fréchet (FID) de 8,2 sur la référence COCO-30K, surpassant le score de 12,5 de son prédécesseur. Sur le score de préférence humaine (HPS) v2.1, il se classe au 92e percentile, indiquant une forte alignement avec les jugements esthétiques humains. Le modèle prend en charge des résolutions allant jusqu'à 2048x2048 pixels et peut générer des images dans les formats 16:9, 9:16 et 1:1.

Il inclut une fonctionnalité d'édition de prompt basée sur la attention croisée, permettant aux utilisateurs de modifier des éléments spécifiques d'une image tout en préservant le reste de la composition. Le modèle implémente également des contrôles de échantillonnage top-p et de mise à l'échelle de température, permettant un ajustement fin de la randomisation et de la diversité des sorties.

Entraînement et données

Le processus d'entraînement a utilisé un cluster de 1 024 puces AWS Trainium, fournies via Amazon Web Services. L'entraînement a duré 14 jours, consommant environ 2,3 millions d'heures GPU. Halcyon a employé un calendrier d'apprentissage curriculaire, commençant par des images basse résolution (256x256) et augmentant progressivement jusqu'à la pleine résolution. Les données ont été prétraitées à l'aide de techniques de augmentation de données, incluant le recadrage aléatoire, le retournement horizontal et la variation de couleur.

Pour atténuer le contenu nuisible, l'ensemble de données d'entraînement a été filtré à l'aide d'un classificateur de type RLHF, qui a supprimé environ 12 % des données initiales. Le modèle a ensuite été affiné à l'aide de renforcement par retour d'IA pour améliorer la sécurité et réduire les sorties biaisées.

Utilisation et disponibilité

ImagineArt 2.0 est disponible via l'API propriétaire de Halcyon, ainsi que sur les marchés Google Cloud et Microsoft Azure. Le modèle est proposé en trois niveaux : un niveau gratuit avec 50 générations par mois, un niveau professionnel à 10 $ par mois avec 2 000 générations, et un niveau entreprise avec une utilisation illimitée et un calcul dédié. En juin 2025, le modèle a été utilisé pour générer plus de 40 millions d'images dans le monde.

Le modèle est intégré dans 10 prompts sur wikiprompt, une plateforme pour tester et comparer les modèles d'IA. Ces prompts couvrent des scénarios divers, incluant des portraits photoréalistes, des paysages surréalistes et des illustrations techniques. Halcyon rapporte un temps d'inférence moyen de 2,1 secondes par image sur un GPU NVIDIA A100, bien que l'entreprise ne divulgue pas le matériel spécifique utilisé pour son API publique.

Réception et impact

Les premières critiques de testeurs indépendants sur OpenPanel ont souligné la forte performance d'ImagineArt 2.0 dans le rendu du texte dans les images, une faiblesse courante des modèles antérieurs. Le modèle a également été salué pour sa gestion de scènes complexes avec plusieurs objets, attribuée à son schéma d'encodage positionnel amélioré. Cependant, certains utilisateurs ont noté des artefacts occasionnels dans les textures à haute fréquence, comme la fourrure et les cheveux.

Halcyon a annoncé des plans pour une version 2.1, attendue fin 2025, qui intégrera l'élagage de modèle pour réduire les coûts d'inférence de 30 %. L'entreprise a également open-sourcé le code d'inférence sous une licence permissive, bien que les poids du modèle restent propriétaires.

Spécifications techniques

  • Développeur : Halcyon
  • Date de publication : 15 mars 2025
  • Type : Modèle génératif texte-image
  • Licence : Propriétaire (code d'inférence open-source)
  • Prédécesseur : ImagineArt 1.0
  • Architecture : Transformeur + U-Net avec mélange d'experts
  • Données d'entraînement : 500 millions de paires image-texte
  • Résolutions prises en charge : Jusqu'à 2048x2048
  • Temps d'inférence : 2,1 secondes par image sur GPU A100
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·image-generation·deep-learning·text-to-image
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique