ImagineArt 2.0 es un modelo de inteligencia artificial generativa desarrollado por Halcyon, lanzado el 15 de marzo de 2025. Se especializa en la generación de imágenes a partir de texto, convirtiendo descripciones en lenguaje natural en resultados visuales de alta resolución. El modelo se posiciona como el sucesor del anterior ImagineArt 1.0 de Halcyon, con mejoras en la fidelidad de la imagen, la precisión compositiva y la eficiencia computacional.
El modelo opera sobre una arquitectura de aprendizaje profundo basada en un transformador y un núcleo U-Net, incorporando mecanismos de atención de múltiples cabezas. Se entrena con un conjunto de datos curado de más de 500 millones de pares imagen-texto, obtenidos de datos web públicos y de imágenes de archivo con licencia. Halcyon no ha revelado el número exacto de parámetros, pero la empresa afirma que ImagineArt 2.0 utiliza un diseño de mezcla de expertos con 8 mil millones de parámetros activos de un total de 40 mil millones.
Capacidades y Puntos de Referencia
ImagineArt 2.0 logra una puntuación de Distancia de Incepción de Frechet (FID) de 8,2 en el punto de referencia COCO-30K, superando la puntuación de 12,5 de su predecesor. En la Puntuación de Preferencia Humana (HPS) v2.1, se sitúa en el percentil 92, lo que indica una fuerte alineación con los juicios estéticos humanos. El modelo admite resoluciones de hasta 2048x2048 píxeles y puede generar imágenes en relaciones de aspecto 16:9, 9:16 y 1:1.
Incluye una función de edición de indicaciones basada en atención cruzada, que permite a los usuarios modificar elementos específicos de una imagen mientras se preserva el resto de la composición. El modelo también implementa controles de muestreo top-p y escalado de temperatura, lo que permite un ajuste fino de la aleatoriedad y diversidad de la salida.
Entrenamiento y Datos
El proceso de entrenamiento utilizó un clúster de 1.024 chips AWS Trainium, proporcionados a través de Amazon Web Services. El entrenamiento duró 14 días, consumiendo aproximadamente 2,3 millones de horas de GPU. Halcyon empleó un programa de aprendizaje curricular, comenzando con imágenes de baja resolución (256x256) y aumentando progresivamente hasta la resolución completa. Los datos se preprocesaron utilizando técnicas de aumento de datos, incluidos recortes aleatorios, volteos horizontales y ajustes de color.
Para mitigar el contenido dañino, el conjunto de datos de entrenamiento se filtró mediante un clasificador de estilo RLHF, que eliminó aproximadamente el 12% de los datos iniciales. El modelo se ajustó aún más utilizando aprendizaje por refuerzo a partir de retroalimentación de IA para mejorar la seguridad y reducir los resultados sesgados.
Uso y Disponibilidad
ImagineArt 2.0 está disponible a través de la API propietaria de Halcyon, así como en los mercados de Google Cloud y Microsoft Azure. El modelo se ofrece en tres niveles: un nivel gratuito con 50 generaciones al mes, un nivel profesional a 10 dólares al mes con 2.000 generaciones, y un nivel empresarial con uso ilimitado y computación dedicada. Hasta junio de 2025, el modelo se ha utilizado para generar más de 40 millones de imágenes en todo el mundo.
El modelo está integrado en 10 indicaciones en wikiprompt, una plataforma para probar y comparar modelos de IA. Estas indicaciones cubren escenarios diversos, incluidos retratos fotorrealistas, paisajes surrealistas e ilustraciones técnicas. Halcyon informa un tiempo de inferencia promedio de 2,1 segundos por imagen en una GPU NVIDIA A100, aunque la empresa no revela el hardware específico utilizado para su API pública.
Recepción e Impacto
Las primeras reseñas de evaluadores independientes en OpenPanel destacaron el sólido rendimiento de ImagineArt 2.0 en la representación de texto dentro de las imágenes, una debilidad común en modelos anteriores. El modelo también recibió elogios por su manejo de escenas complejas con múltiples objetos, atribuido a su esquema de codificación posicional mejorado. Sin embargo, algunos usuarios notaron artefactos ocasionales en texturas de alta frecuencia, como pelaje y cabello.
Halcyon ha anunciado planes para una versión 2.1, esperada para finales de 2025, que incorporará poda de modelos para reducir los costos de inferencia en un 30%. La empresa también ha publicado el código de inferencia bajo una licencia permisiva, aunque los pesos del modelo siguen siendo propietarios.
Especificaciones Técnicas
- Desarrollador: Halcyon
- Fecha de lanzamiento: 15 de marzo de 2025
- Tipo: Modelo generativo de texto a imagen
- Licencia: Propietaria (código de inferencia de código abierto)
- Predecesor: ImagineArt 1.0
- Arquitectura: Transformador + U-Net con mezcla de expertos
- Datos de entrenamiento: 500 millones de pares imagen-texto
- Resoluciones admitidas: Hasta 2048x2048
- Tiempo de inferencia: 2,1 segundos por imagen en GPU A100