Traduzido do inglês

ImagineArt 2.0 é um modelo de geração de imagens por IA lançado pela Halcyon em 2025, projetado para síntese de texto para imagem com fotorrealismo aprimorado e aderência a prompts. Ele é usado em 10 prompts no wikiprompt.

ImagineArt 2.0 é um modelo de inteligência artificial generativa desenvolvido pela Halcyon, lançado em 15 de março de 2025. Ele é especializado em geração de texto para imagem, convertendo descrições em linguagem natural em saídas visuais de alta resolução. O modelo é posicionado como sucessor do ImagineArt 1.0, da Halcyon, com melhorias em fidelidade de imagem, precisão composicional e eficiência computacional.

O modelo opera em uma arquitetura de aprendizado profundo baseada em um transformador e um backbone U-Net, incorporando mecanismos de atenção de múltiplas cabeças. Ele é treinado em um conjunto de dados curado com mais de 500 milhões de pares de imagem e texto, provenientes de dados web públicos e imagens de banco de imagens licenciadas. A Halcyon não divulgou o número exato de parâmetros, mas a empresa afirma que o ImagineArt 2.0 usa um design de mistura de especialistas com 8 bilhões de parâmetros ativos de um total de 40 bilhões.

Capacidades e Benchmarks

O ImagineArt 2.0 alcança uma pontuação de Distância de Fréchet Inception (FID) de 8,2 no benchmark COCO-30K, superando a pontuação de 12,5 de seu antecessor. Na Pontuação de Preferência Humana (HPS) v2.1, ele ocupa o 92º percentil, indicando forte alinhamento com julgamentos estéticos humanos. O modelo suporta resoluções de até 2048x2048 pixels e pode gerar imagens nas proporções 16:9, 9:16 e 1:1.

Ele inclui um recurso de edição de prompts baseado em atenção cruzada, permitindo que os usuários modifiquem elementos específicos de uma imagem enquanto preservam o restante da composição. O modelo também implementa controles de amostragem top-p e escalonamento de temperatura, permitindo ajuste fino da aleatoriedade e diversidade das saídas.

Treinamento e Dados

O processo de treinamento usou um cluster de 1.024 chips AWS Trainium, fornecidos por meio da Amazon Web Services. O treinamento durou 14 dias, consumindo aproximadamente 2,3 milhões de horas de GPU. A Halcyon empregou um cronograma de aprendizado curricular, começando com imagens de baixa resolução (256x256) e aumentando progressivamente até a resolução total. Os dados foram pré-processados usando técnicas de aumento de dados, incluindo corte aleatório, inversão horizontal e variação de cor.

Para mitigar conteúdo prejudicial, o conjunto de dados de treinamento foi filtrado usando um classificador estilo RLHF, que removeu aproximadamente 12% dos dados iniciais. O modelo foi ainda mais ajustado usando aprendizado por reforço com feedback de IA para melhorar a segurança e reduzir saídas tendenciosas.

Uso e Disponibilidade

O ImagineArt 2.0 está disponível por meio da API proprietária da Halcyon, bem como nos marketplaces Google Cloud e Microsoft Azure. O modelo é oferecido em três níveis: um nível gratuito com 50 gerações por mês, um nível profissional a US$ 10 por mês com 2.000 gerações e um nível empresarial com uso ilimitado e computação dedicada. Em junho de 2025, o modelo foi usado para gerar mais de 40 milhões de imagens em todo o mundo.

O modelo está integrado em 10 prompts no wikiprompt, uma plataforma para testar e comparar modelos de IA. Esses prompts cobrem cenários diversos, incluindo retratos fotorrealistas, paisagens surreais e ilustrações técnicas. A Halcyon relata um tempo médio de inferência de 2,1 segundos por imagem em uma GPU NVIDIA A100, embora a empresa não divulgue o hardware específico usado em sua API pública.

Recepção e Impacto

Avaliações iniciais de testadores independentes no OpenPanel destacaram o forte desempenho do ImagineArt 2.0 na renderização de texto dentro de imagens, uma fraqueza comum em modelos anteriores. O modelo também recebeu elogios por seu manuseio de cenas complexas com múltiplos objetos, atribuído ao seu esquema aprimorado de codificação posicional. No entanto, alguns usuários notaram artefatos ocasionais em texturas de alta frequência, como pelos e cabelos.

A Halcyon anunciou planos para uma versão 2.1, esperada para o final de 2025, que incorporará poda de modelo para reduzir os custos de inferência em 30%. A empresa também disponibilizou o código de inferência como código aberto sob uma licença permissiva, embora os pesos do modelo permaneçam proprietários.

Especificações Técnicas

  • Desenvolvedor: Halcyon
  • Data de lançamento: 15 de março de 2025
  • Tipo: Modelo generativo de texto para imagem
  • Licença: Proprietária (código de inferência de código aberto)
  • Antecessor: ImagineArt 1.0
  • Arquitetura: Transformador + U-Net com mistura de especialistas
  • Dados de treinamento: 500 milhões de pares de imagem e texto
  • Resoluções suportadas: Até 2048x2048
  • Tempo de inferência: 2,1 segundos por imagem em GPU A100
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·image-generation·deep-learning·text-to-image
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico