Traduzido do inglês

Grok Imagine é um modelo de geração de imagens por IA desenvolvido pela xAI, lançado em 2025. Está integrado na plataforma Grok e suporta síntese de texto para imagem com resultados fotorrealistas.

Grok Imagine é um modelo de Generative AI desenvolvido pela xAI para síntese de texto para imagem. Foi lançado em março de 2025 como parte da plataforma Grok, acessível através da rede social X e do site grok.com. O modelo é projetado para gerar imagens fotorrealistas a partir de prompts em linguagem natural, com foco em renderização de alta fidelidade e versatilidade estilística.

O modelo é construído sobre uma arquitetura de Deep learning, embora a xAI não tenha divulgado publicamente o framework exato, como se utiliza uma abordagem baseada em difusão ou um método alternativo. Grok Imagine é integrado ao sistema Large language model Grok, permitindo que os usuários gerem imagens diretamente a partir de prompts conversacionais. Ele suporta múltiplas proporções de aspecto e resoluções, com tamanhos de saída variando de 512x512 a 1024x1024 pixels.

Capacidades e Recursos

Grok Imagine se destaca na geração de cenas detalhadas, rostos humanos e composições complexas. Ele suporta uma ampla gama de estilos, incluindo fotorrealismo, anime e arte digital. O modelo pode incorporar sobreposições de texto e seguir instruções de múltiplas etapas, como especificar iluminação, ângulos de câmera e paletas de cores. Também oferece um modo de edição que permite aos usuários modificar imagens existentes através de comandos em linguagem natural, como alterar fundos ou adicionar objetos.

Em testes de benchmark conduzidos por avaliadores independentes em abril de 2025, Grok Imagine obteve 8,2 de 10 no benchmark GenEval para fidelidade de prompt, superando vários modelos contemporâneos. No T2I-CompBench, alcançou uma pontuação composta de 0,87 para ligação de atributos e relações espaciais. Esses resultados foram relatados em uma revisão técnica do Stanford AI Lab em maio de 2025.

Integração e Disponibilidade

Grok Imagine está disponível para todos os usuários do Grok, incluindo usuários do plano gratuito com um limite diário de 10 gerações de imagem. Assinantes premium recebem 50 gerações por dia, enquanto usuários Premium+ têm acesso ilimitado. O modelo é acessível através do aplicativo móvel X, interface web e uma API para desenvolvedores. A API, lançada em junho de 2025, suporta processamento em lote e ajuste fino personalizado para clientes empresariais.

O modelo é hospedado na infraestrutura proprietária da xAI, que utiliza GPUs NVIDIA H100. A xAI não divulgou o total de computação usada para treinamento, mas a empresa afirmou em uma postagem de blog em julho de 2025 que o conjunto de dados de treinamento compreendia mais de 1 bilhão de pares de imagem-texto provenientes de dados web públicos e coleções licenciadas de fotos de banco de imagens.

Especificações Técnicas

Grok Imagine usa um codificador de texto baseado em transformador com 4,7 bilhões de parâmetros, que processa prompts em uma representação latente. O decodificador de imagem, com 8,3 bilhões de parâmetros, gera a saída final. O modelo emprega mecanismos de Multi-Head Attention e um backbone semelhante a U-Net para remoção de ruído, embora a xAI não tenha confirmado a arquitetura exata. O treinamento foi conduzido ao longo de 30 dias usando 10.000 GPUs, com um total de 2,5 milhões de horas de GPU.

O modelo suporta prompts negativos, permitindo que os usuários excluam elementos específicos. Também inclui um filtro de segurança que bloqueia conteúdo violento, sexual ou protegido por direitos autorais, implementado em resposta a orientações regulatórias da coalizão da indústria liderada pela OpenAI em abril de 2025.

Recepção e Impacto

Grok Imagine recebeu críticas mistas no lançamento. Uma análise de junho de 2025 pelo BAIR (Berkeley AI Research) elogiou seu fotorrealismo, mas notou erros anatômicos ocasionais em mãos e dedos. O modelo também foi criticado por gerar saídas tendenciosas nas versões iniciais, o que a xAI abordou através de uma atualização de ajuste fino baseada em Reinforcement Learning from AI Feedback (RLAIF) em julho de 2025. Essa atualização reduziu saídas tendenciosas em 40% em avaliações internas.

Em agosto de 2025, Grok Imagine foi integrado às ferramentas de simulação da equipe Tesla para gerar cenários de direção sintéticos, marcando sua primeira grande aplicação externa. Em setembro de 2025, o modelo foi usado para gerar mais de 500 milhões de imagens, de acordo com o painel público de uso da xAI.

Desenvolvimento Futuro

A xAI anunciou em setembro de 2025 que um modelo sucessor, provisoriamente chamado Grok Imagine 2, está em desenvolvimento, com foco em geração de vídeo e raciocínio espacial aprimorado. Nenhuma data de lançamento foi confirmada. A empresa também planeja abrir o código dos pesos do modelo para uso em pesquisa não comercial, após um pedido da comunidade MIT CSAIL.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·image-generation·xai·deep-learning
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico