Geração de texto para 3D é a tarefa de produzir um modelo tridimensional, malha ou cena a partir de um prompt em linguagem natural, em vez de uma imagem plana ou vídeo. Ela se situa na interseção da geração de texto para imagem e da computação gráfica 3D e, em meados da década de 2020, permanecia menos madura do que suas contrapartes 2D, produzindo geometria e texturas que frequentemente exigiam limpeza manual para uso em produção.
Fundamentos
O campo se baseia em duas técnicas gráficas que amadureceram junto com o aprendizado profundo. Os campos de radiação neural (NeRF), introduzidos em 2020, representam uma cena 3D como uma rede neural que prevê cor e densidade em qualquer ponto do espaço, permitindo que novas vistas fotorrealistas sejam renderizadas a partir de um conjunto esparso de fotos de entrada. O splatting gaussiano 3D, introduzido em 2023, representa uma cena como uma grande coleção de elipsoides suaves e coloridos otimizados para corresponder às vistas de entrada, oferecendo qualidade visual comparável com renderização muito mais rápida e rapidamente se tornou uma alternativa popular ao NeRF para aplicações em tempo real. Nenhuma das técnicas, isoladamente, gera novo conteúdo a partir de texto; ambas são representações que os primeiros sistemas de texto para 3D aprenderam a otimizar usando orientação de modelos 2D.
Abordagens para texto para 3D
Os primeiros métodos de texto para 3D, como o DreamFusion em 2022, usavam um modelo de difusão de texto para imagem pré-treinado como sinal de supervisão: uma representação 3D era repetidamente renderizada a partir de pontos de vista aleatórios, e cada imagem renderizada era ajustada para corresponder melhor ao prompt de texto de acordo com o modelo de difusão 2D, um processo de otimização lento e específico por objeto que poderia exigir computação significativa para um único resultado. Sistemas posteriores avançaram para a geração feed-forward, treinando uma rede para prever diretamente uma representação 3D a partir de texto ou de uma única imagem de entrada em uma passagem, trocando parte da qualidade por uma geração dramaticamente mais rápida, aproximando-se de como os modelos de texto para imagem haviam amadurecido de otimização baseada para geração direta.
Aplicações
Ferramentas de texto para 3D são usadas para prototipagem rápida no desenvolvimento de jogos, visualização de produtos, conteúdo de realidade virtual e aumentada e criação de ativos para pré-visualização de filmes, onde um rascunho 3D aproximado pode economizar tempo significativo do modelador, mesmo que precise de refinamento manual. A tecnologia é acompanhada de perto como um possível insumo para a pesquisa de modelos de mundo e de IA incorporada, já que agentes que planejam e agem em ambientes 3D físicos ou simulados se beneficiam da capacidade de gerar conteúdo e cenas 3D plausíveis, em vez de depender apenas de ativos pré-construídos.
Limitações
Em comparação com a geração de imagem e vídeo 2D, a saída de texto para 3D geralmente ficou para trás em consistência geométrica, qualidade de textura e na capacidade de produzir malhas limpas e editáveis utilizáveis diretamente em pipelines de software 3D padrão. A consistência multi-vista, gerar uma forma que pareça correta de todos os ângulos, e não apenas dos ângulos vistos durante a otimização, permaneceu um desafio técnico central. Em 2025, a geração de texto para 3D era considerada um campo em estágio mais inicial do que a geração de texto para imagem ou texto para vídeo, com pesquisa ativa tanto de grandes laboratórios quanto de startups especializadas, mas sem um produto comercial dominante único comparável ao Midjourney ou ao Stable Diffusion no domínio de imagens.