Traduzido do inglês

CoDi é um modelo de IA generativa multimodal desenvolvido pela Microsoft Research que pode simultaneamente gerar e comprender texto, imagens, áudio e vídeo usando uma arquitetura unificada baseada em difusão.

CoDi (abreviação de Composable Diffusion) é um modelo de inteligência artificial generativa desenvolvido pela Microsoft Research que pode processar e gerar múltiplas modalidades - texto, imagem, áudio e vídeo - em um único framework unificado. Diferentemente de sistemas multimodais anteriores que dependiam de modelos separados para cada tipo de dado, o CoDi usa uma abordagem de difusão componível que permite gerar qualquer combinação dessas modalidades simultaneamente, como produzir um vídeo com áudio sincronizado e legendas de texto a partir de um único prompt. O modelo foi apresentado em um artigo de pesquisa de 2023 e representa um passo em direção a sistemas de IA multimodal mais integrados.

O CoDi se baseia no sucesso dos modelos de difusão, uma classe de algoritmos de aprendizado de máquina que geram dados refinando iterativamente ruído aleatório em saídas estruturadas. Sua principal inovação é a capacidade de combinar múltiplos processos de difusão específicos de cada modalidade em um único modelo, permitindo geração entre modalidades sem exigir que todas estejam presentes durante o treinamento. Isso torna o sistema mais flexível e eficiente do que abordagens anteriores que exigiam dados pareados em todas as modalidades.

Arquitetura e Design

A arquitetura do CoDi consiste em vários componentes-chave. Em seu núcleo, utiliza um espaço latente compartilhado onde diferentes modalidades são representadas como vetores contínuos. Cada modalidade possui seu próprio codificador e decodificador, mas estes são conectados por meio de um framework de difusão componível que permite ao modelo gerar saídas em qualquer combinação. O modelo emprega uma espinha dorsal baseada em Transformer para atenção entre modalidades, permitindo alinhar representações entre os domínios de texto, imagem, áudio e vídeo.

Uma característica notável é o uso de um mecanismo de "ponte" durante o treinamento. Como dados pareados entre todas as quatro modalidades são escassos, o CoDi é treinado em etapas: primeiro em pares de modalidades individuais (por exemplo, texto-imagem, texto-áudio), depois em trios e, finalmente, em todas as combinações. Esse treinamento em etapas permite que o modelo aprenda relações entre modalidades mesmo quando conjuntos de dados multimodais completos não estão disponíveis.

Capacidades e Aplicações

O CoDi pode realizar uma variedade de tarefas de geração. Por exemplo, dado um prompt de texto descrevendo uma cena, ele pode gerar um vídeo com áudio sincronizado e uma descrição textual correspondente. Também pode editar conteúdo existente entre modalidades, como alterar o estilo de uma imagem preservando seu conteúdo semântico, ou gerar efeitos sonoros que correspondam à ação visual de um vídeo.

A natureza componível do modelo significa que os usuários podem condicionar a geração em qualquer subconjunto de modalidades. Essa flexibilidade tem aplicações potenciais em criação de conteúdo, ferramentas de acessibilidade (por exemplo, gerar descrições de áudio para imagens) e produção de mídia interativa. Os pesquisadores demonstraram que o CoDi pode produzir saídas coerentes entre modalidades, mantendo consistência semântica entre o texto, os visuais e o áudio gerados.

Treinamento e Dados

O CoDi foi treinado em conjuntos de dados publicamente disponíveis, incluindo pares de imagem-texto de fontes como LAION-5B, pares de áudio-texto e conjuntos de dados de vídeo-texto. A abordagem de treinamento em etapas exigiu um design cuidadoso de currículo, no qual o modelo primeiro aprendeu alinhamentos pareados mais simples antes de progredir para combinações multimodais mais complexas. Os pesquisadores usaram uma combinação de aprendizado contrastivo e objetivos de difusão para treinar os codificadores e decodificadores.

Um desafio abordado no treinamento foi o desequilíbrio na disponibilidade de dados entre modalidades. Dados de texto e imagem são abundantes, enquanto trios de alta qualidade de vídeo-áudio-texto são mais raros. O design componível do CoDi mitiga isso ao permitir que o modelo aproveite dados pareados para generalizar para combinações de modalidades não vistas.

Recepção e Impacto

O CoDi foi apresentado na Conferência de Visão Computacional e Reconhecimento de Padrões (CVPR) de 2023 e recebeu atenção por sua abordagem unificada para geração multimodal. Foi um dos primeiros modelos a demonstrar geração simultânea de todos os quatro principais tipos de conteúdo em um único framework, influenciando pesquisas subsequentes sobre aprendizado multimodal e modelos de fundação.

Embora o CoDi tenha sido principalmente um protótipo de pesquisa e não tenha sido lançado como produto comercial, suas ideias informaram trabalhos posteriores sobre modelos multimodais unificados, incluindo esforços da OpenAI e do Google DeepMind. A ênfase do modelo em componibilidade e treinamento em etapas foi adotada em várias formas por outros grupos de pesquisa que exploram IA multimodal eficiente.

Limitações

O CoDi tem várias limitações. Sua resolução de saída e qualidade, particularmente para vídeo, são inferiores às de modelos especializados em modalidade única. O modelo pode ter dificuldades com conteúdo de formato longo e manutenção de consistência ao longo de sequências estendidas. Além disso, por depender de difusão, a geração é computacionalmente intensiva, exigindo recursos significativos de GPU. A abordagem de treinamento em etapas também significa que o desempenho em combinações raras de modalidades pode ser menos robusto do que em pares comuns.

Considerações éticas incluem o potencial de uso indevido na geração de mídia sintética. Como em outros modelos generativos, há preocupações sobre deepfakes e desinformação, embora o status de pesquisa do CoDi tenha limitado seu uso direto.

Ver Também

Referências

  • Tang, Z., et al. (2023). CoDi: Composable Diffusion for Real-World Image and Video Generation. CVPR.
  • Publicações no blog da Microsoft Research e documentação técnica sobre o CoDi.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·multimodal-learning·diffusion-models·microsoft-research
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico