CoDi(即Composable Diffusion的缩写)是一个由微软研究院开发的生成式人工智能模型,能够在单一统一框架中处理和生成多种模态,,文本、图像、音频和视频。与早期依赖每种数据类型单独模型的 multimodal 系统不同,CoDi 采用可组合扩散方法,使其能够同时生成这些模态的任意组合,例如从单个提示生成带有同步音频和文本字幕的视频。该模型在2023年的一篇研究论文中提出,代表了向更集成 multimodal AI 系统迈进的一步。
CoDi 建立在扩散模型的成功基础上,扩散模型是一类通过迭代将随机噪声细化为结构化输出来生成数据的机器学习算法。其关键创新在于能够将多个特定模态的扩散过程组合到单个模型中,从而无需在训练期间所有模态都存在即可实现跨模态生成。这使得系统比之前需要跨所有模态配对数据的方法更灵活、更高效。
架构与设计
CoDi 架构由几个关键组件组成。其核心使用一个共享潜在空间,其中不同模态表示为连续向量。每种模态都有自己的编码器和解码器,但这些通过可组合扩散框架连接,使模型能够以任意组合生成输出。该模型采用基于Transformer的主干进行跨模态注意力,使其能够在文本、图像、音频和视频领域之间对齐表示。
一个显著特点是其在训练期间使用“桥接”机制。由于跨所有四种模态的配对数据稀缺,CoDi 分阶段训练:首先在单个模态对上(例如文本-图像、文本-音频),然后在三元组上,最后在所有组合上。这种分阶段训练使模型即使在完整 multimodal 数据集不可用时也能学习跨模态关系。
能力与应用
CoDi 可以执行各种生成任务。例如,给定描述场景的文本提示,它可以生成带有同步音频和匹配文本描述的视频。它还可以跨模态编辑现有内容,例如在保留语义内容的同时更改图像风格,或生成与视频视觉动作匹配的音效。
该模型的可组合性意味着用户可以在任何模态子集上条件化生成。这种灵活性在内容创作、无障碍工具(例如为图像生成音频描述)和交互式媒体制作中具有潜在应用。研究人员已证明 CoDi 可以跨模态生成连贯输出,在生成的文本、视觉和音频之间保持语义一致性。
训练与数据
CoDi 在公开可用的数据集上训练,包括来自LAION-5B等来源的图像-文本对、音频-文本对和视频-文本数据集。分阶段训练方法需要仔细的课程设计,其中模型首先学习更简单的成对对齐,然后逐步过渡到更复杂的 multimodal 组合。研究人员使用对比学习和扩散目标的组合来训练编码器和解码器。
训练中解决的一个挑战是跨模态数据可用性的不平衡。文本和图像数据丰富,而高质量的视频-音频-文本三元组更稀有。CoDi 的可组合设计通过允许模型利用成对数据泛化到未见过的模态组合来缓解这一问题。
接受度与影响
CoDi 在2023年计算机视觉与模式识别会议(CVPR)上展示,并因其对 multimodal 生成的统一方法而受到关注。它是最早展示在单一框架中同时生成所有四种主要内容类型的模型之一,影响了后续关于multimodal 学习和基础模型的研究。
虽然 CoDi 主要是研究原型,并未作为商业产品发布,但其思想已为后来关于统一 multimodal 模型的工作提供了信息,包括OpenAI和Google DeepMind的努力。该模型对可组合性和分阶段训练的强调已被其他探索高效 multimodal AI 的研究团队以各种形式采用。
局限性
CoDi 有几个局限性。其输出分辨率和质量,特别是视频方面,低于专门的单模态模型。该模型在处理长内容以及在扩展序列上保持一致性方面可能遇到困难。此外,由于依赖扩散,生成计算密集,需要大量GPU资源。分阶段训练方法也意味着在稀有模态组合上的性能可能不如常见组合稳健。
伦理考虑包括在生成合成媒体方面可能被滥用的风险。与其他生成模型一样,存在关于深度伪造和错误信息的担忧,尽管 CoDi 的研究状态限制了其直接部署。
参见
参考文献
- Tang, Z., 等. (2023). CoDi: Composable Diffusion for Real-World Image and Video Generation. CVPR.
- 微软研究院关于 CoDi 的博客文章和技术文档。