Make-A-Video是Meta开发的一种生成式人工智能系统,可根据文本描述生成短视频片段。该系统于2022年9月发布,是大型科技公司推出的首批主要商业级文本生成视频模型之一,此前已有文本生成图像方面的研究。该系统利用深度学习和神经网络架构的进展,特别是扩散模型,从自然语言提示中合成逼真的运动和场景。
该模型建立在Meta先前在图像生成方面的研究基础上,尤其是Make-A-Scene系统,并将其扩展到时间维度。与一些早期需要配对文本-视频训练数据的视频生成方法不同,Make-A-Video主要使用未标记的视频数据进行训练,并利用图像-文本对来学习语言与视觉内容之间的映射。这使得它无需大量视频字幕数据集即可生成视频,这是一个显著的实际优势。
架构与训练
Make-A-Video采用三阶段流水线。首先,基于变换器架构的文本编码器将输入提示转换为语义嵌入。其次,扩散模型生成一系列潜在帧,捕捉空间构图和时间动态。第三,解码器将这些潜在表示升级为全分辨率视频帧。训练过程包括两个阶段:一个在图像-文本对上训练的空间模型,用于理解物体外观和布局;一个在未标记视频上训练的时间模型,用于学习运动模式。这种解耦减少了对昂贵的视频-文本数据集的需求。
该模型在大量公开可用的图像和视频语料库上进行了训练,但Meta未披露确切的数据集规模。该系统可生成分辨率高达768x768像素、长度约五秒、帧率约为每秒16帧的视频。它还支持其他功能,例如生成源图像的变体、插值两幅图像以创建平滑过渡,以及动画化单个静态图像。
能力与局限
Make-A-Video可以生成各种场景,从动物和物体到抽象概念,具有连贯的运动和对提示的合理遵循。例如,像“一只泰迪熊在画肖像”这样的提示会产生一只熊移动画笔的短片。然而,该模型存在显著局限性。它在复杂物理方面表现不佳,例如精确的反射或物体之间的真实交互,有时会产生变形形状或闪烁纹理等伪影。视频中的文本渲染也很差,且模型无法生成音频。这些问题在早期文本生成视频系统中很常见。
模型的输出质量随提示的具体程度而变化。模糊的提示通常会产生通用或重复的运动,而详细的提示则提高保真度。Meta强调该系统是研究演示,而非完善的产品,从未作为公共API或开源模型发布。相反,Meta发表了一篇研究论文和一个带有示例视频的演示页面,这引起了大量媒体关注。
与同期系统的比较
Make-A-Video出现在竞争激烈的环境中。OpenAI早些时候发布了用于图像的DALL-E 2,并在2022年还推出了名为Imagen Video的视频模型,但未公开部署。谷歌DeepMind展示了Phenaki这一文本生成视频模型,其他实验室如阿里云和英伟达也在探索类似技术。Make-A-Video因其使用未标记视频训练而减少了数据需求,以及当时相对较高的视觉质量而脱颖而出。然而,它并非首创;更早的系统,如清华大学的CogVideo和中国科技公司BAAI,在2021年已展示了基本的文本生成视频能力。
一个关键区别在于Meta专注于用户友好的输出和基于图像先验的集成。该模型可以接受单张图像并使其动画化,这一功能给评审者留下了深刻印象。相比之下,许多竞争对手需要多个输入帧或更长的提示。权衡之处在于Make-A-Video的视频较短,且缺乏对摄像机角度或物体轨迹的精细控制。
反响与影响
媒体对Make-A-Video的报道大多持积极态度,各媒体称赞该模型能够生成异想天开且连贯的片段。技术评论员指出,这标志着人工智能研究从静态图像向动态内容的转变。该模型也引发了伦理担忧,特别是关于深度伪造和错误信息的潜在风险。Meta承认了这些风险,并表示在制定保障措施之前不会公开发布该模型。该公司还讨论了水印和内容来源工具,但这些并未针对Make-A-Video本身实施。
在研究社区中,Make-A-Video影响了后续视频扩散模型的工作。其架构启发了后来的系统,如Meta自己的Emu Video和开源项目如ModelScope的文本生成视频。题为“Make-A-Video: Text-to-Video Generation without Text-Video Data”的论文在2023年国际学习表征会议(ICLR)上发表,并被广泛引用。
遗产与未来方向
Make-A-Video是一个垫脚石而非最终产品。到2023年,Meta已转向更先进的视频生成研究,包括Emu Video模型,该模型改善了时间一致性和分辨率。文本生成视频的更广泛领域迅速发展,像Runway的Gen-2和谷歌DeepMind的Lumiere等模型提供了更长、更逼真的输出。Make-A-Video的遗产在于证明了无需大规模配对数据集即可实现高质量文本生成视频,并在研究者和公众中普及了这一概念。
该模型还促进了关于创意工具民主化的讨论。虽然它未发布,但其公开演示展示了生成式AI如何降低视频制作的门槛。截至2024年,文本生成视频模型已变得更加可及,但Make-A-Video仍然是机器学习基础媒体生成演变中的一个显著早期里程碑。