译自英文

Phenaki是谷歌DeepMind开发的一种生成式AI模型,用于根据文本提示创建可变长度的视频,采用基于变换器的架构来生成时间连贯的序列。它于2022年作为研究原型推出。

概述

Phenaki 是一个由 Google DeepMind 开发的生成式人工智能模型,用于根据文本描述生成视频。它旨在基于自然语言提示,生成时间上连贯的视频序列,长度可变,从短片段到较长的叙事均可。该模型在 2022 年的一篇研究论文中提出,是文本到视频生成领域的一项重要进展,该领域结合了人工智能机器学习深度学习技术。

架构与训练

Phenaki 的核心架构基于Transformer模型,这是一种在现代人工智能中具有基础性地位的神经网络类型,尤其适用于处理序列数据。与早期通常生成固定长度、低分辨率片段的视频生成模型不同,Phenaki 可以生成具有可变帧数的视频,从而实现更灵活、更动态的输出。它通过将视频压缩为一系列离散的标记来实现这一点,类似于大型语言模型处理文本的方式,然后根据输入文本自回归地生成这些标记。

Phenaki 采用两阶段方法。首先,一个视频分词器使用 3D 卷积编码器-解码器将时空数据压缩为紧凑的视觉标记序列。该分词器在大量视频数据集上进行训练,在保留关键视觉信息的同时降低了数据维度。其次,一个基于 Transformer 的自回归模型,其设计精神与语言建模中使用的模型相似,根据文本提示和先前生成的标记,按顺序生成这些标记。该模型在视频-文本对数据集上进行训练,学习将视觉内容与语言描述对齐。

训练过程涉及掩码标记建模目标,即模型学习预测序列中被掩码的标记,从而使其能够从起始标记或文本提示生成连贯的视频。这种方法使 Phenaki 能够生成任意长度的视频,因为模型可以持续生成标记,直到满足停止条件,例如达到最大长度或生成序列结束标记。

能力与特点

Phenaki 可以根据广泛的文本提示生成视频,包括描述动作、场景甚至时间变化的提示。例如,提示“一只猫在海滩上行走”将生成一只猫在海滩上行走的视频,模型确保帧间的视觉和时间一致性。该模型还支持零样本泛化,这意味着它可以处理训练期间未明确见过的提示,凭借其对语言和视觉概念的理解来生成合理的视频。

一个显著的特点是它能够生成包含多个场景或事件的视频,因为模型可以随时间在视觉状态之间转换。这是通过自回归生成标记实现的,使模型能够提前规划并保持叙事的连贯性。然而,输出分辨率相对较低,通常约为 128x128 像素,视频时长也较短,通常只有几秒钟,尽管长度可以扩展。

与其他模型的比较

Phenaki 大约与其他文本到视频模型(例如来自 OpenAI 和其他研究机构的模型)同时期开发。与一些使用基于扩散方法的模型不同,Phenaki 基于 Transformer 的方法提供了不同的权衡:它可以生成更长的序列,但在更高分辨率下可能难以处理精细细节。该模型的可变长度能力是一个关键的差异化因素,因为许多同期模型仅限于生成固定长度的片段。

在更广泛的生成式人工智能背景下,Phenaki 推动了连接文本与视频的多模态模型的发展。其架构影响了后续的视频生成研究,特别是在使用标记化和自回归建模处理时间数据方面。

局限性与未来方向

作为一个研究原型,Phenaki 存在若干局限性。生成的视频分辨率较低,并且可能出现伪影,例如闪烁或物体外观不一致。该模型在训练和推理过程中还需要大量的计算资源,这限制了其可访问性。此外,训练数据可能包含偏差,模型生成的内容也可能反映这些偏差,从而引发关于其部署的伦理问题。

该领域的未来工作旨在提高分辨率、时间一致性以及对生成内容的控制。研究人员正在探索将 Transformer 方法与扩散方法相结合的混合方法,以及更高效的标记化技术。截至 2025 年,文本到视频生成已取得显著进展,能够生成更高分辨率和更长视频的模型已经出现,但 Phenaki 仍然是该领域的基础性贡献。

影响与反响

Phenaki 的推出引起了人工智能研究界的关注,因为它证明了使用统一的 Transformer 架构从文本生成连贯视频的可行性。它凸显了深度学习模型处理复杂时空数据的潜力,并为创意应用开辟了新途径,例如自动化视频制作和辅助叙事工具。虽然 Phenaki 本身并未商业化部署,但其原理已被后续模型采用,并持续影响着正在进行的研究。

另见

参考文献

  • Phenaki:可变长度视频生成,来自开放领域文本描述(2022),Google DeepMind 研究论文。
  • 文本到视频合成与自回归视频生成的相关工作。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·video-generation·deep-learning·google-deepmind
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史