텍스트-투-비디오 생성

영어에서 번역됨

텍스트-투-비디오 생성은 자연어 프롬프트로부터 짧은 비디오 클립을 생성하는 기능으로, 확산 기반 이미지 생성에서 등장하여 2023년에서 2026년 사이에 빠르게 성숙했습니다.

文本到视频生成是指根据自然语言提示词生成一段视频片段的任务,通常时长为数秒。它是对文本到图像技术在时间维度上的扩展,要求模型在生成连续帧时保持主体、光照和物理规律的一致性,而非生成单张静态图像。

历史

2022年的早期研究系统,包括Meta的Make-A-Video和谷歌的Imagen Video,改编了扩散模型技术,但生成的视频分辨率低、时长短,且往往缺乏连贯性。Runway的Gen-1和Gen-2模型于2023年发布,是最早一批广泛可用的商业工具之一。该领域最受瞩目的时刻出现在2024年2月,OpenAI发布了Sora,其预览版能够生成时长一分钟、高分辨率的视频片段,并被OpenAI描述为迈向通用“世界模拟器”的一步,不过该工具直到后来才广泛开放。谷歌DeepMind的Veo也走了类似路线,其Veo 3于2025年增加了同步音频生成功能,并集成到YouTube的创作工具中。中国的研究机构也迅速进入该领域:快手旗下的可灵和字节跳动的即梦在2025年均登顶了独立的视频生成排行榜,反映出该领域日益全球化和竞争激烈的态势。

技术方法

大多数文本到视频系统都扩展了潜在扩散模型,通过增加时间层来建模帧间运动,有时还会结合基于Transformer的架构,对时空块(而非单张图像)进行处理,OpenAI在描述Sora时便采用了这种方法。生成连贯视频比生成单张图像要困难得多,因为模型必须维持物体的持久性、物理规律的合理性以及光照的一致性,而且错误会随着帧数增加而累积。许多系统还支持图像到视频的功能,即根据用户提供的静态图像生成动画,有些系统还允许控制摄像机运动或对现有片段进行扩展。

应用与反响

文本到视频工具已被应用于广告、预览可视化、社交媒体内容和短视频娱乐等领域,一些工作室也开始尝试将该技术用于制作提案素材或背景镜头。这项技术引发了与早期文本到图像生成和音乐生成类似的争议,包括演员、电影制作人和工会对训练数据中使用受版权保护素材的反对,以及对制作岗位可能被替代的担忧。2023年的好莱坞大罢工将AI生成的形象和表演问题列为核心议题之一。由于深度伪造视频比静态图像传播更快、更具说服力,因此对深度伪造滥用的担忧在视频领域尤为突出,这促使多个平台要求或探索对AI生成视频添加AI水印。

局限性

截至2025年,大多数公开可用的系统仍只能生成数秒至约一分钟的片段,且成本和计算量会随着分辨率和时长的增加而急剧上升。对精确对话、复杂的多角色互动以及长程叙事连贯性的精细控制仍是未解决的问题,这也是OpenAI、谷歌DeepMind、Runway和字节跳动AI之间激烈竞争的领域。

분류:generative-ai·video-generation
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사