译自英文

Google DeepMind的文本到视频生成模型系列,于2024年5月首次发布,2025年推出的Veo 3增加了同步音频生成功能,并与YouTube进行了更紧密的整合。

Veo 是Google DeepMind开发的一系列文本到视频生成模型,于2024年5月首次发布。它建立在谷歌早期内部视频生成研究的基础上,包括Imagen Video和Lumiere研究系统,并被定位为谷歌在高质量AI视频生成新兴市场中与OpenAISora直接竞争的产品。

能力与发布

最初的Veo模型可以根据文本提示生成1080p分辨率的视频片段,支持对电影风格的控制,如航拍镜头、延时摄影和特定摄像机运动,并支持超过一分钟长度的片段。Veo还支持图像到视频的生成,使用静态图像作为生成运动的起始帧。2025年推出的Veo 3引入了一项重要能力,即同步音频生成,可生成与生成视觉内容匹配的对话、音效和环境噪音,这一功能使其区别于当时大多数生成静音视频、需要单独制作音轨的竞争视频模型。

集成

谷歌将Veo集成到其多个自有产品中,包括实验性电影制作和创意工具,并且值得注意的是,其功能允许YouTube创作者直接从平台使用Veo生成视频内容,包括Shorts。这种与YouTube的紧密集成使Veo相对于独立的视频生成产品具有分发优势,将AI视频生成直接嵌入全球最大的视频平台之一,而无需单独的应用程序或工作流程。Veo还通过谷歌的Gemini应用和企业级Vertex AI平台提供,这呼应了谷歌应用于Gemini语言模型家族的更广泛分发策略。

竞争格局

Veo进入了一个快速发展的领域,与Sora、快手可灵、字节跳动即梦以及Runway等独立实验室同台竞技,每个竞争对手在2024年和2025年期间都在分辨率、片段长度、物理一致性和提示遵循度方面不断迭代。视频生成基准测试和社区竞技场上的比较排名随着每个实验室发布更新版本而频繁变化,不同模型在不同维度上各有领先,如运动真实感、音频同步或提示保真度。Veo 3的音频能力尤其被评测者广泛引用为其发布时的重要差异化优势,因为逼真的同步声音在视频生成领域一直落后于视觉质量。

接受度与担忧

与其他先进的视频生成系统一样,Veo因其可能被滥用以制作令人信服的深度伪造和对真实人物的未经授权描绘而受到审查,谷歌实施了包括对生成内容进行可见和不可见水印在内的保障措施,这是该公司在其SynthID系统下更广泛的AI水印工作的一部分。Veo的开发也在谷歌对世界模型研究兴趣的背景下被讨论,一些研究人员和Google DeepMind自身的沟通将高保真视频生成视为迈向模拟物理动态系统的一步,而不仅仅是产生视觉上合理的图像,这种表述与关于Sora的说法相呼应,并且关于这些系统实际编码了多少真正的物理理解仍然是一个争论的话题。

分类:generative-ai·video-generation·google-models
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史