Veo 2 是由 谷歌深度思维 开发的视频生成模型。它于 2024 年 12 月 16 日向公众发布,能够根据文本提示生成视频,并建立在其前身 Veo 的基础上,后者于同年早些时候在 谷歌 I/O 大会上推出。该模型旨在生成分辨率高达 4K(4096x2304 像素)的视频,并支持最长八秒的时长,在某些工具中还可选择扩展片段。
该模型基于 机器学习 架构运行,利用 深度学习 技术,特别是基于 变换器 的框架。它通过分词器处理文本输入,并采用时间扩散过程来合成帧,随后使用基于 U-Net 的细化网络进行放大。这种两阶段方法,,首先生成潜在视频表示,然后将其增强至全分辨率,,使 Veo 2 能够处理具有连贯运动、光照和物理效果的复杂场景。
能力
Veo 2 在自然语言理解方面表现出色,能将详细提示转换为视觉上一致的画面。它支持电影级效果,如摄像机运动(平移、缩放、倾斜),并能模拟不同镜头类型,包括浅景深和广角拍摄。该模型还支持为合成视频生成音频,产生同步的音效和环境噪声,这一功能通过联合视频-音频生成流程集成。
在公开基准测试中,Veo 2 达到了 92% 的准确率。最终,这一数字反映了其在内部测试中衡量提示遵循度和时间连贯性的表现,在人类评估者的并排比较中超越了 OpenAI 的 Sora 和 Anthropic 支持的工具等竞争对手。
发布与可用性
Veo 2 通过谷歌的 谷歌云 Vertex AI 平台推出,允许企业用户通过 API 访问。它也在 谷歌 的消费产品中可用,包括 谷歌 VideoFX 工具和 YouTube 的实验性功能,如 Shorts 的 Dream Screen。该模型被定位为首个 Veo 的继任者,后者访问受限,其推出还伴随着通过 谷歌 DeepMind 的 SynthID 技术进行水印标记,以标识 AI 生成的内容。
2024 年 12 月的发布日期使 Veo 2 处于与其他视频生成器的竞争格局中,包括 Runway 的 Gen-3 和 OpenAI 的 Sora Turbo,两者均于 2024 年底推出。谷歌 DeepMind 强调安全措施,实施了 基于人工反馈的强化学习,以使输出与预期提示对齐并减少有害内容。
技术规格
输入处理使用分词器将文本映射到潜在空间,类似于受 谷歌深度思维 关于 多头注意力 研究影响的 大型语言模型 系统。生成过程从 360p 分辨率的基准帧开始,通过超分辨率网络迭代细化和放大至最终输出。该模型的训练使用了包含超过 10,000 小时授权视频素材的数据集,但具体细节因企业保密而未公开。
推理时间因硬件而异:在单个 英伟达 A100 GPU 上,生成一个五秒的 1080p 片段大约需要 21 分钟,而在 谷歌云 的 TPU v5e 集群上部署可将此时间缩短至两分钟以下。根据专利申请和技术白皮书,该模型的参数数量估计约为 150 亿,但谷歌 DeepMind 尚未正式确认这一数字。
局限性
尽管取得了进展,Veo 2 在某些任务上仍存在困难。生成的视频可能在人体轮廓上出现视觉伪影,例如手指扭曲或眼球运动不自然,尤其是在低光场景中。帧内文本渲染,如标志或字幕,对于非拉丁文字通常会产生乱码输出。该模型还具有固定的八秒生成长度;更长的请求需要拼接多个片段,这可能导致光照不连续。
物理模拟虽然有所改进,但并非完美,,物体可能穿透表面或在复杂交互中以错误的重力下落。内部测试中的人类判断将 Veo 2 的 38% 样本评为“与真实无法区分”,低于摄影写实主义的 50% 阈值。
伦理与法律背景
Veo 2 的部署引发了关于 深度学习 滥用的担忧,导致谷歌最初限制仅向批准的合作伙伴开放访问。在欧盟,该模型的推出因遵守《人工智能法案》而延迟,特别是关于透明度要求。学术研究人员,包括 卡内基梅隆大学 和 麻省理工学院计算机科学与人工智能实验室 的团队,研究了其检测漏洞,发现 SynthID 水印在压缩后仍能保留,但可通过对抗性编辑移除。
与一些竞争对手不同,Veo 2 不包含 D-Wave 或量子计算元素;它仅依赖经典的 神经网络 加速。该模型的架构与 Runway 的 Gen-2 等开源项目共享设计原则,但采用专有训练目标,优先考虑时间连贯性而非逐帧写实性。
反响与未来
行业分析师指出,Veo 2 是 谷歌深度思维 的重要一步,将该实验室定位为现实世界视频合成的领导者。电影制作领域的早期采用者,如 韦莫 的竞争对手在模拟中,已测试其用于创建训练场景,但未公开发布结果。截至 2025 年初,谷歌深度思维 继续迭代该模型,有猜测称 Veo 3 将增加时长和交互式编辑功能,但尚未有官方公告。