OpenAI Sora 2024

译自英文

OpenAI Sora是一款文本生成视频模型及应用(2024-2026年),可根据提示生成短视频,后来增加了社交功能。它在被停用前引发了关于深度伪造和版权的争议。

OpenAI Sora是一款由OpenAI开发的文本转视频模型及社交媒体应用。该模型利用人工智能,根据文本提示生成短视频片段,并能扩展现有短视频。它于2024年2月首次预览,2024年12月公开发布,并于2026年4月关闭,其API计划于2026年9月停止服务。Sora的能力及快速关闭引发了关于生成式AI社会影响的讨论,包括对深度伪造和版权的担忧。

背景

在Sora之前,已存在多种文本转视频模型,包括Meta的Make-A-Video、Runway的Gen-2和Google Veo。OpenAI此前于2023年9月发布了其第三个文本转图像模型DALL-E 3。Sora在此基础上,将DALL-E 3的技术改编用于视频生成。该模型是一个扩散变换器,一种深度学习架构,在潜在空间中对3D补丁进行去噪,然后通过解压器将其转换为标准视频。OpenAI使用公开可用和许可的受版权保护视频训练Sora,但未披露确切来源或数量。

初始发布

团队以日语中“天空”一词命名Sora,以象征其“无限的创造潜力”。2024年2月15日,OpenAI通过发布多段高清视频片段预览了Sora,包括一辆SUV沿山路行驶、一个“短毛怪物”在蜡烛旁、两人在雪中穿行东京,以及加州淘金热的伪造历史镜头。OpenAI表示,它可以生成最长一分钟的视频。公司分享了一份技术报告,详细说明了训练方法。CEO萨姆·奥尔特曼还在推特上发布帖子,用Sora生成的视频回应用户提示。

截至2024年12月9日,OpenAI逐步向美国和加拿大的ChatGPT Pro和ChatGPT Plus用户开放Sora。此前,一个由错误信息和偏见专家组成的小型“红队”进行了对抗性测试。OpenAI还将Sora分享给一小群创意专业人士,包括视频制作者和艺术家,以获取反馈。2025年2月,OpenAI宣布计划将Sora集成到ChatGPT中,允许用户直接从聊天机器人生成视频。

Sora 2

Sora 2于2025年9月30日发布,同时推出iOS应用,Android应用在两个月后推出。Sora 2生成的所有视频均带有可见的移动数字水印,以防止滥用。之前的版本也有安全水印。2025年10月7日,404 Media报道称,能够去除水印的第三方程序已变得普遍。许多媒体,如Wired,指出Sora 2应用在风格和功能上与TikTok明显相似。

停止服务

2026年3月24日,OpenAI在X上宣布,将停止Sora的移动应用和API服务。Sora应用于2026年4月26日关闭,而API计划于2026年9月24日关闭。OpenAI与迪士尼的合作关系,包括允许Sora中使用迪士尼角色的许可协议,也即将结束。这一决定促使英国科技新闻网站The Register将OpenAI称为“产品杀手”,继Google、Amazon Web Services、Broadcom、Cloud Software Group和Netscape等其他科技公司之后。

OpenAI在关闭通知中未提供停止Sora的具体原因。报道将这一决定与计算资源短缺、成本压力以及向核心企业产品的更广泛转变联系起来。在公开发布后,Sora的全球用户峰值约为100万,随后降至不足50万,而由于视频生成的计算需求,该服务估计每天运营成本为100万美元。

法律监管

2024年11月,一组测试人员在Hugging Face上泄露了Sora访问的API密钥,并发布宣言抗议Sora被用于“艺术洗白”。OpenAI在泄露三小时后撤销了所有访问权限,并表示“数百名艺术家”参与了开发,“参与是自愿的”。

在发布时,Sora 2默认允许受版权保护的内容,除非版权持有人联系OpenAI限制生成。2025年10月3日,OpenAI表示,未来的更新将赋予版权持有人“更精细的控制”,但未说明是否移除现有内容。10月6日,MPA主席批评了OpenAI在Sora 2上的版权处理方式。

2025年12月11日,华特迪士尼公司宣布向OpenAI投资10亿美元,并达成三年许可协议,允许Disney+用户在Sora 2上生成超过200个受版权保护的角色,包括来自迪士尼动画、皮克斯、漫威影业和星球大战的角色。

能力与局限

Sora背后的技术是对DALL-E 3技术的改编。据OpenAI称,Sora是一个扩散变换器,一种以变换器作为去噪器的去噪潜在扩散模型。视频在潜在空间中通过去噪3D补丁生成,然后由视频解压器转换为标准空间。使用重新标注来增强训练数据,为视频生成详细说明。

OpenAI使用公开可用的视频和许可的受版权保护视频训练模型,但未透露确切数量或来源。发布时,OpenAI承认存在不足,包括模拟复杂物理、理解因果关系以及区分左右的能力有限。OpenAI还表示,为遵守安全实践,Sora将限制涉及性、暴力、仇恨或名人形象的文本提示,以及包含现有知识产权的内容。

Sora研究员蒂姆·布鲁克斯表示,该模型仅从数据集中学习了如何创建3D图形,而同事比尔·皮布尔斯表示,模型生成连贯场景的能力是扩展变换器架构和训练数据的结果。

影响与争议

Sora的发布加剧了公众对深度学习生成式AI潜在滥用的争论,尤其是在深度伪造方面。可见水印是一种缓解措施,但其被第三方工具移除凸显了内容真实性的挑战。该模型默认使用受版权保护的材料,除非选择退出,这引起了版权持有人和行业团体(如MPA)的批评。Sora的停止服务也引发了对资源密集型AI产品可持续性的质疑,因为运营成本和用户下降促成了其终结。

遗产

Sora的短暂存在展示了文本转视频AI的技术潜力和商业挑战。其扩散变换器方法影响了后续视频生成研究,而其关闭则凸显了大规模运行此类模型的经济现实。Sora引发的关于版权和水印的争论继续塑造着围绕AI内容生成的政策讨论。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-video·openai·generative-ai·deepfakes
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史