OpenAI Sora 发布

译自英文

OpenAI的文本转视频模型,于2024年2月首次预览,2024年12月公开发布,可根据提示生成短视频片段。该模型于2026年4月停止服务,API于2026年9月终止。

Sora是一款由OpenAI开发的文本转视频模型及社交媒体应用。借助人工智能,该模型可根据文本提示生成短视频片段,并能扩展现有短视频。2024年2月,OpenAI向公众展示了其输出示例,第一代Sora于2024年12月在美国和加拿大向ChatGPT Plus和ChatGPT Pro用户公开发布。第二代Sora 2于2025年9月底向美国和加拿大的部分用户发布,并整合了社交媒体功能。该应用于2026年4月26日关闭,应用程序编程接口(API)计划于2026年9月24日停用,标志着Sora AI品牌的终结。

Sora基于DALL-E 3技术的改编版本构建,采用扩散变换器架构。默认情况下,生成器会在视频中使用受版权保护的材料,除非版权所有者主动选择退出。视频包含可见的移动数字水印以防止滥用,但在Sora 2发布一周后,第三方程序即可移除该水印。

背景

在Sora之前,已有多个能够根据文本生成视频的模型问世,包括Meta的Make-A-Video、Runway的Gen-2和Google Veo。Sora的开发商OpenAI已于2023年9月发布了DALL-E系列文本转图像模型中的第三款DALL-E 3。这些早期发展为Sora后来推广的文本转视频生成技术奠定了基础。

首次发布

开发Sora的团队以日语中“天空”一词为其命名,以象征其“无限的创作潜力”。2024年2月15日,OpenAI首次预览Sora,发布了多段由其生成的高清视频片段,包括一辆SUV沿山路行驶、一个“毛茸茸的小怪物”在蜡烛旁动画、两人在雪中穿行东京,以及加州淘金热的伪造历史影像。OpenAI表示其能够生成长达一分钟的视频。该公司随后发布了一份技术报告,重点介绍了训练该模型的方法。OpenAI首席执行官Sam Altman还发布了一系列推文,用Sora生成的视频回应Twitter用户的提示。

截至2024年12月9日,OpenAI已逐步向美国和加拿大的ChatGPT Pro和ChatGPT Plus用户开放Sora。在此之前,该公司仅向一个包括错误信息和偏见领域专家在内的小型“红队”提供有限访问权限,以对模型进行对抗性测试。公司还将Sora分享给一小群创意专业人士,包括视频制作者和艺术家,以征求其在创意领域的实用性反馈。2025年2月,OpenAI宣布计划将Sora整合到ChatGPT中,允许用户通过聊天机器人生成Sora视频。

Sora 2

Sora 2于2025年9月30日发布,同时推出iOS应用,两个月后推出Android应用。该模型生成的所有视频均带有可见的移动水印,以防止工具被滥用。前一版本的Sora也添加了安全水印,以便观众区分真实与虚构内容。2025年10月7日,404 Media报道称,能够从Sora 2视频中移除水印的第三方程序已广泛出现。多家媒体,如《连线》杂志,指出Sora 2应用在风格和功能上与TikTok明显相似。

停用

2026年3月24日,OpenAI在X上宣布将停用Sora的移动应用和API。Sora应用于2026年4月26日关闭,API计划于2026年9月24日关闭。OpenAI与迪士尼的合作关系也即将结束,该合作包括允许在Sora中使用迪士尼角色的许可协议。这一决定促使英国科技新闻网站The Register将OpenAI称为“产品杀手”,效仿了Google、Amazon Web Services、Broadcom、Cloud Software Group和Netscape等其他科技公司的做法。

OpenAI在关闭通知中未说明停用Sora的具体原因。围绕此次停用出现的报道将该决定与计算资源短缺、成本压力以及向核心企业产品的更广泛转型联系起来。在公开发布后,Sora的全球用户数峰值约为一百万,随后降至不足五十万,而由于视频生成的计算需求,该服务运营成本估计为每天一百万美元。

法律监管

2024年11月,一组测试人员在Hugging Face上泄露了Sora访问的API密钥,并发布宣言称他们是在抗议Sora被用于“艺术洗白”。泄露公开三小时后,OpenAI撤销了所有访问权限,并表示“数百名艺术家”参与了开发,“参与是自愿的”。

在发布时,Sora 2默认允许使用受版权保护的内容,除非版权所有者联系OpenAI以限制其内容在该平台上的生成。2025年10月3日,OpenAI表示Sora 2的未来更新将赋予版权所有者对受版权保护内容生成的“更精细控制”,但公司未说明是否会删除现有内容。10月6日,MPA主席批评了OpenAI在Sora 2上的版权处理方式。

2025年12月11日,华特迪士尼公司宣布将在三年许可协议中向OpenAI投资10亿美元,允许Disney+用户生成Sora 2中超过200个受版权保护的角色。这些角色包括迪士尼动画、皮克斯、漫威影业和星球大战中的角色。

能力与局限

Sora背后的技术是DALL-E 3技术的改编版本。据OpenAI称,Sora是一种扩散变换器,即以一个变换器作为去噪器的去噪潜扩散模型。视频通过在潜空间中对3D“补丁”进行去噪生成,然后由视频解压缩器转换为标准空间。训练数据通过重新标注得到增强,即使用视频转文本模型为视频生成详细说明。

OpenAI使用公开视频以及为此获得许可的受版权保护视频来训练模型,但未透露视频的数量或确切来源。发布时,OpenAI承认了Sora的一些不足,包括其在模拟复杂物理、理解因果关系以及区分左右方面的能力有限。OpenAI还表示,按照公司现有的安全实践,Sora将限制涉及性、暴力、仇恨或名人形象的文本提示,以及包含现有知识产权的内容。

Sora研究员Tim Brooks表示,该模型仅凭数据集就学会了创建3D图形,而另一位Sora研究员Bill Peebles则表示,该模型模拟复杂物理的能力有限。这些局限是早期生成式AI视频模型的典型特征,此类模型往往在时间一致性和物理真实性方面存在困难。

影响与遗产

Sora的发布标志着生成式AI的一个重要里程碑,展示了深度学习模型根据文本提示生成连贯视频内容的潜力。其快速普及和随后的停用凸显了扩展此类计算密集型模型的挑战。Sora 2整合社交媒体功能反映了一种更广泛的趋势,即AI工具融入社区和分享能力,类似于TikTok等平台。

Sora的关闭,加上其高昂的运营成本和不断下降的用户数量,引发了对独立AI视频生成服务可持续性的质疑。这一决定也被拿来与其他停用产品的科技公司(如Google和Amazon Web Services)进行比较。尽管存在时间短暂,Sora仍影响了文本转视频技术的后续发展,并为关于版权、水印以及AI生成内容伦理使用的持续辩论做出了贡献。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-video·openai·generative-ai·artificial-intelligence
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史