OpenAI Sora是OpenAI开发的一款文本转视频模型及社交媒体应用。该模型利用人工智能,根据提示生成短视频片段,并可扩展已有的短视频。2024年2月,OpenAI向公众预览了其输出示例,第一代Sora于2024年12月面向美国和加拿大的ChatGPT Plus和ChatGPT Pro用户公开发布。
第二代Sora于2025年9月底面向美国和加拿大的部分用户发布。Sora 2将社交媒体功能整合到应用中。该应用于2026年4月26日关闭,应用程序编程接口(API)计划于2026年9月24日停止服务,标志着整个Sora人工智能品牌的终结。
背景
在Sora之前,已有多种能够从文本生成视频的模型被开发出来,包括Meta的Make-A-Video、Runway的Gen-2和Google Veo。Sora背后的公司OpenAI已于2023年9月发布了其DALL-E文本转图像模型的第三代DALL-E 3。Sora的开发借鉴了生成式人工智能和深度学习领域的进展,特别是图像生成中使用的扩散模型技术。
历史
首次发布
开发Sora的团队以日语词汇“天空”(意为“天空”)命名,以象征其“无限的创造潜力”。2024年2月15日,OpenAI首次预览Sora,发布了多段其生成的高清视频片段,包括一辆SUV行驶在山间公路、一只有烛光旁的“毛茸茸的小怪兽”动画、两人在东京雪中行走的场景,以及模拟加州淘金热的历史片段。OpenAI表示,该模型能够生成长达一分钟的视频。公司随后发布了一份技术报告,重点介绍了训练该模型所采用的方法。OpenAI首席执行官山姆·奥特曼还在Twitter上发布了一系列回应,通过Sora生成的视频回复用户的提示。
截至2024年12月9日,OpenAI已将Sora逐步向美国及加拿大地区的ChatGPT Pro和ChatGPT Plus用户开放。在此之前,该公司仅向一小部分“红队”提供了有限的访问权限,这些成员包括虚假信息和偏见领域的专家,用于对该模型进行对抗性测试。公司还将Sora分享给一小群创意专业人士,包括视频制作者和艺术家,以寻求关于其在创意领域实用性的反馈。2025年2月,OpenAI宣布计划将Sora整合到ChatGPT中,允许用户通过聊天机器人直接生成Sora视频。
Sora 2
Sora 2于2025年9月30日发布,同期推出iOS应用,安卓应用则于两个月后上线。该模型生成的所有视频均带有可见的动态水印,以防止滥用该工具。之前的Sora版本也增加了安全水印,以便观看者区分真实内容和虚构内容。2025年10月7日,404 Media报道称,可去除视频水印的第三方程序随着普及。多家媒体,如《连线》杂志,指出Sora 2应用在外观和功能上明显类似TikTok。
停运
2026年3月24日,OpenAI在X上宣布将停止Sora在移动应用和API中的使用。Sora应用于2026年4月26日关闭,而API计划于2026年9月24日关闭。OpenAI与迪士尼的合作关系(包括一项允许在Sora中使用迪士尼角色的许可协议)也将终止。这一决定促使英国科技新闻网站The Register将OpenAI称为“产品杀手”,效仿了Google、Amazon Web Services、Broadcom、Cloud Software Group和Netscape等其他科技公司的做法。
OpenAI在关闭通知中未提供关闭Sora的具体原因。关于此次中止的相关报道将这一决定与计算资源短缺、成本压力以及公司向核心企业业务更广泛转移的宏观方向相关联。自公开上线以来,Sora的全球用户数峰值约为100万,随后跌落至不到50万,而由于视频生成的计算需求,该服务每天的运营成本预估为100万美元。
法律监管
2024年11月,一群测试人员在一个开源平台上泄露了Sora访问的API密钥,并发布宣言,称他们是为了抗议Sora被用于“艺术洗白”。OpenAI在泄露公开后三小时内撤销了所有访问权限,并表示“数百名艺术家”参与优化了模型开发,且“参与是自愿的”。
在Sora发布时,Sora 2默认允许受版权保护的内容,除非版权持有者主动联系OpenAI限制其内容在平台上的生成。2025年10月3日,OpenAI表示未来对Sora 2的更新将赋予版权持有者“更精细的控制”,但公司尚未说明现有内容是否会移除。2025年10月6日,MPA主席批评了OpenAI在版权问题上的处理方式、基于Sora 2的做法。
2025年12月11日,华特迪士尼公司宣布将向OpenAI投资10亿美元,签订一项为期三年的许可协议,允许Disney+用户使用Sora 2生成其超过200个受版权保护的角色,其中包括Disney Animation、Pixar、Marvel Studios和StarWars旗下的角色。
能力与局限
Ora背后的技术是对DALL-E 3技术的适配。据OpenAI介绍,Sora是一种扩散Transformer,即一种去噪潜在扩散模型,其中的去噪器为一个Transformer。视频在潜在空间中通过对3D“块”进行去噪生成,然后通过视频解压器转换到标准空间。模型采用重字幕技术,利用视频文本转换模型为视频生成详细字幕,从而增强训练数据。
OpenAI使用公开视频以及为此授权许可的受版权保护视频对该模型进行训练,但未透露视频的具体数量或确切来源。从发布开始,OpenAI承认了Sora的一些局限性,包括模拟复杂物理效果、理解因果以及区分左右的能力有限。OpenAI还表示,为了遵循公司现有的安全做法,Sora将限制提示词涉及性、暴力、仇恨或因名人形象的内容,以及包含现有知识产权的内容。
Sora研究员蒂姆·布鲁克斯表示,该模型仅从数据集中自学掌握了三维图形的生成方法,而另一位研究员比尔·皮布尔斯指出,模型的能力来源于训练数据和计算规模的扩展,这与机器学习和神经网络研究的总体趋势一致。