Sora是一款由OpenAI开发的文本生成视频模型及社交媒体应用。该模型利用人工智能,根据提示生成短视频片段,并能扩展已有的短视频。2024年2月,OpenAI向公众预览了其输出示例,第一代Sora于2024年12月在美国和加拿大向ChatGPT Plus和ChatGPT Pro用户公开发布。
第二代Sora于2025年9月底向美国和加拿大的部分用户发布。Sora 2将社交媒体功能整合到应用中。该应用于2026年4月26日关闭,应用程序编程接口(API)计划于2026年9月24日停用,标志着整个Sora AI品牌的终结。
背景
在Sora之前,已有多种能够根据文本生成视频的模型问世,包括Meta的Make-A-Video、Runway的Gen-2和Google Veo。Sora背后的公司OpenAI已于2023年9月发布了其DALL-E文本生成图像模型系列的第三款DALL-E 3。Sora的开发建立在生成式AI的进展之上,特别是扩散模型和变换器,这些技术已被应用于图像和文本生成。OpenAI此前在大型语言模型和神经网络方面的工作为模型的架构提供了参考。
初始发布
开发Sora的团队以日语中“天空”一词为其命名,以象征其“无限的创作潜力”。2024年2月15日,OpenAI首次预览Sora,发布了多段由其生成的高清视频片段,包括一辆SUV沿山路行驶、一个“毛茸茸的小怪物”在蜡烛旁、两人在雪中穿行东京,以及加州淘金热的伪造历史影像。OpenAI表示其能够生成长达一分钟的视频。公司随后发布了一份技术报告,重点介绍了训练该模型的方法。OpenAI首席执行官Sam Altman还发布了一系列推文,用Sora生成的视频回应Twitter用户的提示。
截至2024年12月9日,OpenAI已逐步向美国和加拿大的ChatGPT Pro和ChatGPT Plus用户开放Sora。在此之前,公司仅向一个包括错误信息和偏见领域专家在内的小型“红队”提供有限访问权限,以对模型进行对抗性测试。公司还将Sora分享给一小群创意专业人士,包括视频制作者和艺术家,以征求其在创意领域的实用性反馈。2025年2月,OpenAI宣布计划将Sora整合到ChatGPT中,允许用户通过聊天机器人生成Sora视频。
Sora 2
Sora 2于2025年9月30日发布,同时推出iOS应用,两个月后推出Android应用。该模型生成的所有视频均带有可见的动态水印,以防止工具被滥用。Sora的先前版本也添加了安全水印,以便观众区分真实和虚构内容。2025年10月7日,404 Media报道称,能够去除Sora 2视频水印的第三方程序已变得普遍。许多媒体,如《连线》杂志,指出Sora 2应用在风格和功能上与TikTok明显相似。
停用
2026年3月24日,OpenAI在X上宣布将停用Sora的移动应用和API。Sora应用于2026年4月26日关闭,而API计划于2026年9月24日停用。OpenAI与迪士尼的合作关系也即将结束,该合作包括允许在Sora中使用迪士尼角色的许可协议。这一决定促使英国科技新闻网站The Register将OpenAI称为“产品杀手”,效仿了Google、Amazon Web Services、Broadcom、Cloud Software Group和Netscape等其他科技公司的做法。
OpenAI在关闭通知中未提供停用Sora的具体原因。围绕这一停用出现的报道将其归因于计算资源短缺、成本压力以及向核心企业产品的更广泛转变。自公开发布以来,Sora的全球用户峰值约为一百万,随后降至不足五十万,而由于视频生成的计算需求,该服务估计每天运营成本达一百万美元。
法律监管
2024年11月,一群测试人员在Hugging Face上泄露了Sora访问的API密钥,并发布宣言称他们抗议Sora被用于“艺术洗白”。OpenAI在泄露公开后三小时内撤销了所有访问权限,并表示“数百名艺术家”参与了开发,且“参与是自愿的”。
在Sora 2发布时,其默认允许生成受版权保护的内容,除非版权持有者联系OpenAI以限制其内容在平台上的生成。2025年10月3日,OpenAI表示Sora 2的未来更新将赋予版权持有者“更精细的控制权”,以管理受版权保护内容的生成,但公司未说明是否将删除现有内容。2025年10月6日,MPA主席批评了OpenAI在Sora 2上的版权处理方式。
2025年12月11日,华特迪士尼公司宣布将在三年许可协议中向OpenAI投资10亿美元,允许Disney+用户生成Sora 2上超过200个其受版权保护的角色。这些角色包括来自迪士尼动画、皮克斯、漫威影业和《星球大战》的角色。
能力与局限
Sora背后的技术是对DALL-E 3技术的改编。据OpenAI称,Sora是一种扩散变换器,一种以变换器作为去噪器的去噪潜扩散模型。视频通过在潜空间中去除3D“补丁”的噪声来生成,然后由视频解压缩器转换到标准空间。采用重新描述技术,通过使用视频到文本模型为视频生成详细描述,以增强训练数据。
OpenAI使用公开可用的视频以及为此目的授权的受版权保护视频来训练模型,但未透露视频的数量或确切来源。在发布时,OpenAI承认了Sora的一些缺陷,包括其在模拟复杂物理、理解因果关系以及区分左右方面的能力有限。OpenAI还表示,遵循公司现有的安全实践,Sora将限制涉及性、暴力、仇恨或名人形象的文本提示,以及包含现有知识产权的內容。
Sora研究员Tim Brooks表示,该模型仅从数据集中学会了创建3D图形,而同事研究员Bill Peebles则表示,模型生成连贯场景的能力是扩大训练数据和计算规模的结果。该模型的架构利用了多头注意力和位置编码来处理视频序列中的时间依赖关系。尽管具备这些能力,Sora在物理模拟和因果推理方面的局限性凸显了深度学习在视频生成中的挑战。
反响与影响
2024年2月Sora的预览引发了公众的广泛关注,并引发了关于AI生成视频影响的讨论。批评者担心其可能被滥用于错误信息、版权侵权以及创意专业人士的失业。支持者则强调其在民主化视频制作和促成新形式艺术表达方面的潜力。该模型从简单文本提示生成一分钟长视频的能力被视为生成式AI的重大进步,尽管其计算成本及最终停用引发了对这类模型可持续性的质疑。
在Sora 2发布后,社交媒体功能的整合引发了与TikTok等现有平台的比较,一些观察者指出其具有病毒式内容创作的潜力。Sora 2发布后不久出现的水印去除工具凸显了内容认证和数字取证方面的持续挑战。2026年Sora的停用,加上OpenAI向企业产品的转变,标志着其从面向消费者的AI工具显著撤退,反映了竞争激烈的AI领域中的更广泛行业趋势。