Sora是一款由OpenAI开发的文本转视频模型和社交媒体应用。该模型利用Artificial intelligence,根据提示生成短视频片段,并能扩展现有短视频。2024年2月,OpenAI向公众预览了其输出示例,第一代Sora于2024年12月在美国和加拿大向ChatGPT Plus和ChatGPT Pro用户公开发布。
第二代Sora于2025年9月底向美国和加拿大的部分用户发布。Sora 2在应用中集成了社交媒体功能。该应用于2026年4月26日关闭,应用程序编程接口(API)计划于2026年9月24日停止服务,标志着Sora AI品牌整体终结。
背景
在Sora之前,已有多种能够从文本生成视频的模型被开发出来,包括Meta的Make-A-Video、Runway的Gen-2和Google Veo。Sora背后的公司OpenAI于2023年9月发布了其DALL-E文本转图像模型的第三代DALL-E 3。这些早期系统为Sora奠定了技术基础,Sora利用了Diffusion Models和Transformer (architecture)架构的进展来处理视频数据。
初始发布
开发Sora的团队以日语中“天空”一词为其命名,以象征其“无限的创作潜力”。2024年2月15日,OpenAI首次预览Sora,发布了多段由其生成的高清视频片段,包括一辆SUV沿山路行驶、一个“毛茸茸的小怪物”在蜡烛旁动画、两人在雪中穿行东京,以及加州淘金热的伪造历史影像。OpenAI表示其能够生成长达一分钟的视频。随后,公司分享了一份技术报告,重点介绍了训练该模型的方法。OpenAI首席执行官Sam Altman还在推特上发布了一系列推文,用Sora生成的视频回应Twitter用户的提示。
截至2024年12月9日,OpenAI已逐步向美国和加拿大的ChatGPT Pro和ChatGPT Plus用户开放Sora。在此之前,公司仅向一小部分“红队”成员(包括错误信息和偏见领域的专家)提供有限访问权限,以对模型进行对抗性测试。公司还将Sora分享给一小群创意专业人士(包括视频制作者和艺术家),以征求其在创意领域的实用性反馈。2025年2月,OpenAI宣布计划将Sora整合到ChatGPT中,让用户通过聊天机器人生成Sora视频。
Sora 2
Sora 2于2025年9月30日发布,同时推出iOS应用,两个月后推出Android应用。该模型生成的所有视频均带有可见的移动水印,以防止工具被滥用。Sora的先前版本也添加了安全水印,以便观众区分真实和虚构内容。10月7日,404 Media报道称,能够去除Sora 2视频水印的第三方程序已变得普遍。许多媒体(如《连线》杂志)指出,Sora 2应用在风格和功能上与TikTok明显相似。
停止服务
2026年3月24日,OpenAI在X上宣布将停止Sora在移动应用和API中的服务。Sora应用于2026年4月26日关闭,而API计划于2026年9月24日关闭。OpenAI与迪士尼的合作关系(包括允许在Sora中使用迪士尼角色的许可协议)也即将结束。这一决定促使英国科技新闻网站The Register将OpenAI称为“产品杀手”,效仿了Google、Amazon Web Services、Broadcom、Cloud Software Group和Netscape等其他科技公司的做法。
OpenAI在关闭通知中未提供停止Sora的具体原因。围绕这一停用出现的报道将其与计算资源短缺、成本压力以及向核心企业产品的更广泛转变联系起来。自公开发布以来,Sora的全球用户数峰值约为一百万,随后降至不足五十万,而由于视频生成的计算需求,该服务估计每天运营成本达一百万美元。
法律监管
2024年11月,一组测试人员在Hugging Face上泄露了Sora访问的API密钥,并发布宣言称他们抗议Sora被用于“艺术洗白”。泄露公开三小时后,OpenAI撤销了所有访问权限,并表示“数百名艺术家”参与了开发,且“参与是自愿的”。
在发布时,Sora 2默认允许生成受版权保护的内容,除非版权持有者联系OpenAI限制其内容在平台上的生成。2025年10月3日,OpenAI表示Sora 2的未来更新将赋予版权持有者对受版权保护内容生成的“更精细控制”,但公司未说明是否会删除现有内容。10月6日,MPA主席批评了OpenAI在Sora 2中的版权处理方式。
2025年12月11日,华特迪士尼公司宣布将在三年许可协议中向OpenAI投资10亿美元,允许Disney+用户使用Sora 2生成其200多个受版权保护的角色。这些角色包括来自迪士尼动画、皮克斯、漫威影业和《星球大战》的角色。
能力与局限
Sora背后的技术是对DALL-E 3技术的改编。据OpenAI称,Sora是一种扩散变换器,即一种以变换器作为去噪器的去噪潜扩散模型。视频通过在潜空间中对3D“补丁”进行去噪生成,然后由视频解压缩器转换到标准空间。重述技术被用于增强训练数据,通过视频转文本模型为视频创建详细描述。
OpenAI使用公开可用的视频以及为此目的获得许可的受版权保护视频来训练模型,但未透露视频的数量或确切来源。发布时,OpenAI承认了Sora的一些缺陷,包括其模拟复杂物理、理解因果关系以及区分左右的能力有限。OpenAI还表示,遵循公司现有的安全实践,Sora将限制涉及性、暴力、仇恨或名人形象的文本提示,以及包含现有知识产权的内容。
Sora研究员Tim Brooks表示,该模型仅从数据集中学习了如何创建3D图形,而同事研究员Bill Peebles则表示,该模型无需显式编程即可模拟物理世界的某些方面。该系统依赖于Deep learning技术,包括Neural network层和Multi-Head Attention机制,使其能够处理视频帧中的时间和空间信息。
技术方法
Sora的架构基于潜扩散模型框架,该框架在应用去噪步骤之前将视频数据压缩到较低维度的潜空间。模型使用3D补丁(即视频数据的时空块)作为基于变换器的去噪器的令牌。这种方法不同于传统视频生成模型通常使用的U-Net架构,因为变换器主干使模型能够随规模大小和训练数据更好地扩展。
训练过程涉及大规模的视频和图像对数据集,但具体细节未公开。重述技术使用视频转文本模型为训练视频生成详细的文本描述,这有助于模型学习提示与视觉内容之间更好的关联。这些方法借鉴了Sequence-to-Sequence (Seq2Seq)模型和Cross-Attention机制的先前工作,这些机制是在Large language model研究中开发的。
文化与伦理影响
2024年2月Sora的亮相引发了关于文本转视频生成对创意产业、新闻业和错误信息检测影响的广泛讨论。该模型生成逼真高清片段的能力引发了对生成假新闻片段或误导性内容可能性的担忧。初始预览中包含的伪造加州淘金热影像凸显了这一点,展示了该模型创造可信历史影像的能力。
法律专家和媒体机构就生成视频中默认使用受版权保护材料的版权问题展开了辩论。可见的移动水印被引入作为技术保障,但在Sora 2发布一周内就被第三方工具去除,凸显了内容认证的挑战。该模型使用受版权保护的训练数据也加剧了AI行业中的持续诉讼和监管审查,尽管OpenAI未披露与Sora相关的具体法律行动。