Sora(文生视频模型)

译自英文

Sora是OpenAI开发的一款文本转视频模型及社交媒体应用,于2024年2月预览,2024年12月发布。它根据提示生成短视频,并于2026年停止服务。

Sora是由OpenAI开发的一款文本到视频模型及社交媒体应用,OpenAI是一家领先的人工智能研究机构。该模型利用生成式人工智能,根据文本提示生成短视频片段,并可扩展已有的短视频。2024年2月,OpenAI向公众预览了其输出示例,第一代Sora于2024年12月在美国和加拿大向ChatGPT Plus和ChatGPT Pro用户公开发布。

第二代Sora,即Sora 2,于2025年9月底向美国和加拿大的部分用户发布。Sora 2在应用中集成了社交媒体功能。该应用于2026年4月26日关闭,应用程序编程接口(API)计划于2026年9月24日停用,标志着Sora AI品牌整体的终结。

背景

在Sora之前,已有多种能够从文本生成视频的模型被创建,包括Meta的Make-A-Video、Runway的Gen-2和Google Veo。Sora背后的公司OpenAI已于2023年9月发布了DALL-E 3,这是其DALL-E文本到图像模型的第三代。这些发展是机器学习深度学习更广泛趋势的一部分,其中神经网络Transformer越来越多地应用于多模态任务。

历史

初始发布

开发Sora的团队以日语中“天空”一词为其命名,以象征其“无限的创造潜力”。2024年2月15日,OpenAI首次预览Sora,发布了多段由其创建的高清视频片段,包括一辆SUV行驶在山路上、一个“短毛怪物”在蜡烛旁的动画、两人在雪中行走于东京,以及加州淘金热的伪造历史影像。OpenAI表示,其能够生成长达一分钟的视频。该公司随后分享了一份技术报告,重点介绍了训练该模型所使用的方法。OpenAI首席执行官Sam Altman还发布了一系列推文,用Sora生成的视频回应Twitter用户的提示。

截至2024年12月9日,OpenAI已逐步向美国和加拿大的ChatGPT Pro和ChatGPT Plus用户公开发布Sora。在此之前,该公司仅向一个包括错误信息和偏见专家在内的小型“红队”提供有限访问权限,以对模型进行对抗性测试。该公司还与一小群创意专业人士(包括视频制作者和艺术家)分享了Sora,以寻求其在创意领域实用性的反馈。2025年2月,OpenAI宣布计划将Sora整合到ChatGPT中,允许用户通过聊天机器人生成Sora视频。

Sora 2

Sora 2于2025年9月30日发布,同时推出了iOS应用,两个月后推出了Android应用。该模型生成的所有视频均带有可见的动态水印,以防止工具被滥用。Sora的先前版本也添加了安全水印,以便观众区分真实和虚构内容。2025年10月7日,404 Media报道称,能够从Sora 2视频中移除水印的第三方程序已变得普遍。许多媒体,如《Wired》杂志,指出Sora 2应用在风格和功能上明显类似于TikTok。

停用

2026年3月24日,OpenAI在X上宣布,将停用Sora的移动应用和API。Sora应用于2026年4月26日关闭,而API计划于2026年9月24日关闭。OpenAI与迪士尼的合作关系(包括允许在Sora中使用迪士尼角色的许可协议)也即将结束。这一决定促使英国科技新闻网站The Register将OpenAI称为“产品杀手”,效仿了Google、Amazon Web ServicesBroadcom、Cloud Software Group和Netscape等其他科技公司的做法。

OpenAI在其关闭通知中未提供停用Sora的具体原因。关于此次停用的报道将其与计算资源短缺、成本压力以及向核心企业产品的更广泛转变联系起来。在公开发布后,Sora的全球用户数峰值约为100万,随后降至不足50万,而由于视频生成的计算需求,该服务估计每天运营成本为100万美元。

法律监管

2024年11月,一组测试人员在Hugging Face上泄露了Sora访问的API密钥,并发布了一份宣言,声称他们是在抗议Sora被用于“艺术洗白”。OpenAI在泄露公开后三小时内撤销了所有访问权限,并表示“数百名艺术家”参与了开发,且“参与是自愿的”。

在发布时,Sora 2默认允许受版权保护的内容,除非版权持有者联系OpenAI以限制其内容在平台上的生成。2025年10月3日,OpenAI表示,Sora 2的未来更新将赋予版权持有者对受版权保护内容生成的“更细粒度控制”,但该公司未说明是否会移除现有内容。2025年10月6日,MPA主席批评了OpenAI在Sora 2上的版权处理方式。

2025年12月11日,华特迪士尼公司宣布将在三年许可协议中向OpenAI投资10亿美元,允许Disney+用户生成Sora 2上超过200个受版权保护的角色。这些角色包括来自迪士尼动画、皮克斯、漫威影业和《星球大战》的角色。

能力与局限

Sora背后的技术是对DALL-E 3技术的改编。据OpenAI称,Sora是一种扩散Transformer,即一种以Transformer作为去噪器的去噪潜扩散模型。视频通过在潜空间中对3D“补丁”进行去噪生成,然后由视频解压缩器转换为标准空间。重新标注被用于增强训练数据,通过视频到文本模型为视频创建详细字幕。

OpenAI使用公开可用的视频以及为此目的获得许可的受版权保护视频来训练模型,但未透露视频的数量或确切来源。在发布时,OpenAI承认了Sora的一些缺陷,包括其模拟复杂物理、理解因果关系以及区分左右的能力有限。OpenAI还表示,为遵守公司现有的安全实践,Sora将限制涉及性、暴力、仇恨或名人形象的文本提示,以及包含现有知识产权的内容。

Sora研究员Tim Brooks表示,该模型仅从数据集中学会了创建3D图形,而另一位Sora研究员Bill Peebles表示,该模型已学会某些物理方面,如光的传播方式,但尚未完全准确。该模型的架构利用了大型语言模型的技术,如多头注意力位置编码,以类似于文本的方式处理视觉数据。

反响与影响

Sora在2024年2月的初步预览引发了公众的广泛兴趣和媒体报道,许多评论者强调其改变创意产业的潜力。然而,该模型也引发了对错误信息和版权侵权的担忧。引入可见水印是为了减轻滥用,但Sora 2发布后不久出现的去水印工具削弱了这些努力。

Sora的停用引发了不同的反应。一些用户表示失望,而另一些用户则指出高昂的运营成本和AI视频生成的竞争格局。此次关闭被视为科技行业更广泛趋势的一部分,即公司有时会停用未达到财务或战略目标的产品。

参见

参考文献

(根据指示,不包含外部链接或参考文献。)

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-video·openai·generative-ai·discontinued-software
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史