Sora 是由OpenAI开发的文本转视频生成系统,可将自然语言描述转换为短视频片段。OpenAI 于2024年2月首次预览该模型,并附带一组高度精良的示例视频,将其定位不仅是创意工具,更是迈向通用型“世界模拟器”的早期一步,该模拟器能够随时间建模物理交互、摄像机运动和物体持久性。该模型通过独立应用 Sora 向公众开放,于2024年12月面向付费 ChatGPT 订阅者推出,随后在2025年更广泛发布。
架构
Sora 结合了扩散模型和Transformer (architecture)架构的思想。OpenAI 描述 Sora 并非在固定分辨率的像素网格上操作,而是将视频视为时空“补丁”的序列,这种表示旨在让模型在单一系统中处理不同时长、分辨率和宽高比。据报道,训练利用了大量视频数据,但 OpenAI 未披露确切的数据集组成或规模,这与该公司为早期系统发布的更详细技术报告有所不同。
能力与局限
发布时,Sora 可从文本提示生成约一分钟长的片段,后续版本增加了图像转视频和视频转视频编辑功能,允许用户扩展、混剪或融合现有素材。演示视频展示了连贯的多镜头场景、模拟摄像机运动以及跨帧一致的角色外观,这些能力远超早期的文本转视频系统。OpenAI 也承认存在持续弱点:模型在精确物理(物体相互穿透、因果不一致)、细粒度空间推理以及准确描绘复杂动作(如特定运动技巧)方面仍有困难。
反响与应用时代
Sora 进入了一个竞争日益激烈的视频生成领域,与 Google DeepMind 的Veo、快手 的Kling以及字节跳动的Seedance同台竞技,这些系统在2024年和2025年期间均快速迭代。独立基准测试和社区在视频模型排名平台上的比较将 Sora 置于领先系统之列,但并无明确、稳定的优势,因为竞争对手也在相似时间尺度上发布更新。Runway作为早期视频生成先驱,在主要实验室直接进入该领域后面临更激烈的竞争。
Sora 应用本身因其类似 TikTok 的社交化 AI 生成片段信息流及混剪功能而引人注目,这一设计选择既带来了参与度也引发了批评。评论人士和权利持有人对生成包含受版权保护角色和公众人物的视频的便捷性表示担忧,促使 OpenAI 在早期投诉(包括来自人才机构的投诉)后,为权利持有人添加了退出机制,并为具名个人添加了肖像控制。更广泛的争论呼应了已在AI与版权文本和图像生成领域进行的争议,并为关于深度伪造和合成媒体的担忧增添了视频特定维度,因为该技术能够描绘看似真实但从未发生的人物和事件。
Sora 的发布还加剧了公众对高保真生成视频在劳动力和创意产业影响的辩论,特别是在电影、广告和社交媒体内容制作领域,任何能使用该工具的人制作短视频内容的成本大幅下降。Sam Altman作为 OpenAI 的首席执行官,将 Sora 及其后续版本定位为迈向更通用的基于视频的世界建模的步骤,这一框架与世界模型作为通往更强大 AI 系统路径的更广泛研究兴趣相关,尽管 Sora 在多大程度上构成真正的物理理解而非复杂的模式复制,在研究人员中仍存在争议。