Soraは、OpenAIによって開発されたText-to-video generation生成システムであり、自然言語の記述を短いビデオクリップに変換する。OpenAIは2024年2月に、高度に磨き上げられたサンプル動画のセットとともにこのモデルを初めて公開し、単なる創造的ツールとしてだけでなく、物理的相互作用、カメラの動き、時間経過にわたる物体の永続性をモデル化できる汎用の「世界シミュレーター」への初期段階として位置づけた。このモデルは、2024年12月に有料のChatGPT加入者向けにスタンドアロンアプリ「Sora」として公開され、その後2025年に広く展開された。
アーキテクチャ
Soraは、拡散モデルとTransformer (architecture)アーキテクチャのアイデアを組み合わせている。固定解像度のピクセルグリッドで動作する代わりに、OpenAIはSoraをビデオを時空間「パッチ」のシーケンスとして扱うものと説明し、この表現により単一システム内で様々な長さ、解像度、アスペクト比を処理できるようにすることを意図していた。トレーニングは大量のビデオデータを用いて行われたと報告されているが、OpenAIは正確なデータセットの構成や規模を開示しておらず、これは同社が初期のシステムで発表したより詳細な技術報告書からの逸脱である。
機能と限界
発売時点で、Soraはテキストプロンプトから約1分までのクリップを生成でき、後のバージョンでは画像からビデオへの変換やビデオからビデオへの編集機能が追加され、既存の映像を延長、リミックス、またはブレンドできるようになった。デモ動画では、一貫性のあるマルチショットシーン、シミュレートされたカメラの動き、フレーム間でのキャラクターの外見の一貫性が示され、これらの能力は初期のText-to-video generationシステムをはるかに超えるものであった。OpenAIはまた、持続的な弱点も認めている:モデルは正確な物理(物体が互いを通り抜ける、因果関係の不整合)、細かい空間推論、特定のスポーツ動作などの複雑な行動の正確な描写に苦労した。
評価とアプリ時代
Soraは、Google DeepMindのVeo、KuaishouのKling、ByteDanceのSeedanceと並んで、ますます競争が激化するビデオ生成分野に登場し、各社は2024年から2025年にかけて急速に反復を重ねた。ビデオモデルをランク付けするアリーナでの独立したベンチマークやコミュニティ比較では、Soraは主要システムの一つに位置づけられたが、競合他社が同様のタイムスケールでアップデートをリリースしたため、明確で安定したリードはなかった。初期のビデオ生成の先駆者であるRunwayは、大手研究所がこの分野に直接参入したことで激化する競争に直面した。
Soraアプリ自体は、AI生成クリップのソーシャルでTikTok風のフィードとリミックス機能で注目され、そのデザイン選択は関与と批判の両方を引き出した。コメンテーターや権利保有者は、著作権で保護されたキャラクターや公人を描いたビデオを生成する容易さについて懸念を表明し、OpenAIは初期の苦情(タレントエージェンシーからのものを含む)を受けて、権利保有者向けのオプトアウトメカニズムと指名された個人向けの肖像管理を追加した。より広範な議論は、テキストと画像生成におけるAIと著作権をめぐって進行中の紛争を反映し、実際の人物や起こらなかった出来事をリアルに見せる技術の能力を考慮して、ディープフェイクと合成メディアに関する懸念にビデオ特有の次元を加えた。
Soraのリリースはまた、高忠実度の生成的ビデオが労働と創造産業に与える影響についての公の議論を激化させ、特に映画、広告、ソーシャルメディアコンテンツ制作において、ツールにアクセスできる人なら誰でも短いビデオコンテンツの制作コストが急落した。OpenAIの最高経営責任者であるSam Altmanは、Soraとその後継モデルをより一般的なビデオベースの世界モデリングへのステップとして位置づけ、これはより有能なAIシステムへの道としての世界モデルへの広範な研究関心と結びついているが、Soraが真の物理的理解を構成するのか、それとも洗練されたパターン再現に過ぎないのかという程度については、研究者の間で議論が続いている。