Soraは、大手人工知能研究機関であるOpenAIが開発したテキストから動画を生成するモデルおよびソーシャルメディアアプリである。生成的人工知能を用いて、このモデルはテキストプロンプトに基づいて短い動画クリップを生成し、既存の短い動画を延長することもできた。2024年2月、OpenAIはその出力例を一般公開し、2024年12月に米国とカナダのChatGPT PlusおよびChatGPT Proユーザー向けにSoraの初代バージョンが公開リリースされた。
Sora 2として知られる第2世代のSoraは、2025年9月末に米国とカナダの一部ユーザー向けにリリースされた。Sora 2はアプリにソーシャルメディア機能を統合した。このアプリは2026年4月26日にシャットダウンされ、アプリケーションプログラミングインターフェース(API)は2026年9月24日に廃止される予定であり、Sora AIブランド全体の終焉を迎えることとなる。
背景
Sora以前にも、MetaのMake-A-Video、RunwayのGen-2、Google Veoなど、テキストから動画を生成できるモデルがいくつか作成されていた。Soraの背後にある企業であるOpenAIは、2023年9月にDALL-Eテキストから画像を生成するモデルの3番目であるDALL-E 3をリリースしていた。これらの開発は、機械学習と深層学習における広範なトレンドの一部であり、ニューラルネットワークとトランスフォーマーがマルチモーダルタスクにますます適用されていた。
歴史
初回リリース
Soraを開発したチームは、その「無限の創造的可能性」を象徴するために、日本語の「空」という言葉にちなんで名付けた。2024年2月15日、OpenAIはSoraを初めてプレビューし、山道を走るSUV、ろうそくの隣にある「短くてふわふわしたモンスター」のアニメーション、雪の中を歩く東京の二人、カリフォルニアのゴールドラッシュの偽の歴史的映像など、同社が作成した高解像度動画の複数のクリップを公開した。OpenAIは、最大1分間の動画を生成できると述べた。同社はその後、モデルのトレーニングに使用された方法を強調した技術レポートを共有した。OpenAIのCEOであるサム・アルトマンも、Twitterユーザーのプロンプトに応じてSoraが生成した動画を一連のツイートで投稿した。
2024年12月9日時点で、OpenAIは米国とカナダのChatGPT ProおよびChatGPT Plusユーザー向けにSoraを段階的に一般公開していた。これ以前に、同社は誤情報やバイアスの専門家を含む少数の「レッドチーム」に限定的なアクセスを提供し、モデルに対する敵対的テストを実施していた。また、同社はビデオ制作者やアーティストを含む少数のクリエイティブ専門家グループとSoraを共有し、クリエイティブ分野での有用性についてフィードバックを求めた。2025年2月、OpenAIはユーザーがチャットボットからSora動画を生成できるようにすることで、SoraをChatGPTに統合する計画を発表した。
Sora 2
Sora 2は2025年9月30日に発表され、同時にiOSアプリがリリースされ、2か月後にはAndroidアプリもリリースされた。モデルによって生成されたすべての動画には、ツールの悪用を防ぐために、目に見える動く透かしが含まれている。以前のバージョンのSoraにも、視聴者が現実と架空のコンテンツを区別できるようにするための安全透かしが追加されていた。2025年10月7日、404 Mediaは、Sora 2の動画から透かしを除去できるサードパーティ製プログラムが普及していると報じた。Wired誌などの多くのメディアは、Sora 2アプリがスタイルと機能の点でTikTokと明らかに類似していると指摘している。
廃止
2026年3月24日、OpenAIはX上で、モバイルアプリとAPIの両方でSoraを廃止すると発表した。Soraアプリは2026年4月26日にシャットダウンされ、APIは2026年9月24日にシャットダウンされる予定である。ディズニーのキャラクターをSora内で使用できるようにするライセンス契約を含むOpenAIとディズニーのパートナーシップも終了を迎えていた。この決定により、英国のテクノロジーニュースサイトThe Registerは、Google、Amazon Web Services、Broadcom、Cloud Software Group、Netscapeなどの他のテクノロジー企業の後を追って、OpenAIを「プロダクトキラー」と評した。
OpenAIはシャットダウン通知でSora廃止の具体的な理由を明らかにしなかった。この廃止に関して浮上した報道は、この決定を計算リソースの不足、コスト圧力、そして中核的なエンタープライズ製品への広範なシフトに関連付けた。一般公開後、Soraの世界のユーザー数は約100万人でピークに達した後、50万人未満に減少し、一方で動画生成の計算需要により、サービスは1日あたり推定100万ドルの費用がかかっていた。
法的規制
2024年11月、Soraアクセス用のAPIキーが、Hugging Face上のテスターのグループによってリークされ、彼らはSoraが「アートウォッシング」に使用されていることに抗議していると述べたマニフェストを投稿した。OpenAIはリークが公開されてから3時間後にすべてのアクセスを無効にし、「何百人ものアーティスト」が開発を形作っており、「参加は任意である」と述べた。
Sora 2のリリース時点では、著作権所有者がプラットフォーム上でのコンテンツ生成を制限するためにOpenAIに連絡しない限り、著作権で保護されたコンテンツがデフォルトで許可されていた。2025年10月3日、OpenAIはSora 2の将来のアップデートで著作権所有者に著作権コンテンツの生成に対する「より詳細な制御」を提供すると述べたが、既存のコンテンツが削除されるかどうかは明言しなかった。2025年10月6日、MPAの会長はSora 2に関するOpenAIの著作権へのアプローチを批判した。
2025年12月11日、ウォルト・ディズニー・カンパニーは、3年間のライセンス契約でOpenAIに10億ドルを投資し、Disney+のユーザーがSora 2で200以上の著作権で保護されたキャラクターを生成できるようにすると発表した。これらのキャラクターには、ディズニー・アニメーション、ピクサー、マーベル・スタジオ、スター・ウォーズのキャラクターが含まれる。
機能と制限
Soraの背後にある技術は、DALL-E 3の背後にある技術の適応である。OpenAIによると、Soraは拡散トランスフォーマーであり、トランスフォーマーをデノイザーとして持つデノイジング潜在拡散モデルである。動画は、3D「パッチ」をデノイジングすることによって潜在空間で生成され、その後、ビデオデコンプレッサーによって標準空間に変換される。ビデオからテキストへのモデルを使用して動画の詳細なキャプションを作成することにより、トレーニングデータを拡張するためにリキャプションが採用されている。
OpenAIは、公開されている動画と、その目的のためにライセンスされた著作権で保護された動画を使用してモデルをトレーニングしたが、動画の数と正確な出所は明らかにしなかった。リリース時に、OpenAIはSoraのいくつかの欠点を認めた。これには、複雑な物理をシミュレートする能力、因果関係を理解する能力、左右を区別する能力が限られていることが含まれる。また、OpenAIは、同社の既存の安全慣行に従い、Soraは性的、暴力的、憎悪的、または有名人の画像、および既存の知的財産を特徴とするコンテンツのテキストプロンプトを制限すると述べた。
Soraの研究者であるティム・ブルックスは、モデルがデータセットだけから3Dグラフィックスを作成する方法を学習したと述べ、一方、同僚のSora研究者であるビル・ピーブルズは、モデルが光の伝わり方などの物理の特定の側面を学習したが、まだ完全に正確ではないと述べた。モデルのアーキテクチャは、大規模言語モデルの技術、例えばマルチヘッドアテンションや位置エンコーディングを活用して、テキストに類似した方法で視覚データを処理した。
評価と影響
2024年2月のSoraの初期プレビューは、大きな一般の関心とメディアの報道を生み出し、多くのコメンテーターがクリエイティブ産業を変革する可能性を強調した。しかし、このモデルは誤情報と著作権侵害に関する懸念も引き起こした。目に見える透かしは悪用を軽減するために導入されたが、Sora 2のリリース直後に透かし除去ツールが登場したことで、これらの取り組みは損なわれた。
Soraの廃止は賛否両論の反応を引き起こした。一部のユーザーは失望を表明し、他のユーザーは高い運用コストとAI動画生成の競争環境に言及した。シャットダウンは、企業が財務的または戦略的目標を満たさない製品を時折廃止するテクノロジー業界の広範なトレンドの一部と見なされた。
関連項目
参考文献
(指示に従い、外部リンクや参考文献は含まれていません。)