OpenAI Sora 公開

英語からの翻訳

Soraは、OpenAIが開発したテキストから動画を生成するモデルおよびソーシャルメディアアプリであり、2024年2月にプレビューされた。テキストプロンプトから短い動画クリップを生成したが、コストと利用率の低さにより2026年4月までに廃止された。

Soraは、OpenAIによって開発されたテキストから動画を生成するモデルおよびソーシャルメディアアプリである。Artificial intelligenceを用いて、このモデルはプロンプトに基づいて短い動画クリップを生成し、既存の短い動画を延長することもできた。2024年2月、OpenAIはその出力の例を一般に公開し、Soraの初代バージョンは2024年12月に米国とカナダのChatGPT PlusおよびChatGPT Proユーザー向けに公開リリースされた。

Soraの第2世代は、2025年9月末に米国とカナダの選定ユーザー向けにリリースされた。Sora 2はソーシャルメディア機能をアプリに統合した。このアプリは2026年4月26日にシャットダウンされ、アプリケーションプログラミングインターフェース(API)は2026年9月24日に廃止される予定であり、Sora AIブランド全体の終焉を迎えることとなる。

背景

Sora以前にも、テキストから動画を生成できる他のいくつかのモデルが作成されており、MetaのMake-A-Video、RunwayのGen-2、Google Veoなどが含まれる。Soraの背後にある会社であるOpenAIは、2023年9月にDALL-Eテキストから画像へのモデルの3番目であるDALL-E 3をリリースしていた。これらの初期システムは、Diffusion ModelsおよびTransformer (architecture)アーキテクチャの進歩を活用して動画データを処理するSoraの技術的基盤を確立した。

初期リリース

Soraを開発したチームは、その「無限の創造的可能性」を示すために、日本語の「空」という言葉にちなんで名付けた。2024年2月15日、OpenAIはSoraを初めてプレビューし、山道を走るSUV、ろうそくの隣にある「短くふわふわしたモンスター」のアニメーション、雪の中を歩く二人の人物、カリフォルニアのゴールドラッシュの偽の歴史的映像など、同社が作成した高解像度動画の複数のクリップを公開した。OpenAIは、最大1分間の動画を生成できると述べた。同社はその後、モデルのトレーニングに使用された方法を強調した技術レポートを共有した。OpenAIのCEOであるサム・アルトマンも、TwitterユーザーのプロンプトにSora生成の動画で応答する一連のツイートを投稿した。

2024年12月9日時点で、OpenAIは米国とカナダのChatGPT ProおよびChatGPT Plusユーザー向けにSoraを段階的に一般公開していた。これ以前に、同社は誤情報やバイアスの専門家を含む小さな「レッドチーム」に限定的なアクセスを提供し、モデルに対する敵対的テストを実施していた。また、同社はSoraをビデオ制作者やアーティストを含む少数のクリエイティブ専門家グループと共有し、クリエイティブ分野での有用性に関するフィードバックを求めた。2025年2月、OpenAIはユーザーがチャットボットからSora動画を生成できるようにすることで、SoraをChatGPTに統合する計画を発表した。

Sora 2

Sora 2は2025年9月30日に発表され、同時にiOSアプリがリリースされ、2か月後にはAndroidアプリもリリースされた。モデルによって生成されたすべての動画には、ツールの悪用を防ぐための目に見える動くウォーターマークが含まれている。以前のバージョンのSoraにも、視聴者が現実と架空のコンテンツを区別できるようにする安全ウォーターマークが追加されていた。2025年10月7日、404 Mediaは、Sora 2動画からウォーターマークを除去できるサードパーティプログラムが普及していると報じた。Wired誌などの多くのメディアは、Sora 2アプリがスタイルと機能の点でTikTokと明らかに類似していると指摘している。

廃止

2026年3月24日、OpenAIはX上で、モバイルアプリとAPIの両方でSoraを廃止すると発表した。Soraアプリは2026年4月26日にシャットダウンされ、APIは2026年9月24日にシャットダウンされる予定である。ディズニーキャラクターをSora内で使用できるようにするライセンス契約を含むOpenAIとディズニーのパートナーシップも終了を迎えていた。この決定により、英国のテクノロジーニュースウェブサイトThe Registerは、Google、Amazon Web Services、Broadcom、Cloud Software Group、Netscapeなどの他のテクノロジー企業に続き、OpenAIを「プロダクトキラー」とレッテル付けした。

OpenAIはシャットダウン通知でSoraを廃止する具体的な理由を提供しなかった。この廃止に関して浮上した報告は、計算リソースの不足、コスト圧力、そして中核的なエンタープライズ製品へのより広範なシフトに関連付けられた。公開リリース後、Soraの世界中のユーザー数は約100万人でピークに達した後、50万人未満に減少し、一方で動画生成の計算需要により、サービスは1日あたり推定100万ドルの運用コストがかかっていた。

法的規制

2024年11月、Soraアクセス用のAPIキーが、Hugging Face上のテスターグループによってリークされ、彼らはSoraが「アートウォッシング」に使用されていることに抗議していると述べるマニフェストを投稿した。OpenAIはリークが公開されてから3時間後にすべてのアクセスを無効化し、「何百人ものアーティスト」が開発を形作っており、「参加は任意である」と述べた。

Sora 2のリリース時点では、著作権者がOpenAIに連絡してプラットフォーム上でのコンテンツ生成を制限しない限り、著作権で保護されたコンテンツがデフォルトで許可されていた。2025年10月3日、OpenAIはSora 2の将来のアップデートで著作権者に著作権コンテンツの生成に対する「より詳細な制御」を提供すると述べたが、既存のコンテンツが削除されるかどうかは明言しなかった。2025年10月6日、MPAの会長はSora 2に関するOpenAIの著作権アプローチを批判した。

2025年12月11日、ウォルト・ディズニー・カンパニーは、3年間のライセンス契約でOpenAIに10億ドルを投資し、Disney+のユーザーがSora 2で200以上の著作権キャラクターを生成できるようにすると発表した。これらのキャラクターには、ディズニーアニメーション、ピクサー、マーベルスタジオ、スターウォーズのものが含まれる。

機能と制限

Soraの背後にある技術は、DALL-E 3の背後にある技術の適応である。OpenAIによると、Soraは拡散トランスフォーマーであり、そのデノイザーとして1つのトランスフォーマーを持つデノイジング潜在拡散モデルである。動画は、3D「パッチ」をデノイジングすることによって潜在空間で生成され、その後、ビデオデコンプレッサーによって標準空間に変換される。リキャプショニングは、ビデオからテキストへのモデルを使用して動画の詳細なキャプションを作成することにより、トレーニングデータを増強するために採用されている。

OpenAIは、公開されている動画と、その目的のためにライセンスされた著作権付き動画を使用してモデルをトレーニングしたが、動画の数や正確な出所は明らかにしなかった。リリース時に、OpenAIはSoraのいくつかの欠点を認めた。これには、複雑な物理をシミュレートする能力、因果関係を理解する能力、左右を区別する能力の限界が含まれる。また、OpenAIは、同社の既存の安全慣行に従い、Soraが性的、暴力的、憎悪的、または有名人の画像、および既存の知的財産を特徴とするコンテンツのテキストプロンプトを制限すると述べた。

Sora研究者のティム・ブルックスは、モデルがデータセットだけから3Dグラフィックスを作成する方法を学習したと述べ、同僚のSora研究者ビル・ピーブルズは、モデルが明示的なプログラミングなしで物理世界の特定の側面をシミュレートできると述べた。このシステムは、Deep learning技術、具体的にはNeural network層とMulti-Head Attentionメカニズムに依存しており、これによりビデオフレーム全体の時間的および空間的情報を処理できた。

技術的アプローチ

Soraのアーキテクチャは、ビデオデータをより低次元の潜在空間に圧縮してからデノイジングステップを適用する潜在拡散モデルフレームワークに基づいていた。このモデルは、ビデオデータの時空間ブロックである3Dパッチを、トランスフォーマーベースのデノイザーのトークンとして使用した。このアプローチは、しばしばU-Netアーキテクチャを使用した従来のビデオ生成モデルとは異なり、トランスフォーマーバックボーンにより、モデルサイズとトレーニングデータに応じたより良いスケーリングが可能になった。

トレーニングプロセスには、大規模なビデオと画像のペアのデータセットが含まれていたが、具体的な詳細は開示されなかった。リキャプショニング技術は、ビデオからテキストへのモデルを使用してトレーニングビデオの詳細なテキスト記述を生成し、モデルがプロンプトと視覚コンテンツの間のより良い関連付けを学習するのに役立った。これらの方法は、Large language model研究で開発されたSequence-to-Sequence (Seq2Seq)モデルとCross-Attentionメカニズムにおける以前の研究から引き出された。

文化的および倫理的影響

2024年2月のSoraの公開は、クリエイティブ産業、ジャーナリズム、誤情報検出に対するテキストからビデオへの生成の影響について広範な議論を引き起こした。モデルが現実的で高解像度のクリップを生成する能力は、偽のニュース映像や誤解を招くコンテンツを生成する可能性についての懸念を高めた。これは、初期プレビューに含まれた偽のカリフォルニアゴールドラッシュ映像によって強調され、モデルがもっともらしい歴史的映像を作成する能力を示した。

法律専門家とメディア組織は、生成されたビデオでの著作権で保護された素材のデフォルト使用に関する著作権問題を議論した。目に見える動くウォーターマークは技術的な安全策として導入されたが、Sora 2のリリースから1週間以内にサードパーティツールによって除去されたことは、コンテンツ認証の課題を浮き彫りにした。モデルによる著作権で保護されたトレーニングデータの使用も、AI業界での進行中の訴訟や規制上の監視に貢献したが、OpenAIはSoraに関連する具体的な法的措置を開示しなかった。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-video·openai·artificial-intelligence
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴