Luma Ray 2は、Luma AIが開発した生成的人工知能モデルであり、テキストまたは画像入力を短い動画クリップに変換するものである。2024年にリリースされ、機械学習に基づくメディア生成の進歩を表しており、クリエイティブなコンテンツ制作や視覚効果の分野での応用を対象としている。このモデルは深層学習の原理に基づいて構築されており、具体的には大規模言語モデルで一般的なニューラルネットワークアーキテクチャを、時空間データ生成に適応させて使用している。
Ray 2は、Lumaのより広範な製品スイートの一部として配布されており、ウェブプラットフォームまたはAPIを介してアクセス可能である。同社は主に映画製作者、広告主、デジタルアーティストを対象にマーケティングを行い、一貫した動きと映画的な美学を生み出す能力を強調している。リリース時点では、OpenAIやGoogle DeepMindなどの企業の類似ツールと競合しているが、LumaはRay 2を使いやすさと反復的なワークフロー向けの短いターンアラウンド時間に位置づけている。
アーキテクチャと技術
Ray 2の基盤となるアーキテクチャは、現代のAIモデルで標準となっているトランスフォーマーフレームワークに基づいている。テキストに焦点を当てたトランスフォーマーとは異なり、Ray 2はビデオフレームから派生した視覚トークンを処理し、それらの間の時間的依存関係を学習する。この設計により、モデルはオブジェクトの一貫性と物理的な動きを維持するシーケンスを、通常クリップあたり5〜10秒の短い時間で生成できる。
技術的な革新には、3次元の時空間に合わせた位置エンコーディングの使用や、空間的および時間的特徴の両方に注意を向けるマルチヘッドアテンション機構が含まれる。モデルは、他の本番規模の深層学習システムと同様に、安定したトレーニングのために残差接続とレイヤー正規化を採用している。初期バージョンはU-Netバックボーンに依存していたと報告されているが、Ray 2は純粋なトランスフォーマーベースのアプローチに移行し、計算量に応じたスケーリングを向上させた。
トレーニングにはかなりの計算リソースが必要であり、Amazon Web ServicesやGoogle Cloudなどのプロバイダーからのクラウドインフラストラクチャを利用した可能性が高いが、Lumaは特定のハードウェアパートナーシップを公に開示していない。モデルのパラメータ数は公式には確認されていないが、独立した分析による推定では数十億のパラメータがあり、同じ時代の生成的AIモデルと一致している。
機能と特徴
Ray 2はテキストからビデオのプロンプトを受け入れ、静止フレームをアニメーション化する画像からビデオへの生成もサポートしている。フォトリアリスティックなシーンから様式化されたアニメーションまで、さまざまなスタイルをレンダリングでき、カメラの動き、照明、被写体のアクションを指定するプロンプトを処理する。出力解像度は最大1080pをサポートし、フレームレートは24または30fpsで、プロフェッショナルなビデオ配信の標準である。
注目すべき機能は、キャラクターが動き、オブジェクトと相互作用するような複雑なアクションの処理であり、これは以前の生成モデルにとって歴史的に課題となっていた。Ray 2には、既存のクリップを拡張する機能も含まれており、ゼロから再起動することなく生成されたシーンの継続が可能である。これは、初期フレームが入力シーケンスとして機能するシーケンス間条件付けの形式を通じて実現される。
公開ベンチマークと定性的なレビューでは、Ray 2の滑らかな動きと視覚的忠実度の強みが強調されているが、極端なシーンや高度に鏡面反射するシーンでは時折苦労することがある。モデルはオープンソースではなく、アクセスはLumaの有料サブスクリプション層に制限されており、基本的な実験用の無料の限定層もある。
開発とリリースのタイムライン
Luma AIは、以前はニューラルラジアンスフィールド(NeRF)で知られていたが、前モデルであるDream Machineに続いて、2024年後半にRay 2を発表した。リリースには、動く車両やキャラクターの相互作用などの複雑なシーンを示す一連のデモビデオが伴っていた。同社はデータセットの構成を開示していないが、そのようなモデルで一般的な、公開されライセンスされたビデオデータの大規模なコーパスであると想定されている。
更新サイクルは毎月であり、アーティファクトの削減とプロンプトの忠実度の向上に焦点を当てた改善が行われている。注目すべき更新では、プロンプトでのより多くの言語のサポートが導入され、英語を超えて拡張され、世界的な人工知能実践者へのアクセシビリティが広がった。
比較と影響
第三者テストでは、Ray 2はOpenAIのSoraやGoogleのVeoと比較して好意的に評価されており、特にクリップあたりの価格と生成速度で優れている。Soraは生成時間が長かったが、Ray 2は最適化されたエンコーダー-デコーダー構造により高速な推論を提供し、推論にGroqや他の専門ハードウェアアクセラレータを使用している可能性がある。
Ray 2の導入は、機械学習コミュニティに影響を与え、高品質なビデオ生成がトランスフォーマーのみの設計で実現可能であることを示し、純粋な拡散ベースのアプローチから研究を方向転換させた。また、生成コンテンツの倫理的使用、著作権、大規模モデルのトレーニングの環境コストに関する議論にも拍車をかけており、これらのトピックはAI政策の議論で一般的である。
制限と将来の方向性
能力にもかかわらず、Ray 2には制限がある。クリップのみを生成し、長編のナラティブは生成せず、長いシーケンスでは一貫性を失う可能性がある。モデルは意図しない歪みを避けるために慎重なプロンプトエンジニアリングを必要とし、抽象的な概念や複数の同時アクションのストランドには効果が低い。Lumaはこれらの制約を認識し、開発を継続しており、公開ロードマップには、より長い時間、より高い解像度、LLMとの統合によるより自然な言語制御が含まれている。
進化する状況の中で、Ray 2はファインチューニングを可能にするオープンウェイトの代替品と競合しているが、Lumaはその道を追求していない。しかし、独自のアプローチにより、より速い反復サイクルが実現されている。2024年後半の時点で、Ray 2は商業的なAIビデオ生成の主要な例であり続け、インタラクティブメディアツールに対するユーザーの期待を形成している。