Luma AI(旧称Luma Labs)は、カリフォルニア州サンフランシスコに拠点を置く生成人工知能企業である。同社は、主に消費者向けスマートフォンアプリやウェブプラットフォームを通じて、動画および3Dコンテンツの生成・編集のためのモデルとアプリケーションを開発している。Luma AIは、2024年6月に公開されたテキストから動画を生成するモデル「Dream Machine」と、それ以前の3D生成ツール「Genie」で最もよく知られている。同社はGenerative AIの広範な分野で事業を展開しており、OpenAIのSoraやGoogle DeepMindのVeoなどの他のテキストから動画を生成するシステムと競合している。
Luma AIの製品は、Deep learningおよびNeural networkアーキテクチャの進歩に基づいており、現実的なモーション合成とプロンプトベースの創造性に焦点を当てている。同社のツールにより、ユーザーはテキスト記述や静止画像から短い動画クリップを生成したり、写真から3Dモデルを作成したりすることができる。初期リリース以来、Luma AIはそのモーションキャプチャの品質と、トレーニングデータの透明性をめぐる法的・倫理的問題で注目を集めている。
歴史
Luma AIは2021年にAlex YuとAmit Jainによって設立された。神経レンダリング研究に従事していたYuと、元AppleエンジニアのJainは、フォトリアリスティックな3D再構築に焦点を当てて会社を立ち上げた。2022年、Luma AIは「Luma」というスマートフォンアプリを発表した。このアプリはMachine learningを使用して、電話のカメラで現実世界の物体や空間をスキャンし、高品質の3Dモデルを生成するものだった。同社はその後、テキストプロンプトや画像から3Dアセットを生成できるモデル「Genie」を用いた生成型3D作成へと軸足を移した。
2024年6月、Luma AIはテキストから動画を生成するモデル「Dream Machine」を6月12日に公開した。このリリースは、同社のXアカウントでサンプル動画とともに発表された。数日以内に、ソーシャルメディア上のユーザーは、Midjourneyの画像を再現したDream Machine動画、『真珠の耳飾りの少女』などの有名な芸術作品をアニメーション化した動画、Dogeや distracted boyfriend などのインターネットミームのモーション版を生成した動画を共有した。あるユーザーが作成した架空のアニメ映画『Monster Camp』の予告編は、Luma AIがXで再投稿したが、ユーザーからは『モンスターズ・インク』シリーズの視覚スタイルを模倣し、マイク・ワゾウスキに似たキャラクターが含まれているとの批判が寄せられた。エジプトを舞台にしたピクサー風アニメーションを描いた、Ellenor Argyropoulos監督による別の動画は、バイラルとなった。
2024年末から2025年初頭にかけて、Luma AIは製品ラインを拡大し、Dream Machineの更新版をリリースし、2025年1月にはRay2動画生成モデルを追加した。同社はまた、他のAI企業と提携し、多額の資金調達を受けて、評価額は数億ドルに達すると推定されているが、具体的な数字は公には確認されていない。
Dream Machine
Dream Machineは、Luma AIによって開発されたテキストから動画を生成するモデルである。ユーザーが提供したプロンプトまたは静止画像に基づいて、短い動画クリップを生成する。このモデルは、Large language modelシステムで使用されるものと同様のトランスフォーマーベースのアーキテクチャを使用して構築されたが、視覚的な時間的生成に適合させたものである。2024年6月時点で、Dream Machineによって生成された動画は、長さ5秒、解像度1360×752ピクセルだった。ユーザーはGoogleアカウントでサインアップし、プロンプトを入力するか静止画像をアップロードして生成を開始できた。
このシステムは、動画を生成する前に、独自の大規模言語モデルに基づいてユーザーのプロンプトを内部的に変更する。ユーザーは無料で限られた数の動画を作成でき(1日10本、合計30本の無料動画)、有料のサブスクリプションプランも選択できた。Standard、Pro、Premierプランでは、それぞれ120本、400本、2,000本の動画が許可されており、同社のウェブサイトに記載されている。Luma AIは、リリース直後に動画延長、ディスカバリーページ、動画内編集などの機能を追加する計画を発表した。ウェブサイトはまた、Dream Machineがテキストの描写や一部の種類のモーションに苦労する可能性があることを認め、制限事項を明記していた。
機能と技術
Dream Machineは、動画データでトレーニングされた大規模トランスフォーマーモデルを活用して、一貫性のあるモーションシーケンスを生成する。初期の拡散ベースの動画モデルとは異なり、Dream Machineは、まず潜在フレームを予測し、次にそれらを最終解像度にアップスケールするマルチステージパイプラインを使用する。このモデルは、自然言語プロンプトと参照画像の両方を受け入れることができ、スタイル転送やオブジェクト操作を可能にする。例えば、ユーザーは人物の静止画をアップロードして歩かせたり、描かれたシーンを提供してカメラモーションを要求したりできた。
Luma AIはまた、Dream Machine用の開発者向けアプリケーションプログラミングインターフェース(API)をリリースしており、ローンチ直後には動画延長、ディスカバリー機能、動画内編集ツールを追加する計画を発表した。これらの更新は、カジュアルな使用から、広告、映画のプレビジュアライゼーション、コンセプトアートなどのプロフェッショナルおよびエンタープライズアプリケーションへの移行の意図を示唆している。基盤となる技術は、Transformer (architecture)アーキテクチャと、おそらく拡散ベースの手法の進歩に依存しているが、具体的なアーキテクチャの詳細は完全には開示されていない。
機能と特徴
Dream Machineは、テキストプロンプトまたは静止画像を入力として受け入れ、それらを現実的なモーションを備えた短い動画クリップに変換する。このモデルの強みは、キャラクターのジェスチャー、カメラパン、オブジェクトのインタラクションなど、一貫性のある動きを捉える能力にある。Luma AIはまた、テキストまたは画像プロンプトから3Dアセットを生成する3D生成モデル「Genie」も開発しており、これはゲーム開発や仮想環境を対象としている。
同社のスマートフォンアプリには、3Dキャプチャ用のオリジナルのLumaスキャンアプリと、その後の動画生成・編集用アプリが含まれる。ユーザーはウェブインターフェースを通じてDream Machineにアクセスでき、開発者向けAPIの導入も計画されている。Luma AIはまた、動画延長機能やディスカバリープラットフォームも実験しており、ユーザーはコミュニティ生成コンテンツを閲覧したりリミックスしたりできる。
基盤となる技術は、Transformer (architecture)モデルと拡散ベースの動画生成の組み合わせを使用しており、これは現代のGenerative AIシステムに共通するスタイルである。Luma AIはトレーニングデータの全詳細を開示しておらず、同社のドキュメントは、モデルがテキストレンダリングと複雑なモーションシーケンスに苦労することを指摘している。
評価
Dream Machineは、2024年6月のリリース時にメディアから大きな注目を集めた。ジャーナリストやユーザーは、以前に発表されたが広くリリースされていなかったテキストから動画を生成するモデルであるOpenAIのSoraや、もう1つの競合する動画生成モデルであるKlingと好意的に比較した。The VergeやTechRadarの批評家は、モーションのリアリズムと使いやすさを賞賛したが、トレーニングデータの不透明さについて懸念を表明した。TechRadarのMark Wilsonは、トレーニングデータに関する透明性の欠如が、個人的な創造的プロジェクト以外でのモデルの有用性に対する信頼を制限していると指摘した。Tom's GuideのRyan Morrisonは、Dream Machineを「プロンプト追従とモーション理解において最高のAI動画生成器の1つ」と呼んだが、プロフェッショナルグレードの出力にはまだ及ばないと述べた。Mashableに執筆したChase DiBennedettoは、Dream Machineで作成されたソーシャルメディア動画を「不気味なほど」現実的で、シュールまたは幻想的な設定を連想させると評した。
一部のセキュリティ研究者は、Dream Machineが現実的なディープフェイクの作成に使用される可能性があると指摘しており、同社は著作権とコンテンツの出所に関する継続的な監視に直面している。これらの懸念にもかかわらず、このツールはそのアクセシビリティと無料ティアの品質で広く賞賛された。
比較と文脈
Luma AIは、OpenAIのSora、Google DeepMindのVeo、その他のArtificial intelligence動画モデルを含む競争の激しい環境で事業を展開している。アクセスを制限している一部の競合他社とは異なり、Luma AIはDream Machineを早期に公開し、広範な実験を可能にした。消費者向けツールへの同社の焦点は、エンタープライズ向けの動画生成プラットフォームとは一線を画している。Luma AIはまた、クラウドプロバイダーと協力し、AWS Trainiumまたは同様のインフラストラクチャを使用しているが、具体的なハードウェアパートナーシップは公に詳細化されていない。
3D分野では、Luma AIのGenieは、OpenAIやNvidiaなどの企業のツールと競合しており、3Dアセットの迅速なプロトタイピングを必要とするクリエイターを対象としている。同社は、Neural networkレンダリングの高度な研究と実用的な創造的ツールの間の架け橋として自らを位置づけている。
関連項目
参考文献
2024年6月と2025年1月の公開レポートと会社発表に基づく。情報源には、The Verge、TechRadar、Tom's Guide、Mashableの報道が含まれる。