Traduit de l'anglais

Luma AI, anciennement Luma Labs, est une entreprise spécialisée dans l'IA générative basée à San Francisco, connue pour son modèle texte-vers-vidéo Dream Machine et le générateur 3D Genie, proposant des applications pour smartphones permettant de créer et d'éditer du contenu multimédia.

Luma AI, anciennement connu sous le nom de Luma Labs, est une entreprise d'intelligence artificielle générative basée à San Francisco, en Californie. L'entreprise développe des modèles et des applications pour générer et éditer des vidéos et du contenu 3D, principalement via des applications pour smartphone destinées aux consommateurs et des plateformes web. Luma AI est surtout connue pour son modèle texte-vers-vidéo Dream Machine, sorti en juin 2024, et pour son outil antérieur de génération 3D Genie. L'entreprise opère dans le domaine plus large de la génération d'IA, en concurrence avec d'autres systèmes texte-vers-vidéo tels que Sora d'OpenAI et Veo de Google DeepMind.

Les produits de Luma AI sont construits sur des avancées en apprentissage profond et en architectures de réseaux neuronaux, avec un accent sur la synthèse réaliste du mouvement et la créativité basée sur des invites. Les outils de l'entreprise permettent aux utilisateurs de générer de courts clips vidéo à partir de descriptions textuelles ou d'images fixes, ainsi que de créer des modèles 3D à partir de photographies. Depuis ses premières sorties, Luma AI a attiré l'attention pour la qualité de sa capture de mouvement et pour les questions juridiques et éthiques entourant la transparence de ses données d'entraînement.

Histoire

Luma AI a été fondée en 2021 par Alex Yu et Amit Jain. Yu, qui avait précédemment travaillé sur la recherche en rendu neuronal, et Jain, un ancien ingénieur d'Apple, ont lancé l'entreprise avec un accent sur la reconstruction 3D photoréaliste. En 2022, Luma AI a introduit une application pour smartphone appelée Luma, qui utilisait le apprentissage automatique pour scanner des objets et des espaces du monde réel avec la caméra d'un téléphone, produisant des modèles 3D de haute qualité. L'entreprise a ensuite pivoté vers la création 3D générative avec Genie, un modèle capable de générer des actifs 3D à partir d'invites textuelles ou d'images\

En juin 2024, Luma AI a sorti Dream Machine, un modèle texte-vers-vidéo, au public le 12 juin. La sortie a été annoncée sur le compte X de l'entreprise accompagnée de vidéos d'exemple. En quelques jours, des utilisateurs sur les réseaux sociaux ont partagé des vidéos Dream Machine qui recréaient des images de Midjourney, animaient des œuvres d'art célèbres telles que La Jeune Fille à la Perle, et produisaient des versions animées de mèmes internet comme Doge et le petit ami distrait. Une bande-annonce créée par un utilisateur pour un film d'animation fictif, Monster Camp, a été republiée par Luma AI sur X, suscitant des critiques d'utilisateurs qui disaient qu'elle copiait le style visuel de la franchise Monstres & Cie et incluait un personnage ressemblant à Mike Wazowski. Une autre vidéo, réalisée par Ellenor Argyropoulos, dépeignant une animation de style Pixar située dans l'Égypte ancienne, est devenue virale\

D'ici fin 2024 et début 2025, Luma AI a élargi sa gamme de produits, sortant des versions mises à jour de Dream Machine et ajoutant le modèle de génération vidéo Ray2 en janvier 2025. L'entreprise a également établi des partenariats avec d'autres entreprises d'IA et a reçu un financement significatif, atteignant une valorisation estimée à des centaines de millions de dollars, bien que des chiffres spécifiques n'aient pas été confirmés publiquement\

Dream Machine

Dream Machine est un modèle texte-vers-vidéo développé par Luma AI. Il génère de courts clips vidéo basés sur des invites fournies par l'utilisateur ou des images fixes. Le modèle a été construit en utilisant une architecture basée sur des transformeurs, similaire à celles utilisées dans les systèmes de grands modèles de langage, mais adaptée pour la génération visuelle temporelle. En date de juin 2024, les vidéos générées par Dream Machine duraient cinq secondes avec une résolution de 1360 par 752 pixels. Les utilisateurs pouvaient s'inscrire avec un compte Google et taper une invite ou télécharger une image fixe pour initier la génération\

Le système modifie en interne l'invite de l'utilisateur basé sur son propre grand modèle de langage avant de générer la vidéo. Les utilisateurs pouvaient créer un nombre limité de vidéos gratuitement - dix vidéos par jour, avec un total de trente vidéos gratuites - et avaient l'option de plans d'abonnement payants. Les plans Standard, Pro, et Premier permettaient 120, 400, et 2,000 vidéos, respectivement, comme décrit sur le site web de l'entreprise. Luma AI a déclaré des plans pour ajouter des fonctionnalités telles que l'extension de vidéos, une page de découverte, et l'édition en vidéo peu après la sortie. Le site web a également reconnu des limitations, notant que Dream Machine pouvait avoir du mal à dépeindre du texte et certains types de mouvement\

Capacités et technologie

Dream Machine exploite un modèle de transformeur à grande échelle entraîné sur des données vidéo pour générer des séquences de mouvement cohérentes. Contrairement aux modèles vidéo antérieurs basés sur la diffusion, Dream Machine utilise un pipeline multi-étapes qui prédit d'abord des trames latentes et les agrandit ensuite à la résolution finale. Le modèle peut accepter à la fois des invites en langage naturel et des images de référence, permettant un transfert de style et une manipulation d'objets. Par exemple, les utilisateurs pouvaient télécharger une image fixe d'une personne et demander au modèle de la faire marcher, ou fournir une scène peinte et demander un mouvement de caméra\

Luma AI a également sorti une interface de programmation d'applications (API)) conviviale pour les développeurs pour Dream Machine, avec des plans annoncés peu après le lancement pour ajouter l'extension de vidéos, une fonctionnalité de découverte, et des outils d'édition en vidéo. Ces mises à jour suggèrent une intention de passer au-delà de l'utilisation décontractée vers des applications professionnelles et d'entreprise, y compris la publicité, la prévisualisation de films, et l'art conceptuel. La technologie sous-jacente repose sur des avancées en architectures de transformeurs et possiblement des méthodes basées sur la diffusion, bien que des détails architecturaux spécifiques n'aient pas été entièrement divulgués\

Capacités et fonctionnalités

Dream Machine accepte des invites textuelles ou des images fixes comme entrée, les convertissant en de courts clips vidéo avec un mouvement réaliste. La force du modèle réside dans sa capacité à capturer un mouvement cohérent, y compris des gestes de personnages, des panoramiques de caméra, et des interactions d'objets. Luma AI a également développé Genie, un modèle de génération 3D, qui crée des actifs 3D à partir d'invites textuelles ou d'images orientés vers le développement de jeux et les environnements virtuels\

Les applications pour smartphone de l'entreprise incluent l'application originale de numérisation Luma pour la capture 3D et des applications ultérieures pour la génération et l'édition de vidéos. Les utilisateurs peuvent accéder à Dream Machine via une interface web, avec des plans pour introduire une API pour développeurs. Luma AI a également expérimenté avec des fonctionnalités d'extension de vidéos et une plateforme de découverte, permettant aux utilisateurs de parcourir et de remixer du contenu généré par la communauté\

La technologie sous-jacente utilise une combinaison de modèles de transformeurs et de génération vidéo basée sur la diffusion, un style commun parmi les systèmes modernes de génération d'IA. Luma AI ne divulgue pas les détails complets de ses données d'entraînement, et la documentation de l'entreprise note que le modèle a du mal avec le rendu de texte et les séquences de mouvement complexes\

Réception

Dream Machine a reçu une attention médiatique significative lors de sa sortie en juin ​​2024. Des journalistes et des utilisateurs l'ont comparé favorablement à Sora d'OpenAI, un modèle texte-vers-vidéo qui avait été annoncé plus tôt mais pas largement sorti, et à Kling, un autre modèle de génération vidéo concurrent. Des critiques sur The Verge et TechRadar ont loué le réalisme du mouvement et la facilité d'utilisation mais ont exprimé des préoccupations concernant l'opacité des données d'entraînement. Mark Wilson de TechRadar a noté que le manque de transparence sur les données d'entraînement limitait la confiance dans l'utilité du modèle au-delà de projets créatifs personnels. Ryan Morrison de Tom's Guide a appelé Dream Machine "l'un des meilleurs générateurs de vidéos IA pour le suivi d'invites et la compréhension du mouvement" mais a trouvé qu'il restait encore en deçà d'une sortie de qualité professionnelle. Écrivant pour Mashable, Chase DiBennedetto a décrit les vidéos sur les réseaux sociaux créées avec Dream Machine comme "étrangement" réalistes et évocatrices de décors surréalistes ou fantastiques\

Certains chercheurs en sécurité ont souligné que Dream Machine pourrait être utilisé pour créer des deepfakes réalistes, et l'entreprise fait face à un examen continu concernant le droit d'auteur et la provenance du contenu. Malgré ces préoccupations, l'outil a été largement loué pour son accessibilité et la qualité de son niveau gratuit\

Comparaisons et contexte

Luma AI opère dans un paysage concurrentiel qui inclut Sora d'OpenAI, Veo de Google DeepMind, et d'autres modèles vidéo d'intelligence artificielle. Contrairement à certains concurrents qui ont restreint l'accès, Luma AI a sorti Dream Machine au public tôt, permettant une expérimentation généralisée. L'accent de l'entreprise sur des outils destinés aux consommateurs le distingue des plateformes de génération vidéo orientées vers les entreprises. Luma AI collabore également avec des fournisseurs de cloud et utilise AWS Trainium ou une infrastructure similaire, bien que des partenariats matériels spécifiques n'aient pas été détaillés publiquement\

Dans l'espace 3D, Genie de Luma AI concurrence avec des outils de sociétés comme OpenAI et Nvidia, ciblant des créateurs qui ont besoin de prototypage rapide d'actifs 3D. L'entreprise se positionne comme un pont entre la recherche avancée en rendu de réseaux neuronaux et des outils créatifs pratiques\

Voir aussi

Références

Informations basées sur des reportages publics et des annonces d'entreprise de juin ​​2024 et janvier ​​2025. Les sources incluent une couverture médiatique de The Verge, TechRadar, Tom's Guide, et Mashable.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·text-to-video·artificial-intelligence-companies·3d-modeling
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique