Révélation d'OpenAI Sora

Traduit de l'anglais

Sora était un modèle de texte-vers-vidéo et une application de médias sociaux développés par OpenAI, présenté en avant-première en février 2024. Il générait de courts clips vidéo à partir de prompts textuels, mais a été abandonné en avril 2026 en raison de son coût et de sa faible utilisation.

Sora était un modèle texte-vers-vidéo et une application de médias sociaux développés par OpenAI. Grâce à l'intelligence artificielle, le modèle générait de courts clips vidéo à partir de prompts, et pouvait également prolonger des vidéos courtes existantes. En février 2024, OpenAI a présenté des exemples de ses sorties au public, avec la première génération de Sora rendue publique pour les utilisateurs de ChatGPT Plus et ChatGPT Pro aux États-Unis et au Canada en décembre 2024.

La deuxième génération de Sora a été publiée pour certains utilisateurs aux États-Unis et au Canada à la fin de septembre 2025. Sora 2 a intégré des fonctionnalités de médias sociaux dans l'application. L'application a été fermée le 26 avril 2026 et l'interface de programmation d'application (API) devrait être interrompue le 24 septembre 2026, marquant la fin de la marque Sora AI dans son ensemble.

Contexte

Plusieurs autres modèles capables de générer des vidéos à partir de texte avaient été créés avant Sora, notamment Make-A-Video de Meta, Gen-2 de Runway et Google Veo. OpenAI, l'entreprise derrière Sora, avait publié DALL-E 3, le troisième de ses modèles texte-vers-image DALL-E, en septembre 2023. Ces systèmes antérieurs ont établi les fondations techniques de Sora, qui a tiré parti des avancées dans les modèles de diffusion et les architectures transformers pour traiter les données vidéo.

Première publication

L'équipe qui a développé Sora l'a nommé d'après le mot japonais pour « ciel » afin de signifier son « potentiel créatif illimité ». Le 15 février 2024, OpenAI a d'abord présenté Sora en publiant plusieurs clips de vidéos haute définition qu'il avait créées, notamment un SUV roulant sur une route de montagne, une animation d'un « petit monstre duveteux » près d'une bougie, deux personnes marchant dans Tokyo sous la neige, et de fausses images historiques de la ruée vers l'or en Californie. OpenAI a déclaré qu'il était capable de générer des vidéos d'une durée allant jusqu'à une minute. L'entreprise a ensuite partagé un rapport technique mettant en évidence les méthodes utilisées pour entraîner le modèle. Le PDG d'OpenAI, Sam Altman, a également publié une série de tweets répondant aux prompts des utilisateurs de Twitter avec des vidéos générées par Sora.

À partir du 9 décembre 2024, OpenAI a progressivement rendu Sora disponible au public pour les utilisateurs de ChatGPT Pro et ChatGPT Plus aux États-Unis et au Canada. Avant cela, l'entreprise avait fourni un accès limité à une petite « équipe rouge », comprenant des experts en désinformation et en biais, pour effectuer des tests adverses sur le modèle. L'entreprise a également partagé Sora avec un petit groupe de professionnels créatifs, y compris des vidéastes et des artistes, pour obtenir des retours sur son utilité dans les domaines créatifs. En février 2025, OpenAI a annoncé son intention d'intégrer Sora dans ChatGPT en permettant aux utilisateurs de générer des vidéos Sora à partir du chatbot.

Sora 2

Sora 2 a été dévoilé le 30 septembre 2025, avec une application iOS en même temps, ainsi qu'une application Android deux mois plus tard. Toutes les vidéos générées par le modèle comportent un filigrane visible et animé pour empêcher une utilisation abusive de l'outil. La version précédente de Sora avait également ajouté un filigrane de sécurité pour permettre aux spectateurs de distinguer le contenu réel du contenu fictif. Le 7 octobre, 404 Media a rapporté que des programmes tiers capables de supprimer le filigrane des vidéos Sora 2 étaient devenus courants. De nombreux médias, comme le magazine Wired, ont noté que l'application Sora 2 est ouvertement similaire à TikTok dans son style et ses fonctionnalités.

Interruption

Le 24 mars 2026, OpenAI a annoncé sur X qu'il interrompait Sora à la fois dans l'application mobile et l'API. L'application Sora a été fermée le 26 avril 2026, tandis que l'API devrait être fermée le 24 septembre 2026. Le partenariat d'OpenAI avec Disney, qui comprenait un accord de licence permettant l'utilisation des personnages Disney dans Sora, arrivait également à son terme. Cette décision a poussé le site d'actualités technologiques britannique The Register à qualifier OpenAI de « tueur de produits », suivant les traces d'autres entreprises technologiques telles que Google, Amazon Web Services, Broadcom, Cloud Software Group et Netscape.

OpenAI n'a pas fourni de raison spécifique pour l'interruption de Sora dans son avis de fermeture. Les rapports qui ont émergé concernant cette interruption ont lié la décision à des pénuries de calcul, des pressions sur les coûts et un changement plus large vers des produits d'entreprise de base. Après son lancement public, les utilisateurs mondiaux de Sora ont atteint un pic d'environ un million avant de décliner à moins de 500 000, tandis que le service coûtait environ 1 million de dollars par jour à exploiter en raison des exigences computationnelles de la génération vidéo.

Réglementation légale

En novembre 2024, une clé API pour l'accès à Sora a été divulguée par un groupe de testeurs sur Hugging Face, qui ont publié un manifeste déclarant qu'ils protestaient contre l'utilisation de Sora pour du « blanchiment artistique ». OpenAI a révoqué tout accès trois heures après la divulgation publique et a déclaré que « des centaines d'artistes » ont façonné le développement et que « la participation est volontaire ».

Au moment de son lancement, Sora 2 permettait le contenu protégé par le droit d'auteur par défaut, à moins que les titulaires de droits ne contactent OpenAI pour restreindre la génération de leur contenu sur la plateforme. Le 3 octobre 2025, OpenAI a déclaré qu'une future mise à jour de Sora 2 donnerait aux titulaires de droits « un contrôle plus granulaire » sur la génération de contenu protégé, mais l'entreprise n'a pas précisé si le contenu existant serait supprimé. Le 6 octobre, le président de la MPA a critiqué l'approche d'OpenAI en matière de droit d'auteur avec Sora 2.

Le 11 décembre 2025, la Walt Disney Company a annoncé qu'elle investirait 1 milliard de dollars dans OpenAI, dans le cadre d'un accord de licence de trois ans, pour permettre aux utilisateurs de Disney+ de générer plus de 200 de ses personnages protégés par le droit d'auteur sur Sora 2. Ces personnages incluent ceux de Disney Animation, Pixar, Marvel Studios et Star Wars.

Capacités et limites

La technologie derrière Sora est une adaptation de celle derrière DALL-E 3. Selon OpenAI, Sora est un transformer de diffusion, un modèle de diffusion latente avec débruitage utilisant un transformer comme débruteur. Une vidéo est générée dans l'espace latent en débruitant des « patches » 3D, puis transformée en espace standard par un décompresseur vidéo. La recaptioning est utilisée pour augmenter les données d'entraînement en utilisant un modèle vidéo-vers-texte pour créer des légendes détaillées pour les vidéos.

OpenAI a entraîné le modèle en utilisant des vidéos publiquement disponibles ainsi que des vidéos protégées par le droit d'auteur sous licence à cette fin, mais n'a pas révélé le nombre ou la source exacte des vidéos. Lors de sa publication, OpenAI a reconnu certaines lacunes de Sora, notamment sa capacité limitée à simuler la physique complexe, à comprendre la causalité et à différencier la gauche de la droite. OpenAI a également déclaré que, conformément aux pratiques de sécurité existantes de l'entreprise, Sora restreindra les prompts textuels pour les images sexuelles, violentes, haineuses ou de célébrités, ainsi que le contenu présentant une propriété intellectuelle existante.

Le chercheur de Sora, Tim Brooks, a déclaré que le modèle avait appris à créer des graphiques 3D à partir de son ensemble de données seul, tandis que son collègue chercheur de Sora, Bill Peebles, a déclaré que le modèle pouvait simuler certains aspects du monde physique sans programmation explicite. Le système reposait sur des techniques de apprentissage profond incluant des couches de réseaux de neurones et des mécanismes de attention multi-têtes qui lui permettaient de traiter les informations temporelles et spatiales à travers les trames vidéo.

Approche technique

L'architecture de Sora était construite sur le cadre du modèle de diffusion latente, qui compresse les données vidéo dans un espace latent de dimension inférieure avant d'appliquer des étapes de débruitage. Le modèle utilisait des patches 3D, qui sont des blocs spatiotemporels de données vidéo, comme jetons pour le débruteur basé sur transformer. Cette approche différait des modèles de génération vidéo traditionnels qui utilisaient souvent des architectures U-Net, car le backbone transformer permettait une meilleure mise à l'échelle avec la taille du modèle et les données d'entraînement.

Le processus d'entraînement impliquait des ensembles de données à grande échelle de paires vidéo et image, bien que les détails spécifiques n'aient pas été divulgués. La technique de recaptioning utilisait un modèle vidéo-vers-texte pour générer des descriptions textuelles détaillées des vidéos d'entraînement, ce qui aidait le modèle à apprendre de meilleures associations entre les prompts et le contenu visuel. Ces méthodes s'inspiraient de travaux antérieurs sur les modèles séquence-à-séquence et les mécanismes de attention croisée développés dans la recherche sur les grands modèles de langage.

Impact culturel et éthique

La révélation de Sora en février 2024 a suscité une large discussion sur les implications de la génération texte-vers-vidéo pour les industries créatives, le journalisme et la détection de la désinformation. La capacité du modèle à produire des clips réalistes et haute définition a soulevé des préoccupations concernant le potentiel de génération de fausses actualités ou de contenu trompeur. Cela a été souligné par les fausses images de la ruée vers l'or en Californie incluses dans l'aperçu initial, qui démontraient la capacité du modèle à créer des images historiques plausibles.

Des experts juridiques et des organisations médiatiques ont débattu des questions de droit d'auteur entourant l'utilisation par défaut de matériel protégé dans les vidéos générées. Le filigrane visible et animé a été introduit comme une sauvegarde technique, mais son retrait par des outils tiers dans la semaine suivant la publication de Sora 2 a mis en évidence les défis de l'authentification du contenu. L'utilisation de données d'entraînement protégées par le droit d'auteur par le modèle a également contribué à des poursuites en cours et à un examen réglementaire dans l'industrie de l'IA, bien qu'OpenAI n'ait pas divulgué d'actions légales spécifiques liées à Sora.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·text-to-video·openai·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique