Traducido del inglés

Un modelo de generación de texto a video desarrollado por OpenAI, presentado por primera vez en febrero de 2024 y lanzado como una aplicación de consumo independiente en diciembre de 2024, capaz de producir clips de video cortos y de alta fidelidad a partir de indicaciones en lenguaje natural.

Sora es un sistema de generación de texto a video desarrollado por OpenAI que convierte descripciones en lenguaje natural en clips de video cortos. OpenAI presentó por primera vez el modelo en febrero de 2024 con un conjunto de videos de muestra altamente pulidos, enmarcándolo no solo como una herramienta creativa, sino como un paso temprano hacia un "simulador de mundos" de propósito general capaz de modelar interacciones físicas, movimiento de cámara y permanencia de objetos a lo largo del tiempo. El modelo se puso a disposición del público a través de una aplicación independiente, Sora, lanzada en diciembre de 2024 para suscriptores de pago de ChatGPT antes de un despliegue más amplio en 2025.

Arquitectura

Sora combina ideas de los modelos de difusión y la arquitectura Transformer (architecture). En lugar de operar sobre cuadrículas de píxeles de resolución fija, OpenAI describió a Sora como un sistema que trata el video como secuencias de "parches" de espacio-tiempo, una representación destinada a permitir que el modelo maneje duraciones, resoluciones y relaciones de aspecto variables dentro de un solo sistema. El entrenamiento supuestamente se basó en grandes volúmenes de datos de video, aunque OpenAI no reveló la composición o el tamaño exacto del conjunto de datos, una desviación de los informes técnicos más detallados que la compañía publicó para sistemas anteriores.

Capacidades y limitaciones

En su lanzamiento, Sora podía generar clips de hasta aproximadamente un minuto de duración a partir de un aviso de texto, y versiones posteriores añadieron edición de imagen a video y de video a video, lo que permitía a los usuarios extender, remezclar o combinar material existente. Los videos de demostración mostraron escenas coherentes de múltiples tomas, movimiento de cámara simulado y apariencia consistente de los personajes entre fotogramas, capacidades muy superiores a los sistemas anteriores de texto a video. OpenAI también reconoció debilidades persistentes: el modelo tenía dificultades con la física precisa (objetos que se atraviesan entre sí, causalidad inconsistente), el razonamiento espacial de grano fino y la representación precisa de acciones complejas como movimientos deportivos específicos.

Recepción y la era de la aplicación

Sora llegó a un campo de generación de video cada vez más competitivo, junto con Veo de Google DeepMind, Kling de Kuaishou y Seedance de ByteDance, cada uno iterando rápidamente a lo largo de 2024 y 2025. Evaluaciones comparativas independientes y comparaciones comunitarias en arenas que clasifican modelos de video situaron a Sora entre los sistemas líderes sin una ventaja clara y estable, ya que los rivales lanzaron actualizaciones en escalas de tiempo similares. Runway, un pionero anterior en la generación de video, enfrentó una competencia intensificada una vez que los principales laboratorios entraron directamente en el espacio.

La aplicación Sora en sí fue notable por un feed social, similar a TikTok, de clips generados por IA con una función de remezcla, una elección de diseño que generó tanto participación como críticas. Comentaristas y titulares de derechos expresaron preocupaciones sobre la facilidad de generar video con personajes protegidos por derechos de autor y figuras públicas, lo que llevó a OpenAI a añadir mecanismos de exclusión voluntaria para titulares de derechos y controles de semejanza para individuos nombrados después de quejas tempranas, incluso de agencias de talentos. El debate más amplio hizo eco de disputas ya en curso sobre IA y derechos de autor en la generación de texto e imágenes, y añadió una dimensión específica del video a las preocupaciones sobre deepfakes y medios sintéticos, dada la capacidad de la tecnología para representar personas y eventos de apariencia real que nunca ocurrieron.

El lanzamiento de Sora también intensificó el debate público sobre las implicaciones laborales y de la industria creativa del video generativo de alta fidelidad, particularmente en la producción de contenido para cine, publicidad y redes sociales, donde el costo de producir contenido de video corto cayó drásticamente para cualquier persona con acceso a la herramienta. Sam Altman, director ejecutivo de OpenAI, posicionó a Sora y sus sucesores como pasos hacia un modelado de mundos basado en video más general, un marco conectado con el interés de investigación más amplio en modelos de mundo como un camino hacia sistemas de IA más capaces, aunque el grado en que Sora constituye una comprensión física genuina versus una reproducción sofisticada de patrones siguió siendo disputado entre los investigadores.

Categorías:generative-ai·video-generation·openai-models
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial