Sora é um sistema de geração de texto para vídeo desenvolvido pela OpenAI que converte descrições em linguagem natural em clipes de vídeo curtos. A OpenAI apresentou o modelo pela primeira vez em fevereiro de 2024 com um conjunto de vídeos de amostra altamente polidos, enquadrando-o não apenas como uma ferramenta criativa, mas como um passo inicial em direção a um "simulador de mundo" de propósito geral, capaz de modelar interações físicas, movimento de câmera e permanência de objetos ao longo do tempo. O modelo foi disponibilizado ao público por meio de um aplicativo autônomo, o Sora, lançado em dezembro de 2024 para assinantes pagantes do ChatGPT, antes de uma distribuição mais ampla em 2025.
Arquitetura
O Sora combina ideias de modelos de difusão e da arquitetura transformador. Em vez de operar em grades de pixels de resolução fixa, a OpenAI descreveu o Sora como tratando o vídeo como sequências de "patches" de espaço-tempo, uma representação destinada a permitir que o modelo lide com durações, resoluções e proporções de aspecto variadas dentro de um único sistema. O treinamento, segundo relatos, utilizou grandes volumes de dados de vídeo, embora a OpenAI não tenha divulgado a composição ou o tamanho exato do conjunto de dados, um afastamento dos relatórios técnicos mais detalhados que a empresa publicou para sistemas anteriores.
Capacidades e limitações
No lançamento, o Sora podia gerar clipes de até aproximadamente um minuto a partir de um texto de instrução, e versões posteriores adicionaram edição de imagem para vídeo e de vídeo para vídeo, permitindo que os usuários estendessem, remixassem ou combinassem filmagens existentes. Vídeos de demonstração mostraram cenas multtomadas coerentes, movimento de câmera simulado e aparência consistente dos personagens entre os quadros, capacidades muito além dos sistemas anteriores de geração de texto para vídeo. A OpenAI também reconheceu fraquezas persistentes: o modelo tinha dificuldades com física precisa (objetos passando uns através dos outros, causalidade inconsistente), raciocínio espacial de granularidade fina e representação precisa de ações complexas, como movimentos esportivos específicos.
Recepção e a era do aplicativo
O Sora chegou a um campo de geração de vídeo cada vez mais competitivo, ao lado do Veo do Google DeepMind, do Kling da Kuaishou e do Seedance da ByteDance, cada um iterando rapidamente ao longo de 2024 e 2025. Avaliações independentes e comparações da comunidade em arenas que classificam modelos de vídeo colocaram o Sora entre os sistemas líderes, sem uma liderança clara e estável, à medida que os concorrentes lançavam atualizações em escalas de tempo semelhantes. A Runway, pioneira anterior na geração de vídeo, enfrentou concorrência intensificada quando grandes laboratórios entraram diretamente no espaço.
O próprio aplicativo Sora se destacou por um feed social, no estilo TikTok, de clipes gerados por IA, com um recurso de remix, uma escolha de design que gerou tanto engajamento quanto críticas. Comentaristas e detentores de direitos levantaram preocupações sobre a facilidade de gerar vídeos com personagens protegidos por direitos autorais e figuras públicas, levando a OpenAI a adicionar mecanismos de exclusão para detentores de direitos e controles de semelhança para indivíduos nomeados após reclamações iniciais, inclusive de agências de talentos. O debate mais amplo ecoou disputas já em andamento sobre IA e direitos autorais na geração de texto e imagem, e adicionou uma dimensão específica de vídeo às preocupações sobre deepfakes e mídia sintética, dada a capacidade da tecnologia de retratar pessoas e eventos de aparência real que nunca aconteceram.
O lançamento do Sora também intensificou o debate público sobre as implicações trabalhistas e da indústria criativa do vídeo generativo de alta fidelidade, particularmente na produção de conteúdo para cinema, publicidade e mídia social, onde o custo de produzir clipes de vídeo curtos caiu drasticamente para qualquer pessoa com acesso à ferramenta. Sam Altman, diretor executivo da OpenAI, posicionou o Sora e seus sucessores como passos em direção a uma modelagem de mundo baseada em vídeo mais geral, um enquadramento conectado ao interesse de pesquisa mais amplo em modelos de mundo como um caminho para sistemas de IA mais capazes, embora a extensão em que o Sora constitui compreensão física genuína versus reprodução sofisticada de padrões permanecesse disputada entre pesquisadores.