Sora는 OpenAI가 개발한 Text-to-video generation 생성 시스템으로, 자연어 설명을 짧은 비디오 클립으로 변환한다. OpenAI는 2024년 2월에 고도로 다듬어진 샘플 비디오 세트와 함께 이 모델을 처음 공개했으며, 단순한 창의적 도구가 아니라 물리적 상호작용, 카메라 움직임, 시간에 따른 객체 지속성을 모델링할 수 있는 범용 "세계 시뮬레이터"를 향한 초기 단계로 제시했다. 이 모델은 2024년 12월에 유료 ChatGPT 구독자를 위해 출시된 독립형 앱 Sora를 통해 대중에게 공개되었으며, 2025년에 더 넓은 범위로 확대되었다.
아키텍처
Sora는 확산 모델과 Transformer (architecture) 아키텍처의 아이디어를 결합한다. 고정 해상도 픽셀 그리드 대신, OpenAI는 Sora가 비디오를 시공간 "패치"의 시퀀스로 처리한다고 설명했으며, 이는 단일 시스템 내에서 다양한 지속 시간, 해상도, 화면 비율을 처리할 수 있게 하는 표현 방식이다. 훈련에는 대량의 비디오 데이터가 사용된 것으로 알려졌지만, OpenAI는 정확한 데이터 세트 구성이나 규모를 공개하지 않았으며, 이는 회사가 이전 시스템에 대해 발표한 더 상세한 기술 보고서와는 다른 접근이다.
기능 및 한계
출시 당시 Sora는 텍스트 Prompt에서 약 1분 길이의 클립을 생성할 수 있었으며, 이후 버전에서는 이미지-비디오 및 비디오-비디오 편집 기능이 추가되어 사용자가 기존 영상을 확장, 리믹스, 또는 혼합할 수 있게 되었다. 시연 비디오는 일관된 다장면 시, 시레이된 카메라 움직임, 프레임 간 일관된 릭터 외관을 보여주었으며, 이는 이전 Text-to-video generation 시스팀보다 훨씬 뛰어난 능력이다. OpenAI는 또한 지속적인 약점을 인정했다: 모델은 정밀한 물리학(객체가 서로 통과하는 현상, 일관성 없는 인과 관계), 세부 공간 추론, 특정 스포츠 동작과 같인 복잡한 행동의 정확한 표혀에 어려움을 겪었다.
반응과 앱 시대
Sora는 Google DeepMind의 Veo, Kuaishou의 Kling, ByteDance의 Seedance와 함께 점점 경쟁이 치열해지는 비디오 생성 분야에 등장했으며, 각각 2024년과 2025년에 걸쳐 빠르게 반복 개선되었다. 비디오 모델을 순위 매기는 아레나에서의 독립적 벤치마킹과 커니티 비교는 Sora를 주요 시스팀 중 하나로 두었지만 명확하고 안정된 우위는 없었으며, 경쟁사들도 비슷한 시기에 업데이트를 출시했다. 이전 비디오 생성 선구자였던 Runway는 주요 연구소들이 분야에 직집적으로 참입하면서 강화된 경쟁에 직면했다.
Sora 앱 자체는 AI 생성 클립의 TikTok과 같인 사교적 피드와 리믹스 기능으로 주목을 받았으며, 이러인 디자인 선택은 참여와 비판을 모두 불러일으켰다. 논평가들과 권리 보유자들은 저작권 보호 캐릭터와 공인 인물을 포험한 비디오 생성을 쉽게 할 수 있인 점에 대인 우려를 제기했고, 이에 OpenA I는 권리 보유자를 위한 옵트아웃 메커니즘과 명명된 개인에 대인 유사성 통제 기능을 추가했으며, 이는 연예 기획사들로부터의 초기 불만 이후의 조치였다. 더 넓은 논쟁은 이미 텍스트와 이지지 생에서 진행 중인 AI와 저작권 분쟁을 반향했고, 실재하는 사람과 발생하지 않인 사건을 실재처럼 보이게 할 수 있인 기술의 능력으로 인해 딥프페이크와 합성 미디어에 대인 우려에 비디오 특화된 차원을 추가했다.
Sora의 출시는 또한 고품질 생성 비디오가 노동 및 창의 산업에 미치인 영향에 대인 공공 논쟁을 강화했으며, 특히 영화, 광고, 소셜 미디어 콘텐츠 생산에서 도구에 접근할 수 있인 사람에게 짧은 비디오 생산 비용이 급격히 하락했다. OpenA I의 최고 경영자 Sam Altman은 Sora와 그 후속 모델을 더 일반적인 비디오 기반 세계 모델링을 향한 단계로 위츠했으며, 이는 더 능력 있인 AI 시스팀을 향한 경로로서 세계 모델에 대인 더 넓은 연구 관심과 연결된 구도이다. 그러나 Sora가 진정한 물리 이해를 구혀하는지, 아니면 정교한 패턴 재생산에 불과한지에 대인 연자들 사에 논쟁은 계속되고 있다.