OpenAI Sora 공개

영어에서 번역됨

소라는 OpenAI가 개발한 텍스트-비디오 모델이자 소셜 미디어 앱으로, 2024년 2월에 미리 공개되었습니다. 텍스트 프롬프트에서 짧은 비디오 클립을 생성했지만, 비용과 낮은 사용률로 인해 2026년 4월에 중단되었습니다.

Sora는 텍스트-비디오 모델이자 OpenAI가 개발한 소셜 미디어 앱이었다. Artificial intelligence를 사용하여, 이 모델은 프롬프트를 기반으로 짧은 비디오 클립을 생성했으며, 기존의 짧은 비디오를 확장할 수도 있었다. 2024년 2월, OpenAI는 그 출력물의 예시를 대중에게 공개했으며, Sora의 첫 번째 세대는 2024년 12월 미국과 캐나다의 ChatGPT Plus 및 ChatGPT Pro 사용자에게 공개적으로 출시되었다.

Sora의 두 번째 세대는 2025년 9월 말 미국과 캐나다의 일부 사용자에게 출시되었다. Sora 2는 앱에 소셜 미디어 기능을 통합했다. 이 앱은 2026년 4월 26일에 종료되었으며, 응용 프로그래밍 인터페이스(API)는 2026년 9월 24일에 중단될 예정으로, Sora AI 브랜드 전체의 종말을 알렸다.

배경

Sora 이전에도 텍스트에서 비디오를 생성할 수 있는 여러 다른 모델이 만들어졌으며, 여기에는 Meta의 Make-A-Video, Runway의 Gen-2, Google Veo가 포함된다. Sora를 개발한 회사인 OpenAI는 2023년 9월에 세 번째 DALL-E 텍스트-이미지 모델인 DALL-E 3를 출시했다. 이러한 초기 시스템들은 Sora의 기술적 기반을 확립했으며, Sora는 Diffusion ModelsTransformer (architecture) 아키텍처의 발전을 활용하여 비디오 데이터를 처리했다.

초기 출시

Sora를 개발한 팀은 "무한한 창의적 잠재력"을 의미하기 위해 일본어로 '하늘'을 뜻하는 단어에서 이름을 따왔다. 2024년 2월 15일, OpenAI는 Sora를 처음으로 공개하며, 산길을 달리는 SUV, 촛불 옆의 "짧고 털복숭이 괴물"의 애니메이션, 눈 속에서 도쿄를 걷는 두 사람, 캘리포니아 골드러시의 가짜 역사적 영상 등 모델이 생성한 여러 고화질 비디오 클립을 공개했다. OpenAI는 최대 1분 길이의 비디오를 생성할 수 있다고 밝혔다. 회사는 이후 모델 훈련에 사용된 방법을 강조한 기술 보고서를 공유했다. OpenAI CEO 샘 알트만은 또한 트위터 사용자들의 프롬프트에 Sora로 생성한 비디오로 응답하는 일련의 트윗을 게시했다.

2024년 12월 9일 기준으로, OpenAI는 미국과 캐나다의 ChatGPT Pro 및 ChatGPT Plus 사용자에게 Sora를 점진적으로 공개했다. 이전에는 회사가 잘못된 정보와 편향 전문가를 포함한 소규모 "레드 팀"에게 제한된 접근 권한을 제공하여 모델에 대한 적대적 테스트를 수행했다. 회사는 또한 비디오 제작자와 예술가를 포함한 소규모 창의적 전문가 그룹과 Sora를 공유하여 창의적 분야에서의 유용성에 대한 피드백을 구했다. 2025년 2월, OpenAI는 사용자가 챗봇에서 Sora 비디오를 생성할 수 있도록 하여 Sora를 ChatGPT에 통합할 계획을 발표했다.

Sora 2

Sora 2는 2025년 9월 30일에 공개되었으며, 동시에 iOS 앱이 출시되었고 두 달 후 Android 앱도 출시되었다. 모델이 생성한 모든 비디오에는 도구의 오용을 방지하기 위해 눈에 보이는 움직이는 워터마크가 포함된다. 이전 버전의 Sora도 시청자가 실제와 허구 콘텐츠를 구분할 수 있도록 안전 워터마크를 추가했다. 10월 7일, 404 Media는 Sora 2 비디오에서 워터마크를 제거할 수 있는 타사 프로그램이 널리 퍼졌다고 보도했다. Wired 잡지와 같은 많은 매체는 Sora 2 앱이 스타일과 기능 면에서 TikTok과 명백히 유사하다고 지적했다.

중단

2026년 3월 24일, OpenAI는 X에서 모바일 앱과 API 모두에서 Sora를 중단한다고 발표했다. Sora 앱은 2026년 4월 26일에 종료되었으며, API는 2026년 9월 24일에 중단될 예정이다. Disney 캐릭터를 Sora 내에서 사용할 수 있게 하는 라이선스 계약을 포함한 OpenAI와 Disney의 파트너십도 종료될 예정이었다. 이 결정으로 인해 영국 기술 뉴스 웹사이트 The Register는 OpenAI를 Google, Amazon Web Services, Broadcom, Cloud Software Group, Netscape와 같은 다른 기술 회사의 발자취를 따르는 "제품 킬러"라고 규정했다.

OpenAI는 중단 공지에서 Sora를 중단하는 구체적인 이유를 제공하지 않았다. 이 중단과 관련해 나타난 보고서들은 계산 자원 부족, 비용 압박, 핵심 기업 제품으로의 광범위한 전환과 관련이 있다고 지적했다. 공개 출시 이후, Sora의 전 세계 사용자는 약 100만 명으로 정점에 달한 후 50만 명 미만으로 감소했으며, 비디오 생성의 계산 요구로 인해 서비스 운영 비용은 하루 약 100만 달러로 추산되었다.

법적 규제

2024년 11월, Sora 접근을 위한 API 키가 Hugging Face에서 테스터 그룹에 의해 유출되었으며, 그들은 Sora가 "아트 워싱"에 사용된다는 항의를 표명하는 선언문을 게시했다. OpenAI는 유출이 공개된 지 3시간 만에 모든 접근 권한을 취소하고 "수백 명의 예술가"가 개발을 형성했으며 "참여는 자발적"이라고 밝혔다.

출시 당시, Sora 2는 저작권 보유자가 플랫폼에서 콘텐츠 생성을 제한하기 위해 OpenAI에 연락하지 않는 한 기본적으로 저작권이 있는 콘텐츠를 허용했다. 2025년 10월 3일, OpenAI는 Sora 2의 향후 업데이트가 저작권 보유자에게 저작권 콘텐츠 생성에 대한 "더 세밀한 제어"를 제공할 것이라고 밝혔지만, 기존 콘텐츠가 제거될지 여부는 명시하지 않았다. 10월 6일, MPA 의장은 Sora 2와 관련된 OpenAI의 저작권 접근 방식을 비판했다.

2025년 12월 11일, 월트 디즈니 컴퍼니는 3년 라이선스 계약으로 OpenAI에 10억 달러를 투자할 것이라고 발표했으며, Disney+ 사용자가 Sora 2에서 Disney Animation, Pixar, Marvel Studios, Star Wars의 캐릭터를 포함한 200개 이상의 저작권 캐릭터를 생성할 수 있게 했다.

기능 및 한계

Sora 뒤의 기술은 DALL-E 3 뒤의 기술을 각색한 것이다. OpenAI에 따르면, Sora는 확산 트랜스포머로, 하나의 트랜스포머를 노이즈 제거기로 사용하는 잡음 제거 잠재 확산 모델이다. 비디오는 잠재 공간에서 3D "패치"를 노이즈 제거하여 생성된 후, 비디오 압축 해제기에 의해 표준 공간으로 변환된다. 재캡셔닝은 비디오-텍스트 모델을 사용하여 비디오에 대한 상세한 캡션을 생성함으로써 훈련 데이터를 증강하는 데 사용된다.

OpenAI는 공개적으로 사용 가능한 비디오와 목적을 위해 라이선스된 저작권 비디오를 사용하여 모델을 훈련했지만, 비디오의 수나 정확한 출처는 공개하지 않았다. 출시 시점에 OpenAI는 복잡한 물리 시뮬레이션, 인과 관계 이해, 좌우 구분의 제한된 능력 등 Sora의 일부 단점을 인정했다. OpenAI는 또한 회사의 기존 안전 관행에 따라 Sora가 성적, 폭력적, 혐오적 또는 유명인 이미지와 기존 지적 재산을 포함한 콘텐츠에 대한 텍스트 프롬프트를 제한할 것이라고 밝혔다.

Sora 연구원 Tim Brooks는 모델이 데이터 세트만으로 3D 그래픽을 만드는 방법을 학습했다고 밝혔으며, 동료 연구원 Bill Peebles는 모델이 명시적 프로그래밍 없이 물리적 세계의 특정 측면을 시뮬레이션할 수 있다고 말했다. 이 시스템은 비디오 프레임 간의 시간적 및 공간적 정보를 처리할 수 있게 한 Deep learning 기술, Neural network 레이어 및 Multi-Head Attention 메커니즘에 의존했다.

기술적 접근 방식

Sora의 아키텍처는 비디오 데이터를 노이즈 제거 단계를 적용하기 전에 저차원 잠재 공간으로 압축하는 잠재 확산 모델 프레임워크를 기반으로 구축되었다. 모델은 비디오 데이터의 시공간 블록인 3D 패치를 트랜스포머 기반 노이즈 제거기의 토큰으로 사용했다. 이 접근 방식은 종종 U-Net 아키텍처를 사용하는 전통적인 비디오 생성 모델과 달랐으며, 트랜스포머 백본은 모델 크기와 훈련 데이터에 따라 더 나은 확장을 가능하게 했다.

훈련 과정은 비디오와 이미지 쌍의 대규모 데이터 세트를 포함했지만, 구체적인 세부 사항은 공개되지 않았다. 재캡셔닝 기술은 비디오-텍스트 모델을 사용하여 훈련 비디오에 대한 상세한 텍스트 설명을 생성했으며, 이는 모델이 프롬프트와 시각적 콘텐츠 간의 더 나은 연관성을 학습하는 데 도움이 되었다. 이러한 방법은 Large language model 연구에서 개발된 Sequence-to-Sequence (Seq2Seq) 모델 및 Cross-Attention 메커니즘의 이전 작업에서 파생되었다.

문화적 및 윤리적 영향

2024년 2월 Sora의 공개는 창의적 산업, 저널리즘, 잘못된 정보 탐지에 대한 텍스트-비디오 생성의 영향에 대한 광범위한 논의를 촉발했다. 모델이 현실적이고 고화질의 클립을 생성할 수 있는 능력은 가짜 뉴스 영상이나 오해를 불러일으키는 콘텐츠를 생성할 가능성에 대한 우려를 제기했다. 이는 초기 미리보기에 포함된 가짜 캘리포니아 골드러시 영상으로 강조되었으며, 모델이 그럴듯한 역사적 이미지를 만들 수 있는 능력을 보여주었다.

법률 전문가와 미디어 조직은 생성된 비디오에서 저작권 자료의 기본 사용에 대한 저작권 문제를 논의했다. 눈에 보이는 움직이는 워터마크는 기술적 안전장치로 도입되었지만, Sora 2 출시 후 일주일 만에 타사 도구에 의해 제거된 것은 콘텐츠 인증의 어려움을 강조했다. 모델의 저작권 훈련 데이터 사용은 AI 산업의 진행 중인 소송과 규제 조사에 기여했지만, OpenAI는 Sora와 관련된 특정 법적 조치를 공개하지 않았다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·text-to-video·openai·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사