Make-A-Video는 메타(Meta)가 개발한 Generative AI 시스템으로, 텍스트 설명에서 짧은 비디오 클립을 생성한다. 2022년 9월에 발표되었으며, 대형 기술 기업이 선보인 최초의 상업용 수준 텍스트-비디오 모델 중 하나로, 이전의 텍스트-이미지 생성 연구를 기반으로 한다. 이 시스템은 Deep learning 및 Neural network 아키텍처, 특히 확산 모델(diffusion models)의 발전을 활용하여 자연어 프롬프트에서 사실적인 움직임과 장면을 합성한다.
이 모델은 메타의 이전 이미지 생성 연구, 특히 Make-A-Scene 시스템을 기반으로 하여 이를 시간적 차원으로 확장한다. 일부 초기 비디오 생성 접근 방식이 짝을 이룬 텍스트-비디오 훈련 데이터를 요구한 것과 달리, Make-A-Video는 주로 레이블이 없는 비디오 데이터로 훈련되었고 이미지-텍스트 쌍을 사용하여 언어와 시각적 콘텐츠 간의 매핑을 학습했다. 이를 통해 광범위한 비디오 캡셔닝 데이터셋 없이도 비디오를 생성할 수 있었으며, 이는 실질적인 이점이었다.
아키텍처 및 훈련
Make-A-Video는 3단계 파이프라인을 사용한다. 첫째, Transformer (architecture) 아키텍처를 기반으로 한 텍스트 인코더가 입력 프롬프트를 의미론적 임베딩으로 변환한다. 둘째, 확산 모델이 공간적 구성과 시간적 역학을 모두 포착하는 일련의 잠재 프레임을 생성한다. 셋째, 디코더가 이러한 잠재 표현을 전체 해상도 비디오 프레임으로 업스케일링한다. 훈련 과정은 두 단계로 이루어졌다: 객체의 외형과 배치를 이해하기 위해 이미지-텍스트 쌍으로 훈련된 공간 모델, 그리고 움직임 패턴을 학습하기 위해 레이블이 없는 비디오로 훈련된 시간 모델이다. 이러한 분리는 값비싼 비디오-텍스트 데이터셋의 필요성을 줄였다.
이 모델은 공개적으로 이용 가능한 대규모 이미지 및 비디오 말뭉치로 훈련되었지만, 메타는 정확한 데이터셋 크기를 공개하지 않았다. 시스템은 최대 768x768 픽셀 해상도와 약 5초 길이, 초당 약 16프레임의 비디오를 생성할 수 있었다. 또한 소스 이미지의 변형 생성, 두 이미지 간 보간을 통한 부드러운 전환 생성, 단일 정지 이미지 애니메이션과 같은 추가 기능도 지원했다.
기능 및 한계
Make-A-Video는 동물, 객체에서 추상적 개념에 이르기까지 다양한 장면을 일관된 움직임과 프롬프트에 대한 합리적인 준수로 생성할 수 있었다. 예를 들어, "초상화를 그리는 테디 베어"와 같은 프롬프트는 붓을 움직이는 곰의 짧은 클립을 생성했다. 그러나 이 모델에는 주목할 만한 한계가 있었다. 정확한 반사나 객체 간의 사실적인 상호작용과 같은 복잡한 물리 현상에 어려움을 겪었으며, 형태 변형이나 깜빡이는 텍스처와 같은 아티팩트를 생성하기도 했다. 비디오 내 텍스트 렌더링도 취약했으며, 오디오를 생성할 수 없었다. 이러한 문제는 초기 텍스트-비디오 시스템 전반에서 공통적이었다.
모델의 출력 품질은 프롬프트의 구체성에 따라 달라졌다. 모호한 프롬프트는 종종 일반적이거나 반복적인 움직임을 생성했지만, 상세한 프롬프트는 충실도를 향상시켰다. 메타는 이 시스템이 완성된 제품이 아닌 연구 시연임을 강조했으며, 공개 API나 오픈소스 모델로 출시되지 않았다. 대신 메타는 연구 논문과 샘플 비디오가 포함된 데모 페이지를 게시했으며, 이는 상당한 언론의 주목을 받았다.
동시대 모델과의 비교
Make-A-Video는 경쟁이 치열한 환경에서 등장했다. OpenAI는 이전에 이미지용 DALL-E 2를 출시했고, 2022년에는 Imagen Video라는 비디오 모델도 소개했지만 공개적으로 배포되지는 않았다. Google DeepMind는 텍스트-비디오 모델인 Phenaki를 시연했으며, Alibaba Cloud 및 NVIDIA와 같은 다른 연구소도 유사한 기술을 탐구하고 있었다. Make-A-Video는 레이블이 없는 비디오 훈련을 사용하여 데이터 요구 사항을 줄였고, 당시 비교적 높은 시각적 품질을 제공한 점에서 두드러졌다. 그러나 최초는 아니었다. 칭화대학과 중국 기술 기업 BAAI의 CogVideo와 같은 초기 시스템은 2021년에 기본적인 텍스트-비디오 생성을 보여주었다.
핵심 차별점은 메타가 사용자 친화적인 출력과 이미지 기반 사전 지식의 통합에 초점을 맞춘 것이었다. 이 모델은 단일 이미지를 가져와 애니메이션화할 수 있었으며, 이는 리뷰어들에게 인상적이었다. 반면 많은 경쟁사는 여러 입력 프레임이나 더 긴 프롬프트를 요구했다. 그 대가로 Make-A-Video의 비디오는 짧았고 카메라 각도나 객체 궤적에 대한 세밀한 제어가 부족했다.
수용 및 영향
Make-A-Video에 대한 언론 보도는 대체로 긍정적이었으며, 매체들은 모델이 기발하고 일관된 클립을 생성하는 능력을 칭찬했다. 기술 평론가들은 이것이 Artificial intelligence 연구가 정적 이미지에서 동적 콘텐츠로 전환되는 신호라고 언급했다. 이 모델은 또한 딥페이크와 잘못된 정보의 가능성과 관련된 윤리적 우려를 제기했다. 메타는 이러한 위험을 인정하고 안전장치가 개발될 때까지 모델을 공개적으로 출시하지 않을 것이라고 밝혔다. 회사는 워터마킹과 콘텐츠 출처 추적 도구에 대해서도 논의했지만, 이러한 기능은 Make-A-Video 자체에는 구현되지 않았다.
연구 커뮤니티 내에서 Make-A-Video는 이후 비디오 확산 모델 연구에 영향을 미쳤다. 그 아키텍처는 메타의 자체 Emu Video와 ModelScope의 텍스트-비디오와 같은 오픈소스 프로젝트를 포함한 후속 시스템에 영감을 주었다. "Make-A-Video: Text-to-Video Generation without Text-Video Data"라는 제목의 논문은 2023년 국제 학습 표현 학회(ICLR)에서 발표되었으며 널리 인용되었다.
유산 및 향후 방향
Make-A-Video는 최종 제품이 아닌 디딤돌이었다. 2023년까지 메타는 시간적 일관성과 해상도를 개선한 Emu Video 모델을 포함한 더 발전된 비디오 생성 연구로 전환했다. 텍스트-비디오 생성 분야는 전반적으로 빠르게 발전하여 Runway의 Gen-2 및 Google DeepMind의 Lumiere와 같은 모델이 더 길고 사실적인 출력을 제공했다. Make-A-Video의 유산은 대규모 짝을 이룬 데이터셋 없이도 텍스트에서 고품질 비디오 생성이 가능하다는 것을 입증하고, 연구자와 대중 모두에게 이 개념을 대중화한 데 있다.
이 모델은 또한 창의적 도구의 민주화에 관한 논의에 기여했다. 출시되지는 않았지만, 공개 데모는 생성형 AI가 비디오 제작의 장벽을 낮출 수 있는 방법을 보여주었다. 2024년 현재 텍스트-비디오 모델은 더 접근 가능해졌지만, Make-A-Video는 Machine learning 기반 미디어 생성의 진화에서 주목할 만한 초기 이정표로 남아 있다.