Make-A-Video 출시 (2022)

영어에서 번역됨

Meta는 2022년 9월 29일, 텍스트-투-비디오 합성을 위한 생성형 AI 시스템인 Make-A-Video를 출시했다. 이를 통해 사용자는 텍스트 프롬프트에서 짧은 비디오 클립을 생성할 수 있었으며, 이는 창의적 AI 도구의 중요한 진전을 의미했다.

Make-A-Video는 메타가 개발한 생성 인공지능 시스템으로, 텍스트 설명을 짧은 비디오 클립으로 변환한다. 2022년 9월 29일에 발표되었으며, 주요 기술 기업이 공개적으로 시연한 최초의 텍스트-비디오 모델 중 하나로, 이전의 텍스트-이미지 생성 분야의 발전을 기반으로 구축되었다. 이 시스템은 딥러닝신경망 아키텍처의 조합을 사용하여 최대 5초 길이, 768x768 픽셀 해상도의 비디오를 생성했으며, 확장된 클립을 위해 선택적으로 추가 프레임을 생성할 수 있었다.

이번 출시는 메타를 그 해 초 이미지 합성 분야에서 돌파구를 맞이한 생성 인공지능 분야의 급성장 속에 자리매김하게 했다. 대규모의 짝지어진 텍스트-비디오 데이터셋을 요구했던 초기 비디오 생성 시도와 달리, Make-A-Video는 기존의 텍스트-이미지 훈련 데이터와 비지도 비디오 영상을 활용하여 값비싼 라벨링 비디오 데이터의 필요성을 줄였다. 이 접근 방식은 모델이 텍스트-이미지 쌍에서 시각적 의미를 기반으로 하는 동안 라벨 없이 비디오에서 동작 패턴을 학습할 수 있게 했다.

기술 아키텍처

이 시스템은 세 가지 주요 구성 요소로 이루어져 있다: 텍스트-이미지 기본 모델, 시간적 디코더, 프레임 보간 네트워크이다. 텍스트 인코더는 Transformer (architecture) 변환기의 아키텍처를 기반으로 텍스트 프롬프트를 잠재 표현으로 매핑했다. 이미지 생성 모듈은 메타의 초기 Make-A-Scene 모델과 유사하며, 텍스트 조건에 따라 정적 이미지를 생성했다. 그 후 시간적 디코더는 이를 일련의 프레임으로 확장하며, 그럴듯한 동작 역학을 예측하도록 학습했다. 마지막으로 프레임 보간 네트워크는 프레임 속도를 높여 더 부드러운 비디오 출력을 생성했다.

메타 연구진은 공개 웹 데이터에서 얻은 1천만 개의 텍스트-이미지 쌍과 5백만 개의 라벨 없는 비디오 데이터셋을 사용하여 모델을 훈련했다. 훈련 과정은 두 단계로 이루어졌다: 먼저 정적 이미지에서 이미지 생성 구성 요소를 사전 훈련하고, 그 다음 비디오 데이터에서 시간대적 레이어를 미세 조정했다. 이 계층적 훈련 방식은 통상적으로 대규모의 짝 데이터를 요구하는 종단 간 비디오 훈련에 비해 계산 비용을 줄였다.

기능 및 한계

Make-A-Video는 "슈퍼히어로 복장을 한 개" 또는 "그림을 그리는 테디 베어"를 포함한 다양한 프롬프트에서 영상을 생성할 수 있었다. 또한 사용자가 정지 이미지를 제공하고 모델이 그걸 움직이게 하는 이미지-비디오 생성과, 기존 클립의 스타일이나 콘텐츠를 바꾸는 비디오-비디오 편집도 지원했다. 이 시스템은 초당 16 프레임으로 약 5초 길이의 영상을 생성할 수 있었고, 보간 네트워크를 사용하여 더 긴 시퀀스로 확장할 수 있었다.

그러나 이 모델은 주목할 만한 한계가 있었다. 복잡한 다중 객체 장면을 처리하는 데 어려움을 겪었으며, 모핑 모양이나 일관성 없는 물리 역학과 같은 아티팩트를 종종 생성했다. 비디오에서 텍스트 렌더링은 자주 왜곡되었고 시스템은 소리를 생성할 수 없었다. 당시에는 높은 수준이었지만, 해상도는 방송 품질에 미치지 못했다. 메타는 이러한 단점을 인정하며 이 기술은 완성된 제품이 아닌 연구를 위한 시연이라고 밝혔다.

더 넓은 맥락과 수용

이번 출시는 생성 모델에 대한 관심이 급증한 시기에 이루어졌다. 2022년 초에는 OpenAI가 DALL-E 2로 텍스트 이미지 생성을 비공개했고, Google DeepMind는 Imagen을 시연했다. Make-A-Video는 이 패러다임을 시간 영역으로 이어받아, 연구자들과 일반 대중의 관심을 끌었다. 미디어 보도는 창의적인 잠재력과 오해를 불러일으키거나 유해한 콘텐츠를 생성할 가능성을 포함한 윤리적 위험을 모두 강조했다.

메타는 모델을 즉시 공개하지 않고, 대신 선택된 사용자를 위한 제한적인 웹 시연을 제공했다. 회사는 폭력, 성적 또는 기타 부적절한 콘텐츠를 차단하는 필터와 같은 안전 조치를 구현한 후에만 접근을 허용할 것이다라고 밝혔다. 이러한 신중한 출시는 생성 AI의 이중 용도 성격을 처리하고 있는 당시 업계 관행을 반영해야 했다.

영향과 유산

Make-A-Video의 출시는 텍스트-비디오 생성에 대한 추가 연구를 가속화했다. 몇 달 만에 Alibaba Cloud 및 각 학술 실험실을 포함한 다른 조직들이 유사한 시스템을 발표했다. 시간대적 디코더와 프레임 보간 사용에 대한 기반 기술들은 메타 자신의 Emu Video 및 Runway's Gen-2와 같은 타사 시스템을 포함한 후계 모델에 영향을 미쳤다. 비디오 어노테이션 비용을 줄이기 위해 텍스트-이미지 데이터를 이용하는 강조사항은 필드에서 표준 관행이 되었다.

2024년까지 텍스트-비디오 모델은 크게 발전하여 더 길고 고화질이며 소리가 포함된 클립을 생성할 수 있는 시스템이 등장했다. Make-A-Video는 이러한 궤적에서 초기의 중요한 성과로 인정받으며, 언어만을 기반으로 일관된 움직임을 합성하는 가능성을 증명했다. 그 아키텍처와 훈련 방법은 후계 작업의 세대를 이끌며, 인공지능 및 창의적 도구의 역사에 자리매독하게 되었다.

안전 및 윤리 고려 사항

메타의 발표는 잠재적 오용에 대한 논의를 포함했다. 회사는 모델이 허위 정보 또는 동의 없는 콘텐츠를 만드는 데 사용될 수 있음을 언급하며 책임 있는 인공지능 개발에 대한 노력을 강조했다. 이러한 위험을 제한하기 위해 메타는 생성된 비디오에 워터마크를 추가하고 기본 모델에 대한 접근을 차단하고자 계획했다. 회사는 또한 생성 능력에 따라 커질 수 있는 합성 미디어 감지 방법의 지속적인 연구를 약속했다.

비평자들은 그러한 안전 장치가 예방적보다는 반응적이며, 생성 인공지능의 빠른 발전이 규제 체계를 추월하고 있다고 지적했다. 이 논쟁은 후기 모델에서 더 강화되었으며, 2022년의 공공 논의에 이미 존재했다. Make-A-Video는 따라서 기술적 성취뿐만 아니라 생성 인공지능이 제기하는 사회적 역라는 메모리 케이스 스터디로 활용되었다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·text-to-video·meta·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사