Imagen Video는 Google DeepMind가 개발한 텍스트-비디오 생성 시스템이다. 2022년 10월에 발표되었으며, 초기 Imagen 텍스트-이미지 모델의 아키텍처를 기반으로 하여 자연어 프롬프트에서 짧고 고품질의 비디오 클립을 생성하는 기능을 확장했다. 이 모델은 생성형 인공지능의 중요한 진전을 나타내며, 텍스트 설명에서 직접 일관된 움직임, 객체 상호작용, 스타일 변형을 합성하는 능력을 보여준다.
이 시스템은 일련의 비디오 확산 모델로 작동하며, 이는 딥러닝 아키텍처의 한 유형으로, 노이즈가 있는 비디오 신호를 점진적으로 정제하여 깨끗한 출력을 생성한다. 이 접근 방식은 Imagen Video가 1280x768 픽셀 해상도와 초당 24프레임의 프레임 속도로 최대 약 5초 길이의 비디오를 생성할 수 있게 한다. 이 모델은 대규모 비디오-텍스트 쌍 데이터셋으로 훈련되어 복잡한 시간적 역학과 시각적 개념을 학습할 수 있다.
아키텍처 및 훈련
Imagen Video는 저해상도 비디오 프레임을 생성하는 기본 비디오 확산 모델을 사용하며, 그 다음 공간 및 시간적 초고해상도 모델 시리즈가 출력을 업스케일링한다. 기본 모델은 잠재 공간에서 작동하며, 비디오 변분 오토인코더를 사용하여 입력을 압축한다. 초고해상도 단계는 공간적 세부 사항과 시간적 일관성을 정제하여 최종 고화질 비디오를 생성한다.
훈련에는 공개 소스에서 수집된 1400만 개의 비디오-텍스트 쌍과 6000만 개의 이미지-텍스트 쌍 데이터셋이 포함되었다. 모델은 Google Cloud의 컴퓨팅 인프라를 활용하여 TPU(텐서 처리 장치) 클러스터에서 훈련되었다. 훈련 과정은 분류기 없는 안내라는 기술을 사용했으며, 이는 생성된 비디오와 입력 텍스트 프롬프트 간의 정렬을 개선한다.
기능 및 특징
Imagen Video는 사실적인 장면, 애니메이션 시퀀스, 예술적 렌디션을 포함한 다양한 스타일의 비디오를 생성할 수 있다. 동작, 카메라 움직임, 객체 상호작용을 지정하는 텍스트 프롬프트를 지원한다. 이 모델은 또한 애니메이션 로고나 자막과 같은 비디오 내 텍스트 렌더링 능력을 보여주며, "수채화"나 "픽셀 아트"와 같은 특정 예술적 스타일을 적용할 수 있다.
주목할 만한 특징 중 하나는 시간적 일관성으로, 객체와 장면이 프레임 전체에서 일관되게 유지되도록 보장한다. 이 모델은 또한 여러 객체와 복잡한 장면을 가진 비디오를 생성할 수 있지만, 매우 세부적이거나 모호한 프롬프트에서는 어려움을 겪을 수 있다. 이 시스템은 발표 당시 공개되지 않았으며, Google DeepMind는 안전 문제와 오용 가능성을 이유로 들었다.
다른 모델과의 비교
Imagen Video는 비슷한 시기에 발표된 Meta의 Make-A-Video와 같은 경쟁 모델과 함께 최초의 주목할 만한 텍스트-비디오 모델 중 하나였다. OpenAI의 이후 Sora 모델이 트랜스포머 기반 아키텍처를 사용하는 것과 달리, Imagen Video는 확산 모델 프레임워크에 의존한다. 이러한 접근 방식의 차이는 비디오 생성 분야의 다양한 방법을 강조한다.
초기 텍스트-이미지 모델과 비교하여, Imagen Video는 정적 이미지에서 동적 시퀀스로 과제를 확장하며, 모델이 공간적 특징뿐만 아니라 시간적 의존성도 학습해야 한다. 이는 모델이 여러 프레임을 동시에 처리해야 하므로 작업이 훨씬 더 계산 집약적이게 만든다.
한계 및 안전
Google DeepMind는 Imagen Video의 여러 한계를 인정했다. 이 모델은 특히 복잡한 장면에서 깜빡임이나 왜곡된 객체와 같은 아티팩트가 있는 비디오를 생성할 수 있다. 또한 비정상적이거나 추상적인 개념을 포함한 프롬프트를 잘못 해석할 수 있다. 생성 과정은 계산 비용이 많이 들며, 상당한 처리 능력이 필요하여 접근성을 제한한다.
이러한 우려로 인해 모델은 공개되지 않았다. 개발자들은 워터마킹과 콘텐츠 필터링을 포함한 오용 방지를 위한 안전 조치를 포함하여, 이러한 기술을 출시하기 전에 신중한 평가와 안전 조치가 필요하다고 강조했다. 이러한 신중한 접근 방식은 미디어 생성에서 인공지능의 윤리적 함의에 대한 더 넓은 산업 논의를 반영한다.
영향 및 유산
Imagen Video는 텍스트-비디오 생성의 빠른 발전에 기여했으며, 해당 분야의 후속 연구와 개발에 영향을 미쳤다. 그 아키텍처와 훈련 방법론은 이후 모델에서 참조되었으며, 비디오 품질과 프롬프트 충실도에 대한 벤치마크를 수립하는 데 도움이 되었다. 이 작업은 또한 Google DeepMind와 산업 전반의 머신러닝 연구에 대한 추가 투자를 촉진했다.
상업 제품은 아니지만, Imagen Video는 텍스트에서 고품질 비디오를 생성하는 기술적 실현 가능성을 입증했으며, Veo 및 기타 비디오 생성 도구와 같은 미래 시스템의 길을 열었다. 안전하고 책임 있는 배포에 대한 강조는 주요 AI 연구 조직이 이러한 강력한 모델을 다루는 방식에 선례를 설정했다.