이미지 비디오 출시 (2022)

영어에서 번역됨

Imagen Video 출시(2022)는 2022년 10월에 발표된 Google의 텍스트-비디오 모델을 가리키며, 기존의 Imagen 텍스트-이미지 기술을 기반으로 합니다. 이 모델은 기본 확산 모델과 업샘플링을 사용하여 텍스트 프롬프트에서 짧고 고품질의 비디오를 생성합니다.

Imagen Video는 2022년 10월에 처음 발표된 Google이 개발한 텍스트-비디오 생성 모델이다. 이 모델은 Google의 초기 Imagen 텍스트-이미지 시스템의 기능을 확장하여 자연어 설명으로부터 짧고 고충실도의 비디오 클립을 생성한다. 이 모델은 확산 기반 기술을 정적 이미지뿐만 아니라 비디오의 시간적 차원에도 적용한다는 점에서 Generative AI 분야의 중요한 진전을 나타낸다.

이 발표는 Imagen Video를 소비자 제품이 아닌 연구 시연으로 자리매김했으며, Google은 창의적 응용 가능성을 강조하는 동시에 오용 위험도 인정했다. 이 모델은 당시 Google Brain의 일부였던 Google DeepMind 팀이 개발했으며, 2023년 4월 DeepMind와의 합병 이전이었다.

기술 구조

Imagen Video는 원래 Imagen 이미지 모델에 사용된 계단식 확산 모델 접근 방식을 기반으로 한다. 이 시스템은 여러 단계로 작동한다. 기본 비디오 확산 모델은 64x64 픽셀 프레임 크기에서 시작하여 초당 24프레임의 저해상도 비디오를 생성한다. 그 다음 일련의 공간 및 시간 업샘플러가 해상도를 1280x768 픽셀로 높인다.

이 모델은 고정된 Transformer (architecture) 기반 텍스트 인코더, 특히 T5를 사용하여 입력 프롬프트를 해석한다. 이 텍스트 인코딩은 확산 과정에 공급되며, 확산 과정은 무작위 노이즈를 반복적으로 제거하여 일관된 비디오 프레임으로 변환한다. 일부 초기 비디오 생성 시도와 달리 Imagen Video는 비디오 자체 생성에 Large language model을 사용하지 않고 언어 모델을 텍스트 이해에만 사용한다.

주요 혁신에는 프레임 간 부드러운 움직임을 보장하는 시간적 초해상도 네트워크와 세부 정보를 추가하는 공간 초해상도 네트워크의 사용이 포함된다. 이 모델은 공개 LAION-5B 데이터 세트와 Google 내부 데이터의 비디오를 포함한 1,400만 개의 비디오-텍스트 쌍 데이터 세트로 학습되었다.

기능 및 한계

Imagen Video는 초당 24프레임으로 최대 5초 길이의 비디오를 생성할 수 있으며, 시네마틱, 3D 애니메이션, 수채화 그림을 포함한 다양한 스타일을 지원한다. 또한 비디오 내 텍스트를 생성할 수 있지만 이미지 모델과 유사한 한계가 있다. 이 시스템은 16:9, 9:16, 1:1을 포함한 다양한 화면 비율을 지원한다.

시연에서 이 모델은 객체를 애니메이션화하고, 간단한 내러티브를 만들고, 곰 인형이 걷거나 우주선이 착륙하는 것과 같은 복잡한 장면을 렌더링하는 능력을 보여주었다. 그러나 더 긴 시퀀스, 복잡한 물리 법칙, 프레임 간 일관된 캐릭터 정체성에는 어려움을 겪었다. 이 모델은 또한 Deep learning 생성 모델에서 흔한 문제인 인간의 손과 얼굴을 정확하게 렌더링하는 데 어려움이 있었다.

Google은 이 모델이 스토리보드, 애니메이션 사전 시각화, 교육 콘텐츠에 사용될 수 있다고 언급했지만 안전 문제로 공개적으로 출시하지 않았다. 회사는 딥페이크와 허위 정보를 포함한 오해의 소지가 있거나 유해한 콘텐츠를 생성할 위험을 강조했다.

동시대 모델과의 비교

Imagen Video는 2022년 9월 몇 주 전에 공개된 Meta의 Make-A-Video를 포함한 당시의 다른 텍스트-비디오 모델과 함께 발표되었다. 두 시스템 모두 유사한 확산 기반 접근 방식을 사용했지만, Imagen Video는 더 높은 해상도와 시간적 일관성을 강조했다.

이미지에 초점을 맞춘 OpenAI의 DALL-E나 Stability AI의 Stable Diffusion과 달리, Imagen Video는 대규모 비디오 생성을 처음으로 시도한 모델 중 하나였다. 또한 2024년 OpenAI가 출시한 Sora와 같은 후속 모델과 달리 더 짧은 클립과 더 낮은 해상도를 생성했지만, 이후 연구의 토대를 마련했다.

이 모델의 아키텍처는 유사한 계단식 확산 기술을 통합한 Imagen 2 및 Imagen 3 이미지 모델을 포함한 이후 Google 제품에 영향을 미쳤다. Imagen Video 자체는 상용화되지 않았지만, 그 기술은 2024년에 발표된 Veo와 같은 Google의 이후 비디오 생성 노력에 정보를 제공했다.

반응 및 영향

Imagen Video에 대한 초기 반응은 긍정적이었으며, 연구자들은 이전 작업에 비해 생성된 클립의 품질을 칭찬했다. 기술 저널리스트들은 비디오가 짧고 때로는 불완전하지만 Machine learning 비디오 합성의 빠른 발전을 보여준다고 언급했다. 이 모델은 창의적 워크플로우를 가속화할 수 있는 개념 증명으로 간주되었다.

그러나 일부 비평가들은 이 모델이 상당한 계산 리소스를 요구하여 대부분의 연구자가 접근하기 어렵다고 지적했다. Google은 모델 가중치나 API를 공개하지 않아 독립적 평가를 제한했다. 이는 더 넓은 커뮤니티 실험을 허용한 Stable Diffusion과 같은 오픈 소스 노력과 대조되었다.

이 발표는 또한 텍스트-비디오 기술의 윤리적 함의에 대한 논의를 촉발했다. 학자와 정책 입안자들은 오용에 대한 안전장치를 요구했고, 이는 Google이 모델을 내부에 유지하기로 한 결정으로 이어졌다. 이는 종종 유사한 조사에 직면한 이후 생성 비디오 모델에 대한 선례를 설정했다.

유산

2022년 Imagen Video의 출시는 Artificial intelligence 연구의 이정표를 세웠으며, 확산 모델이 이미지에서 비디오로 확장될 수 있음을 입증했다. 계단식 아키텍처와 T5 텍스트 인코딩 사용은 이후 시스템의 표준이 되었다. 시간적 일관성과 계산 비용의 한계는 이후 연구 방향을 안내했다.

2025년까지 비디오 생성 모델은 Veo 3 및 Sora와 같은 시스템이 거의 사실적인 품질의 1분 길이 클립을 생성하면서 크게 발전했다. Imagen Video는 종종 텍스트-비디오 합성의 타당성을 보여주고 남아 있는 과제를 강조한 이러한 발전의 초기 선구자로 인용된다.

Google은 Imagen 제품군을 계속 개발하여 2023년 12월 Imagen 2, 2024년 8월 Imagen 3, 2025년 5월 Imagen 4를 출시했다. 이들은 이미지에 초점을 맞추었지만, 2022년에 개척된 비디오 기능은 Google Cloud 서비스 및 Gemini 어시스턴트를 포함한 Google의 더 넓은 생성 AI 제품에 통합되었다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·text-to-video·google·diffusion-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사