영어에서 번역됨

Phenaki는 Google DeepMind가 개발한 생성형 AI 모델로, 텍스트 프롬프트에서 가변 길이의 비디오를 생성하며, 트랜스포머 기반 아키텍처를 사용하여 시간적으로 일관된 시퀀스를 생성합니다. 2022년에 연구용 프로토타입으로 소개되었습니다.

Phenaki는 생성형 인공지능 모델로, Google DeepMind가 텍스트 설명으로부터 비디오를 생성하기 위해 개발했다. 자연어 프롬프트를 기반으로 짧은 클립부터 더 긴 내러티브까지 다양한 길이의 시간적으로 일관된 비디오 시퀀스를 생성하도록 설계되었다. 이 모델은 2022년 연구 논문에서 소개되었으며, 인공지능, 머신러닝, 딥러닝 기법을 결합한 텍스트-비디오 생성 분야에서 중요한 진전을 나타낸다.

Phenaki의 핵심 아키텍처는 트랜스포머 모델을 기반으로 하며, 이는 현대 AI, 특히 순차 데이터를 다루는 작업에서 기초가 된 신경망 유형이다. 초기 비디오 생성 모델이 종종 고정 길이의 저해상도 클립을 생성한 것과 달리, Phenaki는 가변적인 프레임 수의 비디오를 생성할 수 있어 더 유연하고 동적인 출력을 가능하게 한다. 이는 비디오를 이산 토큰의 시퀀스로 압축하고, 대규모 언어 모델이 텍스트를 처리하는 방식과 유사하게 입력 텍스트에 조건화된 이 토큰들을 자기회귀적으로 생성함으로써 달성된다.

아키텍처 및 훈련

Phenaki는 두 단계 접근 방식을 사용한다. 첫째, 비디오 토크나이저가 3D 컨볼루션 인코더-디코더를 사용하여 시공간 데이터를 컴팩트한 시각 토큰 시퀀스로 압축한다. 대규모 비디오 데이터셋으로 훈련된 이 토크나이저는 필수적인 시각 정보를 보존하면서 차원을 줄인다. 둘째, 언어 모델링에서 사용되는 것과 유사한 트랜스포머 기반 자기회귀 모델이 텍스트 프롬프트와 이전에 생성된 토큰에 조건화하여 이 토큰들을 순차적으로 생성한다. 모델은 비디오-텍스트 쌍 데이터셋으로 훈련되어 시각적 콘텐츠와 언어적 설명을 정렬하는 방법을 학습한다.

훈련 과정은 마스크된 토큰 모델링 목표를 포함하며, 모델은 시퀀스에서 마스크된 토큰을 예측하는 방법을 학습하여 시작 토큰이나 텍스트 프롬프트에서 일관된 비디오를 생성할 수 있다. 이 접근 방식은 모델이 최대 길이나 시퀀스 종료 토큰과 같은 중지 조건이 충족될 때까지 토큰 생성을 계속할 수 있으므로 임의 길이의 비디오를 생성할 수 있게 한다.

기능 및 특징

Phenaki는 동작, 장면, 시간적 변화를 설명하는 프롬프트를 포함한 다양한 텍스트 프롬프트에서 비디오를 생성할 수 있다. 예를 들어, "고양이가 해변을 걷는" 프롬프트는 고양이가 해변을 걷는 비디오를 생성하며, 모델은 프레임 간 시간적 일관성을 보장한다. 또한 제로샷 일반화를 지원하여 훈련 중 명시적으로 보지 못한 프롬프트도 언어와 시각적 개념에 대한 이해를 활용해 처리할 수 있다.

주목할 만한 기능 중 하나는 여러 장면이나 사건을 가진 비디오를 생성할 수 있는 능력으로, 모델이 시간이 지남에 따라 다양한 시각적 상태 간 전환할 수 있다. 이는 모델이 미리 계획하고 내러티브 일관성을 유지할 수 있게 하는 자기회귀 토큰 생성을 통해 달성된다. 그러나 출력 해상도는 상대적으로 낮으며, 일반적으로 약 128x128 픽셀이고, 비디오는 수 초로 짧지만 길이를 확장할 수 있다.

다른 모델과의 비교

Phenaki는 OpenAI 및 다른 연구 그룹의 모델과 비슷한 시기에 개발되었다. 확산 기반 접근 방식을 사용하는 일부 모델과 달리, Phenaki의 트랜스포머 기반 방법은 다른 절충점을 제공한다. 더 긴 시퀀스를 생성할 수 있지만 더 높은 해상도에서 세부적인 디테일에는 어려움을 겪을 수 있다. 가변 길이 기능은 핵심 차별점이며, 많은 동시대 모델이 고정 길이 클립으로 제한되었다.

생성형 AI의 더 넓은 맥락에서 Phenaki는 텍스트와 비디오를 연결하는 다중 모달 모델의 진화에 기여한다. 그 아키텍처는 특히 시간적 데이터를 위한 토크나이제이션과 자기회귀 모델링의 사용에서 이후 비디오 생성 연구에 영향을 미쳤다.

한계 및 향후 방향

연구 프로토타입인 Phenaki는 여러 가지 한계가 있다. 생성된 비디오는 저해상도이며 깜빡임이나 객체 외관의 불일치와 같은 아티팩트가 나타날 수 있다. 또한 훈련과 추론에 상당한 계산 리소스가 필요하여 접근성을 제한한다. 추가적으로, 훈련 데이터에는 편향이 포함될 수 있으며, 모델은 이러한 편향을 반영한 콘텐츠를 생성할 수 있어 배포에 대한 윤리적 우려를 제기한다.

이 분야의 미래 연구는 해상도, 시간적 일관성, 생성 콘텐츠에 대한 제어를 개선하는 것을 목표로 한다. 연구자들은 트랜스포머와 확산 방법을 결합한 하이브리드 접근 방식과 더 효율적인 토크나이제이션 기법을 탐구하고 있다. 2025년 기준으로 텍스트-비디오 생성은 크게 발전하여 더 높은 해상도와 더 긴 비디오를 생성할 수 있는 모델이 등장했지만, Phenaki는 해당 분야의 기초적 기여로 남아 있다.

영향 및 평가

Phenaki의 도입은 AI 연구 커뮤니티에서 관심을 받았다. 이는 딥러닝 모델이 텍스트에서 일관된 비디오를 생성하는 실행 가능성을 입증했기 때문이다. 자동화된 비디오 제작 및 창의적 응용 도구와 같은 가능성을 강조했다. 상업적으로 배포되지는 않았지만, Phenaki의 원리는 이후 비디오 생성 연구, 특히 시간적 데이터를 위한 토크나이제이션과 자기회귀 모델링 사용에 영향을 주었다.

같이 보기

참고 문헌

  • Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions, Google DeepMind 연구 논문, 2022.
  • 텍스트-비디오 생성 관련 후속 연구 작업.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·video-generation·deep-learning·google-deepmind
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사