Phenaki는 생성형 인공지능 모델로, Google DeepMind가 텍스트 설명으로부터 비디오를 생성하기 위해 개발했다. 자연어 프롬프트를 기반으로 짧은 클립부터 더 긴 내러티브까지 다양한 길이의 시간적으로 일관된 비디오 시퀀스를 생성하도록 설계되었다. 이 모델은 2022년 연구 논문에서 소개되었으며, 인공지능, 머신러닝, 딥러닝 기법을 결합한 텍스트-비디오 생성 분야에서 중요한 진전을 나타낸다.
Phenaki의 핵심 아키텍처는 트랜스포머 모델을 기반으로 하며, 이는 현대 AI, 특히 순차 데이터를 다루는 작업에서 기초가 된 신경망 유형이다. 초기 비디오 생성 모델이 종종 고정 길이의 저해상도 클립을 생성한 것과 달리, Phenaki는 가변적인 프레임 수의 비디오를 생성할 수 있어 더 유연하고 동적인 출력을 가능하게 한다. 이는 비디오를 이산 토큰의 시퀀스로 압축하고, 대규모 언어 모델이 텍스트를 처리하는 방식과 유사하게 입력 텍스트에 조건화된 이 토큰들을 자기회귀적으로 생성함으로써 달성된다.
아키텍처 및 훈련
Phenaki는 두 단계 접근 방식을 사용한다. 첫째, 비디오 토크나이저가 3D 컨볼루션 인코더-디코더를 사용하여 시공간 데이터를 컴팩트한 시각 토큰 시퀀스로 압축한다. 대규모 비디오 데이터셋으로 훈련된 이 토크나이저는 필수적인 시각 정보를 보존하면서 차원을 줄인다. 둘째, 언어 모델링에서 사용되는 것과 유사한 트랜스포머 기반 자기회귀 모델이 텍스트 프롬프트와 이전에 생성된 토큰에 조건화하여 이 토큰들을 순차적으로 생성한다. 모델은 비디오-텍스트 쌍 데이터셋으로 훈련되어 시각적 콘텐츠와 언어적 설명을 정렬하는 방법을 학습한다.
훈련 과정은 마스크된 토큰 모델링 목표를 포함하며, 모델은 시퀀스에서 마스크된 토큰을 예측하는 방법을 학습하여 시작 토큰이나 텍스트 프롬프트에서 일관된 비디오를 생성할 수 있다. 이 접근 방식은 모델이 최대 길이나 시퀀스 종료 토큰과 같은 중지 조건이 충족될 때까지 토큰 생성을 계속할 수 있으므로 임의 길이의 비디오를 생성할 수 있게 한다.
기능 및 특징
Phenaki는 동작, 장면, 시간적 변화를 설명하는 프롬프트를 포함한 다양한 텍스트 프롬프트에서 비디오를 생성할 수 있다. 예를 들어, "고양이가 해변을 걷는" 프롬프트는 고양이가 해변을 걷는 비디오를 생성하며, 모델은 프레임 간 시간적 일관성을 보장한다. 또한 제로샷 일반화를 지원하여 훈련 중 명시적으로 보지 못한 프롬프트도 언어와 시각적 개념에 대한 이해를 활용해 처리할 수 있다.
주목할 만한 기능 중 하나는 여러 장면이나 사건을 가진 비디오를 생성할 수 있는 능력으로, 모델이 시간이 지남에 따라 다양한 시각적 상태 간 전환할 수 있다. 이는 모델이 미리 계획하고 내러티브 일관성을 유지할 수 있게 하는 자기회귀 토큰 생성을 통해 달성된다. 그러나 출력 해상도는 상대적으로 낮으며, 일반적으로 약 128x128 픽셀이고, 비디오는 수 초로 짧지만 길이를 확장할 수 있다.
다른 모델과의 비교
Phenaki는 OpenAI 및 다른 연구 그룹의 모델과 비슷한 시기에 개발되었다. 확산 기반 접근 방식을 사용하는 일부 모델과 달리, Phenaki의 트랜스포머 기반 방법은 다른 절충점을 제공한다. 더 긴 시퀀스를 생성할 수 있지만 더 높은 해상도에서 세부적인 디테일에는 어려움을 겪을 수 있다. 가변 길이 기능은 핵심 차별점이며, 많은 동시대 모델이 고정 길이 클립으로 제한되었다.
생성형 AI의 더 넓은 맥락에서 Phenaki는 텍스트와 비디오를 연결하는 다중 모달 모델의 진화에 기여한다. 그 아키텍처는 특히 시간적 데이터를 위한 토크나이제이션과 자기회귀 모델링의 사용에서 이후 비디오 생성 연구에 영향을 미쳤다.
한계 및 향후 방향
연구 프로토타입인 Phenaki는 여러 가지 한계가 있다. 생성된 비디오는 저해상도이며 깜빡임이나 객체 외관의 불일치와 같은 아티팩트가 나타날 수 있다. 또한 훈련과 추론에 상당한 계산 리소스가 필요하여 접근성을 제한한다. 추가적으로, 훈련 데이터에는 편향이 포함될 수 있으며, 모델은 이러한 편향을 반영한 콘텐츠를 생성할 수 있어 배포에 대한 윤리적 우려를 제기한다.
이 분야의 미래 연구는 해상도, 시간적 일관성, 생성 콘텐츠에 대한 제어를 개선하는 것을 목표로 한다. 연구자들은 트랜스포머와 확산 방법을 결합한 하이브리드 접근 방식과 더 효율적인 토크나이제이션 기법을 탐구하고 있다. 2025년 기준으로 텍스트-비디오 생성은 크게 발전하여 더 높은 해상도와 더 긴 비디오를 생성할 수 있는 모델이 등장했지만, Phenaki는 해당 분야의 기초적 기여로 남아 있다.
영향 및 평가
Phenaki의 도입은 AI 연구 커뮤니티에서 관심을 받았다. 이는 딥러닝 모델이 텍스트에서 일관된 비디오를 생성하는 실행 가능성을 입증했기 때문이다. 자동화된 비디오 제작 및 창의적 응용 도구와 같은 가능성을 강조했다. 상업적으로 배포되지는 않았지만, Phenaki의 원리는 이후 비디오 생성 연구, 특히 시간적 데이터를 위한 토크나이제이션과 자기회귀 모델링 사용에 영향을 주었다.
같이 보기
참고 문헌
- Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions, Google DeepMind 연구 논문, 2022.
- 텍스트-비디오 생성 관련 후속 연구 작업.