Veo 2는 Google DeepMind가 개발한 Generative AI 비디오 모델이다. 2024년 12월 16일에 공개되었으며, 텍스트 프롬프트에서 비디오를 생성하며, 같은 해 초 Google I/O에서 출시된 전작 Veo의 기반 위에 구축되었다. 이 모델은 최대 4K(4096x2304 픽셀) 해상도의 비디오를 생성하도록 설계되었으며, 최대 8초 길이를 지원하고 특정 도구에서는 확장 클립 옵션을 제공한다.
이 모델은 Deep learning 기술, 특히 Transformer (architecture) 기반 프레임워크를 활용하는 Machine learning 아키텍처에서 작동한다. 텍스트 입력을 토크나이저를 통해 처리하고 시간적 확산 과정을 사용하여 프레임을 합성한 다음, U-Net 기반 정제 네트워크를 사용하여 업스케일링한다. 이 2단계 접근 방식 - 먼저 잠재 비디오 표현을 생성한 다음 전체 해상도로 향상 - 을 통해 Veo 2는 일관된 움직임, 조명, 물리 현상을 갖춘 복잡한 장면을 처리할 수 있다.
기능
Veo 2는 자연어 이해에 탁월하며, 상세한 프롬프트를 시각적으로 일관된 영상으로 변환한다. 팬, 줌, 틸트와 같은 카메라 움직임과 같은 영화적 효과를 처리하고 얕은 피사계 심도 및 광각 촬영을 포함한 다양한 렌즈 유형을 모방할 수 있다. 이 모델은 또한 합성된 비디오에 대한 오디오 생성을 지원하여 동기화된 음향 효과와 주변 소음을 생성하며, 이 기능은 공동 비디오-오디오 생성 파이프라인을 통해 통합된다.
공개 벤치마크에서 Veo 2는 92%의 정확도를 달성했다. 결국 이 수치는 프롬프트 준수와 시간적 일관성을 측정하는 내부 테스트에서의 성능을 반영한 것으로, 인간 평가자가 실시한 측면 비교 평가에서 OpenAI의 Sora 및 Anthropic 지원 도구와 같은 경쟁 모델을 능가했다.
출시 및 이용 가능성
Veo 2는 Google Cloud Vertex AI 플랫폼을 통해 도입되어 기업 사용자가 API를 통해 액세스할 수 있게 되었다. 또한 Google VideoFX 도구 및 YouTube의 Shorts용 Dream Screen과 같은 실험적 기능을 포함한 Google의 소비자 제품에서도 사용할 수 있게 되었다. 이 모델은 액세스가 제한되었던 첫 번째 Veo의 후속 모델로 자리 잡았으며, 출시와 함께 Google DeepMind의 SynthID 기술을 통한 워터마킹이 적용되어 AI 생성 콘텐츠를 표시했다.
2024년 12월의 출시일은 Veo 2를 Runway의 Gen-3 및 OpenAI의 Sora Turbo를 포함한 다른 비디오 생성기와 경쟁 구도에 놓이게 했으며, 이들 모두 2024년 말에 출시되었다. Google DeepMind는 안전 조치를 강조하며, 출력을 의도된 프롬프트에 맞추고 유해한 콘텐츠를 줄이기 위해 Reinforcement Learning from AI Feedback (RLAIF)(인공 피드백 기반 강화 학습)을 구현했다.
기술 사양
입력 처리는 Large language model 시스템과 유사하게 텍스트를 잠재 공간에 매핑하는 토크나이저를 사용하며, 이는 Multi-Head Attention에 대한 Google DeepMind의 연구에 의해 영향을 받았다. 생성은 360p 해상도의 기본 프레임으로 시작하여 반복적으로 정제되고 초해상도 네트워크를 통해 최종 출력으로 업스케일링된다. 모델의 훈련에는 10,000시간 이상의 라이선스 비디오 영상으로 구성된 데이터 세트가 사용되었지만, 정확한 세부 사항은 기업 기밀 유지에 따라 공개되지 않았다.
추론 시간은 하드웨어에 따라 다르다. 단일 NVIDIA A100 GPU에서 5초 1080p 클립은 약 21분 만에 생성할 수 있으며, Google Cloud의 TPU v5e 클러스터에 배포하면 2분 미만으로 단축된다. 모델의 매개변수 수는 특허 출원 및 기술 백서를 기반으로 약 150억 개로 추정되지만, Google DeepMind는 이 수치를 공식적으로 확인하지 않았다.
한계
발전에도 불구하고 Veo 2는 특정 작업에서 어려움을 겪는다. 생성된 비디오는 특히 저조도 장면에서 왜곡된 손가락이나 부자연스러운 눈 움직임과 같은 인간 실루엣의 시각적 아티팩트를 나타낼 수 있다. 프레임 내 텍스트 렌더링(예: 표지판 또는 자막)은 비라틴 문자에서 종종 왜곡된 출력을 생성한다. 모델은 또한 8초의 고정 생성 길이를 가지며, 더 긴 요청은 여러 클립을 이어 붙여야 하므로 조명의 불연속성이 발생할 수 있다.
물리 시뮬레이션은 개선되었지만 완벽하지 않다 - 복잡한 상호 작용에서 물체가 표면을 관통하거나 잘못된 중력으로 떨어질 수 있다. 내부 테스트에서 인간 판단은 Veo 2 샘플의 38%를 "실제와 구별할 수 없음"으로 평가하여 사진적 사실주의의 50% 임계값보다 낮았다.
윤리 및 법적 맥락
Veo 2의 배포는 Deep learning 오용에 대한 우려를 제기하여 Google은 초기에 승인된 파트너로 액세스를 제한했다. 유럽 연합에서는 투명성 요구 사항과 관련하여 AI Act 준수로 인해 모델 출시가 지연되었다. Carnegie Mellon University 및 MIT CSAIL 그룹을 포함한 학계 연구자들은 탐지 취약성을 연구했으며, SynthID 워터마크가 압축을 통해 지속되지만 적대적 편집으로 제거될 수 있음을 발견했다.
일부 경쟁사와 달리 Veo 2는 D-Wave 또는 양자 컴퓨팅 요소를 통합하지 않으며, 고전적인 Neural network 가속에만 의존한다. 모델의 아키텍처는 Runway의 Gen-2와 같은 오픈 소스 프로젝트와 설계 원리를 공유하지만, 프레임별 사실성보다 시간적 일관성을 우선시하는 독점 훈련 목표를 사용한다.
평가 및 향후 전망
업계 분석가들은 Veo 2를 Google DeepMind의 중요한 진전으로 언급하며, 이 연구소를 실제 비디오 합성 분야의 선두주자로 자리매김했다고 평가했다. Waymo의 경쟁사와 같은 시뮬레이션 분야의 영화 제작 초기 채택자들은 공개 결과를 발표하지 않고 훈련 시나리오 생성용으로 테스트했다. 2025년 초 현재 Google DeepMind는 모델을 계속 반복하고 있으며, 더 긴 길이와 대화형 편집 기능을 갖춘 Veo 3에 대한 추측이 있지만 공식 발표는 없었다.