Veo는 텍스트-비디오 생성 모델 계열로, Google DeepMind가 개발했으며 2024년 5월에 처음 발표되었다. 이는 Imagen Video 및 Lumiere 연구 시스템을 포함한 Google의 초기 내부 비디오 생성 연구를 기반으로 구축되었으며, 고충실도 AI 비디오 생성의 신흥 시장에서 OpenAI의 Sora에 대한 Google의 직접적인 경쟁자로 자리매김했다.
기능 및 출시
초기 Veo 모델은 텍스트 프롬프트에서 1080p 해상도의 비디오 클립을 생성할 수 있었으며, 항공 촬영, 타임랩스, 특정 카메라 움직임과 같은 영화적 스타일을 제어할 수 있었고, 1분 이상 길이의 클립을 지원했다. Veo는 또한 정지 이미지를 생성된 움직임의 시작 프레임으로 사용하는 이미지-비디오 생성을 지원했다. 2025년 Veo 3와 함께 도입된 중요한 기능은 동기화된 오디오 생성으로, 생성된 시각적 콘텐츠에 맞춘 대화, 음향 효과, 주변 소음을 생성했으며, 이는 당시 대부분의 경쟁 비디오 모델이 별도로 제작된 오디오 트랙이 필요한 무성 비디오를 생성했던 것과 차별화되는 특징이었다.
통합
Google은 Veo를 실험적 영화 제작 및 창의적 도구를 포함한 여러 자사 제품에 통합했으며, 특히 YouTube 크리에이터가 플랫폼에서 직접 Shorts를 포함한 비디오 콘텐츠를 생성할 수 있는 기능을 제공했다. YouTube와의 긴밀한 통합은 Veo에게 독립형 비디오 생성 제품에 비해 배포상의 이점을 제공했으며, 별도의 앱이나 워크플로우를 요구하는 대신 세계 최대 비디오 플랫폼 중 하나에 AI 비디오 생성을 직접 내장했다. Veo는 또한 Google의 Gemini 앱과 기업용 Vertex AI 플랫폼을 통해 제공되었으며, 이는 Google이 Gemini 언어 모델 계열에 적용한 광범위한 배포 전략을 반영한 것이다.
경쟁 구도
Veo는 Sora, Kuaishou의 Kling, ByteDance의 Seedance, 그리고 Runway와 같은 독립 연구소와 함께 빠르게 진화하는 분야에 진입했으며, 각 경쟁사는 2024년과 2025년 내내 해상도, 클립 길이, 물리적 일관성, 프롬프트 준수 측면에서 반복적으로 개선했다. 비디오 생성 벤치마크와 커뮤니티 아레나에서의 비교 순위는 각 연구소가 업데이트된 버전을 출시함에 따라 반복적으로 변동했으며, 서로 다른 모델이 다양한 시점에 움직임 사실성, 오디오 동기화, 프롬프트 충실도와 같은 서로 다른 축에서 선두를 차지했다. 특히 Veo 3의 오디오 기능은 출시 당시 리뷰어들에 의해 의미 있는 차별점으로 널리 인용되었는데, 이는 사실적인 동기화 사운드가 비디오 생성 분야 전반에서 시각적 품질에 뒤처져 있었기 때문이다.
수용 및 우려
다른 고급 비디오 생성 시스템과 마찬가지로 Veo는 설득력 있는 딥페이크와 실제 인물의 무단 묘사를 만드는 데 악용될 가능성에 대한 조사를 받았으며, Google은 SynthID 시스템 하에서 회사의 광범위한 AI 워터마킹 노력의 일환으로 생성 콘텐츠의 가시적 및 비가시적 워터마킹을 포함한 안전장치를 구현했다. Veo의 개발은 또한 Google의 세계 모델에 대한 연구 관심의 맥락에서 논의되었으며, 일부 연구자와 Google DeepMind의 자체 커뮤니케이션은 고충실도 비디오 생성을 단순히 시각적으로 그럴듯한 이미지를 생성하는 것이 아니라 물리적 역학을 모델링하는 시스템으로 나아가는 단계로 규정했으며, 이러한 프레임은 Sora에 대해 제기된 주장을 반영했고 이러한 시스템이 실제로 얼마나 진정한 물리적 이해를 인코딩하는지에 대한 논쟁의 대상으로 남아 있다.