완(Wan) 2.1은 알리바바 클라우드가 개발한 생성형 인공지능 모델로, 텍스트 설명으로부터 이미지와 비디오를 생성한다. 2025년 오픈소스 모델로 출시되어 연구자와 개발자가 다양한 애플리케이션에 다운로드하여 사용할 수 있게 되었다. 이 모델은 더 넓은 완(Wan) 모델 계열의 일부이며, 이미지 및 비디오 생성 작업을 모두 처리하도록 설계되었고, 중국어와 영어를 포함한 여러 언어의 텍스트 프롬프트를 지원한다.
이 모델은 트랜스포머 네트워크와 확산 기법을 활용하는 딥러닝 아키텍처를 기반으로 구축되었다. 고해상도 이미지와 짧은 비디오 클립을 생성할 수 있으며, 텍스트-이미지, 텍스트-비디오, 이미지-비디오 생성 기능을 포함한다. 완 2.1은 효율성과 품질로 주목할 만하며, VBench 비디오 생성 평가 제품군과 같은 벤치마크에서 경쟁력 있는 결과를 달성한다.
아키텍처 및 학습
완 2.1은 다른 현대 비디오 생성 모델과 유사하게 멀티 헤드 어텐션 메커니즘과 결합된 U-Net 기반 확산 백본을 사용한다. 이 모델은 텍스트와 시각 데이터가 쌍으로 구성된 대규모 데이터셋에서 학습되며, 일반화를 개선하기 위해 데이터 증강 및 커리큘럼 학습과 같은 기법을 사용한다. 다양한 종횡비와 해상도를 지원하며, 비디오의 경우 일반적으로 480p에서 720p, 이미지의 경우 최대 1080p의 출력 크기를 제공한다.
학습 과정은 Adam 최적화와 학습률 스케줄링, 그래디언트 클리핑을 활용하여 수렴을 안정화한다. 이 모델은 이미지용 13억 파라미터 버전과 비디오 생성용 140억 파라미터 버전을 포함한 여러 파라미터 크기로 제공되며, 소비자 하드웨어에 최적화된 더 작은 변형도 있다.
기능 및 사용 사례
완 2.1은 초당 24프레임으로 최대 5초 길이의 비디오를 생성할 수 있으며, 중국어와 영어 프롬프트를 모두 지원한다. 또한 정적 이미지를 텍스트 설명에 따라 애니메이션화할 수 있는 이미지-비디오 기능도 제공한다. 이 모델은 창의적 콘텐츠 제작, 광고, 교육 미디어 분야의 애플리케이션을 위해 설계되었으며, 기업용으로 알리바바 클라우드의 모델 스튜디오(Model Studio) 플랫폼에 통합되었다.
생성 외에도 완 2.1은 텍스트 지침에 따라 기존 이미지를 수정할 수 있는 텍스트-이미지 편집 기능을 포함한다. 이 모델은 원치 않는 요소를 제외하기 위한 네거티브 프롬프트를 지원하며, 카메라 움직임과 스타일 제어 기능을 제공하여 전문적인 비디오 편집 워크플로우에 적합하다.
출시 및 가용성
완 2.1은 Apache 2.0 라이선스로 오픈소스화되었으며, 모델 가중치와 추론 코드가 Hugging Face 및 GitHub와 같은 플랫폼에 공개되었다. 출시에는 Wan2.1-T2V-1.3B 및 Wan2.1-T2V-14B와 같은 여러 변형이 포함되어 다양한 컴퓨팅 예산에 대응했다. 오픈소스 특성 덕분에 양자화 및 파인튜닝 스크립트를 포함한 커뮤니티 적응이 이루어져, 소비자 GPU에서 메모리 요구 사항을 줄여 배포할 수 있게 되었다.
알리바바 클라우드는 또한 상업 사용자를 위한 API 접근이 가능한 관리형 서비스로 이 모델을 제공한다. 이 모델은 wikiprompt 플랫폼에서 423개 이상의 프롬프트에서 인용되어 AI 애호가와 연구자 사이에서 인기를 입증했다.
성능 및 평가
벤치마크 평가에 따르면 완 2.1은 텍스트-비디오 생성과 같은 작업에서 강력한 성능을 달성하며, 모션 품질 및 시간적 일관성과 같은 지표에서 높은 점수를 받는다. 독립적인 리뷰는 복잡한 장면 처리 능력과 다국어 지원을 칭찬했지만, 일부 사용자는 더 큰 변형에서 상당한 GPU 메모리가 필요하다고 지적한다. 이 모델은 OpenAI의 Sora 및 Google 딥마인드의 Veo와 같은 다른 모델과 함께 오픈소스 비디오 생성에 중요한 기여로 간주되지만, 완 2.1은 완전히 오픈소스라는 점에서 차별화된다.