Muse는 2023년 1월 연구 논문에서 처음 발표된 Google이 개발한 텍스트-이미지 생성 모델이다. 이는 트랜스포머 기반 모델 계열에 속하며, 텍스트 설명에서 고해상도 이미지를 생성하도록 설계되었다. Stable Diffusion이나 DALL-E와 같은 확산 기반 모델과 달리, Muse는 압축된 이미지 공간에서 이산 토큰을 사용하며, 대규모 언어 모델에서 영감을 받은 마스크 생성 접근 방식을 사용한다.
이 모델은 Google과 Google DeepMind의 연구자들이 개발했으며, 벡터 양자화 및 트랜스포머 아키텍처에 대한 이전 연구를 기반으로 한다. "Muse: Text-To-Image Generation via Masked Generative Transformers"라는 논문에서 공개적으로 상세히 설명되었으며, MS-COCO와 같은 벤치마크에서 최첨단 결과와 제로샷 생성 능력을 입증했다. Google은 Muse를 확산 모델보다 더 효율적인 대안으로 포지셔닝했으며, 경쟁력 있는 이미지 품질을 유지하면서 더 빠른 추론 시간을 주장했다.
아키텍처
Muse는 2단계 파이프라인을 사용한다. 먼저, 사전 훈련된 변분 오토인코더(VAE)가 이미지를 이산 토큰 그리드로 압축하며, 이는 VQGAN 또는 VQ-VAE에서 사용된 접근 방식과 유사하다. 둘째, 트랜스포머 모델은 동결된 대규모 언어 모델(구체적으로 T5)에서 생성된 텍스트 임베딩에 조건화되어 이 그리드의 마스크된 토큰을 예측하도록 훈련된다. 생성 중에 모델은 모든 토큰이 마스크된 상태로 시작하여 가장 확실한 토큰을 반복적으로 예측하고 여러 단계에 걸쳐 나머지를 채운다. 이 마스크 모델링 기술은 병렬 디코딩을 허용하여 자동 회귀 모델에 비해 생성을 가속화한다.
텍스트 인코더는 동결된 T5-XXL 모델로, 풍부한 의미 표현을 제공한다. 이미지 토크나이저는 대규모 이미지 데이터셋에서 훈련된 VAE로, 구성에 따라 256x256 또는 512x512 토큰 그리드를 생성한다. 트랜스포머 자체는 표준 인코더-디코더 아키텍처로, 텍스트 임베딩이 인코더 입력이고 마스크된 이미지 토큰이 디코더 입력이다.
훈련 및 데이터
Muse는 공개적으로 사용 가능한 LAION-5B 데이터셋과 Google 내부 데이터셋을 포함한 대규모 이미지-텍스트 쌍 코퍼스에서 훈련되었다. 훈련 과정은 두 단계로 구성되었다. 먼저, VAE가 이미지 단독으로 별도로 훈련되었고, 그 다음 트랜스포머가 텍스트와 마스크되지 않은 컨텍스트가 주어졌을 때 마스크된 토큰을 예측하도록 훈련되었다. 모델은 TPU v4 포드에서 훈련되었으며, 가장 큰 변형은 30억 개의 매개변수를 가졌다. 논문은 Muse가 MS-COCO에서 7.9의 제로샷 FID 점수를 달성하여 당시 GLIDE 및 DALL-E 2와 같은 초기 확산 모델을 능가했다고 보고했다.
기능
이 모델은 텍스트-이미지 생성 외에도 여러 작업을 지원한다. 입력 이미지를 부분적으로 마스크하고 텍스트 프롬프트를 제공하여 로컬 변경을 허용하는 이미지 편집을 수행할 수 있다. 또한 아웃페인팅(이미지를 경계 너머로 확장)과 인페인팅(누락된 영역 채우기)을 지원한다. 추가로, Muse는 가변 종횡비로 이미지를 생성할 수 있으며 특정 스타일이나 도메인에 맞게 미세 조정할 수 있다. 논문은 Muse가 단일 TPU에서 약 1.5초 만에 고품질 512x512 이미지를 생성할 수 있음을 입증했으며, 이는 많은 디노이징 단계가 필요한 확산 모델보다 훨씬 빠르다.
다른 모델과의 비교
Muse는 종종 확산 프로세스를 사용하는 DALL-E 2 및 Imagen과 비교된다. 확산 모델은 점진적으로 노이즈를 추가하고 제거하며 수백 단계가 필요하다. 반면, Muse는 이산 토큰 접근 방식과 반복적 마스크 해제를 사용하며 일반적으로 10-20단계만 필요하다. 이는 추론 중 계산 효율성을 높인다. 그러나 확산 모델은 단순성과 견고성 때문에 생산 시스템에서 더 널리 채택되었다. Muse의 이산 토큰 공간에 대한 의존성은 특히 복잡한 질감이나 미세한 세부 사항에서 때때로 아티팩트를 유발할 수 있다.
수용 및 영향
Muse는 이미지 도메인에서 마스크 모델링의 혁신적인 사용으로 연구 커뮤니티에서 좋은 평가를 받았다. 이는 이후의 이산 확산 및 토큰 기반 생성 연구에 영향을 미쳤다. 그러나 Google은 Imagen이나 Gemini와 같은 이후 모델과 달리 Muse를 공개 제품이나 API로 출시하지 않았다. 코드와 가중치는 오픈소스로 공개되지 않아 재현성을 제한했다. 그럼에도 불구하고 Muse의 아이디어는 이후 Google 모델에 통합되었으며 Parti 및 MuseGAN과 같은 오픈소스 노력에 영감을 주었다.
같이 보기
참고 문헌
- Chang, H., et al. (2023). "Muse: Text-To-Image Generation via Masked Generative Transformers." arXiv:2301.00704.
- Google AI Blog. (2023). "Muse: A New Text-to-Image Model."