영어에서 번역됨

Parti는 Google이 개발한 자기회귀적(autoregressive) 텍스트-이미지 모델로, 텍스트 설명으로부터 고충실도(high-fidelity) 이미지를 생성합니다. 이 모델은 트랜스포머 기반의 시퀀스-투-시퀀스(sequence-to-sequence) 접근 방식을 사용하여 시각적 토큰의 시퀀스로 이미지를 생성합니다.

Parti는 Google DeepMind가 개발한 자기회귀적(autoregressive) 텍스트-이미지 생성 모델이다. 이미지 생성을 시퀀스-투-시퀀스(sequence-to-sequence) 문제로 취급하여 텍스트 설명으로부터 이미지를 생성하며, 이는 대규모 언어 모델이 텍스트를 생성하는 방식과 유사하다. Parti는 2022년에 소개되었으며, 여러 객체와 특정 속성을 포함한 복잡한 프롬프트에서 고품질의 사실적인 이미지를 생성하는 능력으로 주목받았다.

이 모델은 먼저 인코더를 사용하여 입력 텍스트 프롬프트를 토큰 시퀀스로 변환한 다음, 디코더가 이미지 토큰 시퀀스를 자기회귀적으로 예측하는 방식으로 작동한다. 이러한 이미지 토큰은 별도로 학습된 이산적(discrete) 시각 코드북에서 파생된다. 이러한 접근 방식 덕분에 Parti는 모델 크기와 학습 데이터에 따라 확장이 가능하며, 이미지 품질과 의미론적 정렬(semantic alignment)이 향상되었다.

아키텍처

Parti의 아키텍처는 트랜스포머 모델을 기반으로 한다. 인코더-디코더 구조를 사용하며, 인코더는 텍스트를 처리하고 디코더는 이미지 토큰 시퀀스를 생성한다. 시각 토큰은 토크나이저 역할을 하는 사전 학습된 Vision Transformer(ViT) 모델에서 얻어진다. 디코더는 주어진 텍스트와 이전에 생성된 토큰을 바탕으로 다음 이미지 토큰을 예측하도록 학습되며, 이는 머신 러닝 시퀀스 모델링과 유사한 과정이다.

모델은 3억 5천만 개에서 200억 개에 이르는 다양한 크기의 매개변수로 학습되었다. 가장 큰 변형 모델인 Parti-20B는 MS-COCO 및 Localized Narratives와 같은 벤치마크에서 최첨단 성능을 입증했으며, 생성된 이미지와 실제 이미지 분포 간의 유사성을 측정하는 FID(Fréchet Inception Distance) 점수에서 우수한 결과를 기록했다.

학습 및 데이터

Parti는 공개적으로 이용 가능한 웹 데이터와 독점 데이터 세트를 포함한 대규모 이미지-텍스트 쌍 데이터로 학습되었다. 학습 과정은 두 단계로 진행된다. 첫 번째 단계에서는 ViT 기반 토크나이저를 사용하여 시각 코드북을 학습하고, 두 번째 단계에서는 이산적 이미지 토큰을 텍스트로부터 예측하도록 자기회귀 트랜스포머를 학습한다. 모델은 이산적 이미지 토큰에 대한 표준 교차 엔트로피 손실(cross-entropy loss)을 사용하여 최적화되었다.

역량 및 한계

Google은 모델 크기와 학습 데이터를 확장함에 따라 이미지 품질이 지속적으로 개선되었으며, 특히 구성적 추론(compositional reasoning)이 필요한 복잡한 프롬프트에서 두드러진 향상을 보고했다. 또한 Parti는 여러 객체, 공간적 관계, 스타일 속성을 포함한 프롬프트를 처리하는 능력을 보여주었다.

역량 및 한계

Parti는 높은 충실도와 의미론적 정확성을 가진 이미지를 생성하는 데 뛰어나다. "모자를 쓴 고양이 사진"이나 "일몰의 미래 도시 그림"과 같은 특정 장면을 설명하는 프롬프트로 이미지를 생성할 수 있다. 또한 많은 이미지 생성 모델이 어려워하는 텍스트 렌더링도 지원한다. 그러나 Parti는 객체 수를 잘못 세거나 세부 속성이 일치하지 않는 등 미세한 부분에서 오류를 범할 수 있으며, 학습과 추론에 상당한 계산 자원이 필요하다는 한계가 있다.

다른 모델과의 비교

Parti는 DALL-E 2 및 Imagen과 같은 다른 텍스트-이미지 생성 모델과 동시에 개발되었다. Imagen이 확산 기반(diffusion-based) 접근 방식을 사용하는 반면, Parti는 자기회귀적 방식을 사용하여 시퀀스 모델링의 발전을 활용할 수 있었다. 평가에서 Parti-20B는 MS-COCO 벤치마크에서 DALL-E 2 및 Imagen과 비교하여 FID 점수와 인간 평가 측면에서 경쟁력 있거나 우수한 결과를 달성했다. 그러나 Imagen과 같은 확산 모델은 특정 미적 품질에서 강점을 보였으며, Parti는 의미론적 정렬과 복잡한 추론에서 우수함을 입증했다.

영향 및 유산

Parti는 생성형 AI의 이미지 합성 분야 발전에 크게 기여했다. 그 자기회귀적 접근 방식은 텍스트와 이미지를 공유 토큰 공간에서 처리하는 통합 멀티모달 모델에 대한 후속 연구에 영향을 미쳤다. Parti의 코드북 및 확장에 대한 통찰력은 이후 텍스트, 이미지, 오디오 생성을 통합하는 Gemini 모델 제품군과 같은 다른 Google 모델에 채택되었다. 또한 이 모델은 딥 러닝 연구에서 비전-언어 작업의 확장 법칙(scaling laws)의 중요성을 강조했다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:text-to-image·google-deepmind·autoregressive-model·generative-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사