Parti-20B는 텍스트-이미지 생성을 위한 200억 개의 매개변수를 가진 AI 모델로, Google Research에서 개발했다. Parti 계열에 속하며, 이미지 생성을 시퀀스-투-시퀀스 문제로 취급하는데, 여기서 Transformer (architecture) 인코더가 텍스트를 처리하고 디코더가 시각적 토큰을 예측한다. Parti-20B는 이 시리즈에서 가장 큰 변형으로, 복잡한 프롬프트에서 고도로 세부적이고 의미적으로 정렬된 이미지를 생성하도록 설계되었다.
이 모델은 Sequence-to-Sequence (Seq2Seq) 학습 개념을 기반으로 하며, 텍스트 입력을 이미지 토큰의 격자에 매핑하는 신경망 아키텍처를 활용한다. 확산 기반 접근 방식과 달리 Parti-20B는 자기회귀 디코더를 사용하여 이미지 패치를 순차적으로 생성한다. 이 설계는 모델 크기에 따라 효과적으로 확장되어 충실도와 구성 이해를 개선할 수 있게 한다.
아키텍처 및 훈련
Parti-20B는 Encoder-Decoder Architecture 트랜스포머를 사용하며, 인코더는 Multi-Head Attention과 Positional Encoding을 사용하여 텍스트 프롬프트를 처리한다. 디코더는 학습된 코드북을 통해 픽셀로 매핑되는 이산 시각적 토큰의 시퀀스를 예측한다. 훈련에는 대규모 이미지-텍스트 쌍 데이터 세트가 포함되며, Adam (Optimizer)와 Learning Rate Scheduling을 사용한 최적화가 이루어진다. 모델은 안정성을 위해 Layer Normalization과 Dropout을 사용하고, 대규모 훈련을 처리하기 위해 Gradient Clipping을 사용한다.
자기회귀 생성 과정은 Beam Search 또는 Top-K Sampling 및 Top-P (Nucleus) Sampling과 같은 샘플링 전략에 의존하며, 다양성을 제어하기 위해 Temperature Scaling을 사용한다. Parti-20B의 규모는 질감과 공간 관계와 같은 미세한 세부 사항을 포착할 수 있게 하며, 이는 더 작은 모델이 놓치는 부분이다.
기능 및 성능
Parti-20B는 여러 객체, 속성 및 공간 제약이 포함된 복잡한 프롬프트를 따르는 데 탁월하다. 사실적인 이미지, 예술적 스타일 및 새로운 구성을 생성할 수 있다. 이전 모델과 비교하여 제로샷 일반화에서 상당한 개선을 보여주며, 미세 조정 없이 보지 못한 프롬프트를 처리할 수 있다. 모델은 또한 훈련 중 Data Augmentation을 지원하여 견고성을 향상시킨다.
벤치마크 평가에서 Parti-20B는 텍스트-이미지 작업에서 최첨단 결과를 달성했으며, FID(Fréchet Inception Distance) 및 인간 선호도 점수에서 많은 동시대 모델을 능가했다. 200억 개의 매개변수는 더 넓은 범위의 시각적 개념을 표현할 수 있게 하지만, 추론에 상당한 계산 리소스가 필요하다.
다른 모델과의 관계
Parti-20B는 DALL-E 및 Stable Diffusion과 같은 모델과 함께 Generative AI의 더 넓은 추세의 일부이다. 확산 모델과 달리 자기회귀 접근 방식을 사용하며, 일부 연구자들은 이 접근 방식이 더 나은 제어 가능성을 제공한다고 주장한다. 이 모델은 Large language model 기술과 관련이 있으며, 트랜스포머 백본과 이미지에 적응된 훈련 목표를 공유한다. 또한 확장 법칙에 대한 Machine learning 연구와 연결되며, 더 큰 모델이 일관되게 성능을 향상시킨다.
Google은 Parti-20B를 공개적으로 출시하지 않았으며, 내부 연구 및 선별된 파트너로 접근을 제한했다. 이는 오픈 소스 노력과 대조되지만, 독점 AI 시스템을 개발하는 회사의 전략과 일치한다. 이 모델의 아키텍처는 토큰화 및 디코딩 효율성 개선을 포함하여 이후의 텍스트-이미지 생성 작업에 영향을 미쳤다.
한계 및 윤리적 고려 사항
많은 텍스트-이미지 모델과 마찬가지로 Parti-20B는 필터링되지 않은 인터넷 데이터로 훈련된 경우 편향되거나 유해한 출력을 생성할 수 있다. 또한 드문 개념이나 모호한 프롬프트로 어려움을 겪을 수 있으며, 때로는 무의미한 결과를 생성할 수 있다. 200억 개의 매개변수 모델을 실행하는 계산 비용은 높으며, Google Cloud TPU 또는 GPU와 같은 특수 하드웨어가 필요하여 접근성을 제한한다.
연구자들은 프롬프트 필터링 및 출력 조정과 같은 안전 조치의 필요성을 강조했다. Parti-20B의 개발은 또한 저작권 및 기만적인 이미지 생성에 대한 오용 가능성에 대한 질문을 제기한다. 2023년 현재 이러한 우려는 AI 커뮤니티에서 여전히 활발하며, 책임 있는 배포를 요구하고 있다.
유산 및 영향
Parti-20B는 자기회귀 모델을 수백억 개의 매개변수로 확장하는 것이 이미지 생성에 실행 가능함을 입증했으며, Imagen 및 Gemini와 같은 이후 모델의 길을 열었다. 그 성공은 Deep learning에서 모델 규모의 중요성을 강화했고, 효율적인 트랜스포머에 대한 추가 연구를 촉진했다. 공개적으로 사용할 수는 없지만, 그 기술적 기여는 연구 논문에 문서화되어 학계와 산업계 노력에 영향을 미쳤다.
이미지를 시퀀스로 취급하는 모델의 접근 방식은 비디오 생성 및 3D 장면 합성과 같은 다른 영역에도 적용되었다. Parti-20B는 자기회귀 및 확산 기반 생성 모델 간의 절충점을 이해하기 위한 참조 지점으로 남아 있으며, 그 발견은 차세대 시스템 설계에 계속 정보를 제공하고 있다.