영어에서 번역됨

Parti-20B는 Google이 개발한 200억 개의 매개변수를 가진 자기회귀적 텍스트-이미지 모델로, 시퀀스-투-시퀀스 트랜스포머 아키텍처를 사용하여 텍스트 설명에서 고충실도 이미지를 생성합니다.

Parti-20B는 텍스트-이미지 생성을 위한 200억 개의 매개변수를 가진 AI 모델로, Google Research에서 개발했다. Parti 계열에 속하며, 이미지 생성을 시퀀스-투-시퀀스 문제로 취급하는데, 여기서 Transformer (architecture) 인코더가 텍스트를 처리하고 디코더가 시각적 토큰을 예측한다. Parti-20B는 이 시리즈에서 가장 큰 변형으로, 복잡한 프롬프트에서 고도로 세부적이고 의미적으로 정렬된 이미지를 생성하도록 설계되었다.

이 모델은 Sequence-to-Sequence (Seq2Seq) 학습 개념을 기반으로 하며, 텍스트 입력을 이미지 토큰의 격자에 매핑하는 신경망 아키텍처를 활용한다. 확산 기반 접근 방식과 달리 Parti-20B는 자기회귀 디코더를 사용하여 이미지 패치를 순차적으로 생성한다. 이 설계는 모델 크기에 따라 효과적으로 확장되어 충실도와 구성 이해를 개선할 수 있게 한다.

아키텍처 및 훈련

Parti-20B는 Encoder-Decoder Architecture 트랜스포머를 사용하며, 인코더는 Multi-Head AttentionPositional Encoding을 사용하여 텍스트 프롬프트를 처리한다. 디코더는 학습된 코드북을 통해 픽셀로 매핑되는 이산 시각적 토큰의 시퀀스를 예측한다. 훈련에는 대규모 이미지-텍스트 쌍 데이터 세트가 포함되며, Adam (Optimizer)Learning Rate Scheduling을 사용한 최적화가 이루어진다. 모델은 안정성을 위해 Layer NormalizationDropout을 사용하고, 대규모 훈련을 처리하기 위해 Gradient Clipping을 사용한다.

자기회귀 생성 과정은 Beam Search 또는 Top-K SamplingTop-P (Nucleus) Sampling과 같은 샘플링 전략에 의존하며, 다양성을 제어하기 위해 Temperature Scaling을 사용한다. Parti-20B의 규모는 질감과 공간 관계와 같은 미세한 세부 사항을 포착할 수 있게 하며, 이는 더 작은 모델이 놓치는 부분이다.

기능 및 성능

Parti-20B는 여러 객체, 속성 및 공간 제약이 포함된 복잡한 프롬프트를 따르는 데 탁월하다. 사실적인 이미지, 예술적 스타일 및 새로운 구성을 생성할 수 있다. 이전 모델과 비교하여 제로샷 일반화에서 상당한 개선을 보여주며, 미세 조정 없이 보지 못한 프롬프트를 처리할 수 있다. 모델은 또한 훈련 중 Data Augmentation을 지원하여 견고성을 향상시킨다.

벤치마크 평가에서 Parti-20B는 텍스트-이미지 작업에서 최첨단 결과를 달성했으며, FID(Fréchet Inception Distance) 및 인간 선호도 점수에서 많은 동시대 모델을 능가했다. 200억 개의 매개변수는 더 넓은 범위의 시각적 개념을 표현할 수 있게 하지만, 추론에 상당한 계산 리소스가 필요하다.

다른 모델과의 관계

Parti-20B는 DALL-E 및 Stable Diffusion과 같은 모델과 함께 Generative AI의 더 넓은 추세의 일부이다. 확산 모델과 달리 자기회귀 접근 방식을 사용하며, 일부 연구자들은 이 접근 방식이 더 나은 제어 가능성을 제공한다고 주장한다. 이 모델은 Large language model 기술과 관련이 있으며, 트랜스포머 백본과 이미지에 적응된 훈련 목표를 공유한다. 또한 확장 법칙에 대한 Machine learning 연구와 연결되며, 더 큰 모델이 일관되게 성능을 향상시킨다.

Google은 Parti-20B를 공개적으로 출시하지 않았으며, 내부 연구 및 선별된 파트너로 접근을 제한했다. 이는 오픈 소스 노력과 대조되지만, 독점 AI 시스템을 개발하는 회사의 전략과 일치한다. 이 모델의 아키텍처는 토큰화 및 디코딩 효율성 개선을 포함하여 이후의 텍스트-이미지 생성 작업에 영향을 미쳤다.

한계 및 윤리적 고려 사항

많은 텍스트-이미지 모델과 마찬가지로 Parti-20B는 필터링되지 않은 인터넷 데이터로 훈련된 경우 편향되거나 유해한 출력을 생성할 수 있다. 또한 드문 개념이나 모호한 프롬프트로 어려움을 겪을 수 있으며, 때로는 무의미한 결과를 생성할 수 있다. 200억 개의 매개변수 모델을 실행하는 계산 비용은 높으며, Google Cloud TPU 또는 GPU와 같은 특수 하드웨어가 필요하여 접근성을 제한한다.

연구자들은 프롬프트 필터링 및 출력 조정과 같은 안전 조치의 필요성을 강조했다. Parti-20B의 개발은 또한 저작권 및 기만적인 이미지 생성에 대한 오용 가능성에 대한 질문을 제기한다. 2023년 현재 이러한 우려는 AI 커뮤니티에서 여전히 활발하며, 책임 있는 배포를 요구하고 있다.

유산 및 영향

Parti-20B는 자기회귀 모델을 수백억 개의 매개변수로 확장하는 것이 이미지 생성에 실행 가능함을 입증했으며, Imagen 및 Gemini와 같은 이후 모델의 길을 열었다. 그 성공은 Deep learning에서 모델 규모의 중요성을 강화했고, 효율적인 트랜스포머에 대한 추가 연구를 촉진했다. 공개적으로 사용할 수는 없지만, 그 기술적 기여는 연구 논문에 문서화되어 학계와 산업계 노력에 영향을 미쳤다.

이미지를 시퀀스로 취급하는 모델의 접근 방식은 비디오 생성 및 3D 장면 합성과 같은 다른 영역에도 적용되었다. Parti-20B는 자기회귀 및 확산 기반 생성 모델 간의 절충점을 이해하기 위한 참조 지점으로 남아 있으며, 그 발견은 차세대 시스템 설계에 계속 정보를 제공하고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·text-to-image·transformer·google-deepmind
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사