SD3 Large는 Stability AI가 개발한 이미지 합성을 위한 Generative AI 모델이다. 2024년에 출시되었으며, 텍스트 설명에서 고해상도 이미지를 생성하는 데 중점을 둔 Stable Diffusion 3 제품군의 일부이다. 이 모델은 프롬프트 준수, 사실적 표현, 이미지 내 텍스트 렌더링과 같은 영역에서 이전 Stable Diffusion 버전보다 개선되도록 설계되었다.
SD3 Large는 텍스트-이미지 모델로, 이전 모델들의 U-Net 기반 설계와 달리 Transformer (architecture) 기반 아키텍처를 사용한다. Multi-Head Attention 메커니즘을 통합하며, 대규모 이미지-텍스트 쌍 데이터셋으로 훈련되었다. 이 모델은 최대 1024x1024 픽셀 해상도의 이미지를 생성할 수 있으며, 인페인팅 및 아웃페인팅 기능을 지원하여 기존 이미지를 편집하고 확장할 수 있다.
아키텍처
SD3 Large의 기본 아키텍처는 확산 모델로, 텍스트 프롬프트의 안내에 따라 노이즈가 있는 이미지를 반복적으로 정제하여 깨끗한 출력을 생성한다. 수십억 개의 매개변수를 가진 Neural network을 사용하여 Stable Diffusion 시리즈에서 더 큰 모델 중 하나이다. 이 모델은 Cross-Attention 메커니즘을 사용하여 텍스트 임베딩을 이미지 특징과 정렬함으로써 생성된 콘텐츠를 정밀하게 제어할 수 있다. 이전 버전이 Residual Network (ResNet) 블록에 의존했던 것과 달리, SD3 Large는 순수 트랜스포머 백본을 활용하여 확장성과 성능을 개선한다.
기능
SD3 Large는 이전 텍스트-이미지 모델에서 흔한 과제였던 정확한 텍스트 렌더링으로 이미지를 생성하는 데 뛰어나다. 사실적 표현부터 예술적 스타일까지 다양한 스타일을 지원하며, 여러 객체와 속성을 포함한 복잡한 프롬프트를 처리할 수 있다. 또한 출력에서 피해야 할 사항을 지정할 수 있는 네거티브 프롬프트와 프롬프트 준수를 제어하는 가이던스 스케일 매개변수와 같은 고급 기능을 제공한다. 훈련 중에는 Adam (Optimizer) 사용에 최적화되어 있지만, 추론은 Top-P (Nucleus) Sampling 및 Temperature Scaling과 같은 표준 샘플링 기법을 사용한다.
출시 및 이용 가능성
SD3 Large는 같은 해에 출시된 SD3 Medium 이후 2024년 6월에 출시되었다. 연구 및 개인 사용을 위한 비상업적 라이선스로 제공되며, 상업용 라이선스는 Stability AI를 통해 이용할 수 있다. 이 모델은 Stability AI API를 통해 접근할 수 있으며, Amazon Web Services 및 Google Cloud와 같은 플랫폼과의 통합을 통해서도 사용할 수 있다. 또한 Hugging Face에서 다운로드할 수 있어 개발자가 AMD 및 NVIDIA GPU를 포함한 호환 하드웨어에서 로컬로 실행할 수 있다.
성능 및 평가
SD3 Large에 대한 초기 평가는 이미지 품질 및 프롬프트 충실도와 같은 벤치마크에서 이전 모델보다 상당한 개선을 보여주었다. 읽을 수 있는 텍스트를 생성하고 복잡한 장면을 처리하는 능력으로 Machine learning 커뮤니티에서 긍정적인 피드백을 받았다. 그러나 일부 사용자는 이 모델이 상당한 계산 리소스를 요구하여 고급 하드웨어가 없는 취미 사용자에게는 접근성이 낮다고 지적했다. 2024년 기준으로 SD3 Large는 Deep learning 기반 이미지 생성 분야에서 선도적인 오픈 가중치 모델 중 하나로 간주된다.
한계
강점에도 불구하고 SD3 Large에는 한계가 있다. 매우 추상적인 프롬프트나 희귀 객체와 관련된 프롬프트에서 어려움을 겪을 수 있으며, 복잡한 조명 조건에서 때때로 아티팩트를 생성할 수 있다. 또한 훈련 데이터에서 편향을 물려받아 고정관념적인 표현으로 이어질 수 있다. Stability AI는 유해 콘텐츠를 줄이기 위한 안전 필터를 구현했지만, 이는 완벽하지 않다. 다른 Large language model 관련 기술과 마찬가지로, 향후 반복에서 이러한 문제를 해결하기 위한 지속적인 연구가 진행 중이다.