SDXL(Stable Diffusion XL)은 Stability AI가 개발하고 2023년 7월에 출시한, 텍스트 설명에서 이미지를 생성하는 딥러닝 모델이다. 이는 Stable Diffusion 시리즈의 후속 모델로, 이전 모델들보다 더 높은 해상도의 이미지와 개선된 구성 및 프롬프트 준수 능력을 제공하도록 설계되었다. SDXL은 오픈소스 모델로, 가중치와 코드가 공개되어 있으며, Generative AI 분야의 광범위한 맥락에서 작동한다.
이 모델은 이미지 합성에 사용된 초기 신경망의 아키텍처를 기반으로 구축되었으며, 특히 U-Net 백본과 트랜스포머 기반 텍스트 인코더를 결합한다. SDXL은 두 단계 파이프라인을 사용한다: 기본 모델이 잠재 이미지를 생성하고, 정제 모델이 세부 사항을 향상시킨다. 이 접근 방식은 이전 Stable Diffusion 버전의 512x512 픽셀에서 크게 증가한 1024x1024 픽셀의 기본 해상도로 이미지를 출력할 수 있게 한다.
아키텍처 및 훈련
SDXL은 잠재 확산 아키텍처를 사용하며, 모델은 픽셀에 직접 작동하는 대신 압축된 잠재 공간에서 작동한다. 기본 모델은 두 개의 텍스트 인코더를 통해 텍스트 프롬프트를 처리하는 교차 주의 메커니즘을 갖춘 U-Net을 사용한다: 하나는 OpenAI의 CLIP ViT-L 기반이고, 다른 하나는 OpenCLIP ViT-bigG 기반이다. 이 이중 인코더 설정은 공간 관계와 스타일 속성을 포함한 복잡한 프롬프트에 대한 모델의 이해를 향상시킨다.
SDXL의 훈련 데이터는 고품질 미학과 다양한 콘텐츠에 중점을 둔 대규모 이미지-텍스트 쌍 데이터셋을 포함했다. Stability AI는 모델이 LAION-5B 데이터셋의 필터링된 하위 집합에 추가로 선별된 데이터를 보충하여 훈련되었다고 보고했다. 훈련 과정은 광범위한 컴퓨팅 자원을 활용했지만, 하드웨어 및 기간에 대한 구체적인 세부 사항은 완전히 공개되지 않았다.
기능 및 특징
SDXL은 자연어 프롬프트에서 사실적인 이미지, 디지털 아트, 양식화된 일러스트레이션을 생성할 수 있다. 텍스트-이미지 생성, 이미지-이미지 편집, 인페인팅(이미지의 누락된 부분 채우기)을 포함한 다양한 고급 기능을 지원한다. 또한 모델은 사용자 정의 데이터셋에 대한 미세 조정을 허용하여 특정 스타일이나 주제에 맞게 조정할 수 있다.
주목할 만한 기능 중 하나는 여러 객체, 조명 조건, 카메라 각도를 지정하는 것과 같은 복잡한 프롬프트를 처리하는 개선된 능력이다. SDXL은 또한 이미지 세부 사항을 향상시키고 아티팩트를 줄이기 위해 두 번째 단계로 적용할 수 있는 "정제기" 모델을 도입했다. 이 두 모델 접근 방식은 이전 Stable Diffusion 릴리스와의 주요 차별점이었다.
출시 및 가용성
SDXL은 2023년 7월 26일에 연구 미리보기로 처음 출시되었으며, 이후 완전한 오픈소스 릴리스가 이어졌다. 모델 가중치는 Hugging Face에서 제공되며, 소비자급 하드웨어에서 로컬로 실행할 수 있지만 최적의 성능을 위해서는 고급 GPU가 권장된다. SDXL은 또한 다양한 클라우드 플랫폼과 타사 도구에 통합되어 광범위한 사용자에게 접근성을 제공한다.
출시와 함께 모델의 설계 및 평가를 상세히 설명하는 기술 보고서와 일련의 블로그 게시물이 제공되었다. Stability AI는 SDXL을 이미지 생성을 위한 최첨단 오픈 모델로 자리매김했으며, OpenAI 및 Google DeepMind와 같은 회사의 독점 시스템과 경쟁했다.
영향 및 사용
SDXL은 오픈 라이선스와 고품질 출력 덕분에 아티스트, 디자이너, 연구자들 사이에서 빠르게 인기 있는 도구가 되었다. 디지털 아트에서 광고에 이르기까지 수많은 창의적 프로젝트에 사용되었으며, 많은 파생 모델과 미세 조정 변형의 기반이 되었다. 모델의 출시는 딥페이크와 저작권에 대한 우려를 포함한 AI 생성 이미지의 윤리적 영향에 대한 논의도 촉발했다.
머신러닝 연구의 맥락에서 SDXL은 확산 모델의 발전에 기여하여 이미지 생성 및 다중 모달 시스템에 대한 후속 작업에 영향을 미쳤다. 그 아키텍처와 훈련 방법론은 학술 논문과 산업 보고서에서 인용되어 생성 AI 진화의 중요한 이정표로서의 역할을 확고히 했다.
한계
개선에도 불구하고 SDXL은 알려진 한계가 있다. 이미지 내 텍스트 렌더링에 어려움을 겪을 수 있으며, 종종 왜곡되거나 철자가 틀린 단어를 생성한다. 모델은 또한 훈련 데이터에 존재하는 편향을 나타낼 수 있어 특정 그룹에 대한 고정관념적 표현을 초래할 수 있다. 또한 고해상도 이미지 생성에는 상당한 메모리와 컴퓨팅 성능이 필요하며, 이는 일부 사용자에게 장벽이 될 수 있다. 많은 생성 모델과 마찬가지로 출력이 때때로 일관되지 않거나 원하는 결과를 얻기 위해 여러 번의 시도가 필요할 수 있다.