Stability AI의 Stable Diffusion 2022

영어에서 번역됨

Stable Diffusion은 2022년 Stability AI가 출시한 딥러닝 기반 텍스트-이미지 모델로, 잠재 확산(latent diffusion) 기법에 기반한다. 텍스트 프롬프트에서 상세한 이미지를 생성하며, 공개 출시와 소비자용 하드웨어에서 실행 가능한 점으로 주목받는다.

Stable Diffusion은 2022년 Stability AI가 출시한 딥러닝 기반 텍스트-이미지 모델로, 확산 기법을 기반으로 한다. 주로 텍스트 설명에 따라 세부 이미지를 생성하는 데 사용되지만, 인페인팅, 아웃페인팅, 텍스트 프롬프트에 따라 안내되는 이미지-이미지 변환과 같은 작업에도 적용될 수 있다. 이 모델은 진행 중인 생성형 AI 붐의 일부로 간주되며, 클라우드 서비스를 통해서만 접근 가능했던 DALL-E 및 Midjourney와 같은 이전의 독점적 텍스트-이미지 모델과 차별화되었다.

Stable Diffusion은 잠재 확산 모델로, 일종의 심층 생성 인공 신경망이다. 코드와 모델 가중치는 공개되었으며, 최적화된 버전은 2.4GB VRAM만으로도 대부분의 소비자용 하드웨어에서 실행될 수 있다. 이러한 접근성은 이전 모델과 차별화되어 널리 채택되는 데 기여했다.

개발

Stable Diffusion은 독일 뮌헨 루트비히-막시밀리안 대학교와 하이델베르크 대학교 연구자들이 개발한 '잠재 확산' 프로젝트에서 시작되었다. 원저자 5명 중 4명(로빈 롬바흐, 안드레아스 블라트만, 패트릭 에서, 도미니크 로렌츠)은 이후 Stability AI에 합류하여 후속 버전을 출시했다. 기술 라이선스는 뮌헨 루트비히-막시밀리안 대학교의 CompVis 그룹에서 공개했으며, 개발은 Runway의 패트릭 에서와 CompVis의 로빈 롬바흐가 주도했다. 이들은 이전에 잠재 확산 아키텍처를 발명한 바 있다. Stability AI는 또한 훈련 데이터셋을 구성한 독일 비영리 단체인 LAION과 EleutherAI를 지원자로 언급했다.

기술

아키텍처

2015년에 도입된 확산 모델은 훈련 이미지에 가우시안 노이즈를 연속적으로 적용하는 것을 제거하도록 훈련되며, 일련의 노이즈 제거 오토인코더와 유사하다. 이름은 열역학적 확산에서 유래했는데, 초기 개발이 열역학에서 영감을 받았기 때문이다. SD 3 이전의 Stable Diffusion 시리즈 모델은 뮌헨 루트비히-막시밀리안 대학교의 CompVis 그룹이 2021년에 개발한 변형인 잠재 확산 모델(LDM)을 사용했다.

Stable Diffusion은 세 부분으로 구성된다: 변분 오토인코더(VAE), U-Net, 선택적 텍스트 인코더. VAE 인코더는 이미지를 픽셀 공간에서 더 작은 잠재 공간으로 압축하여 기본 의미론적 의미를 포착한다. 순방향 확산 동안 압축된 잠재 표현에 가우시안 노이즈가 반복적으로 적용된다. U-Net 블록은 ResNet 백본으로 구성되며, 출력을 노이즈 제거하여 잠재 표현을 얻고, VAE 디코더는 표현을 픽셀 공간으로 다시 변환하여 최종 이미지를 생성한다.

노이즈 제거 단계는 교차 주의 메커니즘을 통해 텍스트, 이미지 또는 다른 양식에 조건을 둘 수 있다. 텍스트 조건의 경우, 사전 훈련된 고정 CLIP ViT-L/14 텍스트 인코더가 프롬프트를 임베딩 공간으로 변환한다. 연구자들은 훈련 및 생성의 계산 효율성 증가를 LDM의 장점으로 지적한다. U-Net에 860만 개의 매개변수, 텍스트 인코더에 123만 개의 매개변수를 가진 Stable Diffusion은 2022년 기준으로 비교적 가벼우며, 소비자용 GPU 또는 OpenVINO 버전을 사용하면 CPU 전용에서도 실행할 수 있다.

#### SD XL

XL 버전은 동일한 LDM 아키텍처를 사용하지만 더 크다: 더 큰 UNet 백본, 더 큰 교차 주의 컨텍스트, 하나 대신 두 개의 텍스트 인코더, 여러 종횡비에 대한 훈련. 동시에 출시된 SD XL Refiner는 동일한 아키텍처를 가지지만 텍스트 조건 img2img를 통해 기존 이미지에 세부 사항을 추가하도록 훈련되었다.

#### SD 3.0

3.0 버전은 백본을 완전히 변경하여 UNet 대신 Rectified Flow Transformer를 사용한다. 아키텍처는 원본 텍스트 인코딩, 변환된 텍스트 인코딩, 잠재 공간의 이미지 인코딩의 세 가지 트랙을 가지며, 후자 두 개는 각 트랜스포머 블록에서 혼합된다. 이는 텍스트와 이미지 인코딩을 내부적으로 혼합한다는 점을 반영하여 "다중 양식 확산 트랜스포머"(MMDiT)로 명명되었으며, 이전 DiT 버전에서는 텍스트가 이미지에 영향을 주지만 그 반대는 아니었다.

훈련 데이터

Stable Diffusion은 Common Crawl 웹 데이터에서 파생된 공개 데이터셋인 LAION-5B의 이미지-캡션 쌍으로 훈련되었다. LAION-5B는 언어별로 분류되고 해상도, 워터마크 가능성, 예측 미적 점수로 필터링된 5억 개의 이미지-텍스트 쌍을 포함한다. 데이터셋은 Stability AI가 자금을 지원한 독일 비영리 단체인 LAION이 만들었다. 모델은 laion2B-en, laion-high-resolution, laion-aesthetics v2 5+의 세 가지 하위 집합으로 훈련되었다. 1200만 개 이미지의 더 작은 하위 집합에 대한 제3자 분석에 따르면 약 47%가 100개 도메인에서 나왔으며, Pinterest가 8.5%를 차지했고, 그 다음으로 WordPress, Blogspot, Flickr, DeviantArt, Wikimedia Commons가 뒤를 이었다. Bayerischer Rundfunk의 조사에 따르면 Hugging Face에 호스팅된 LAION 데이터셋에는 대량의 개인 및 민감 데이터가 포함되어 있다.

훈련 절차

모델은 처음에 laion2B-en과 laion-high-resolution으로 훈련되었으며, 마지막 라운드는 인간 평가자로부터 10점 만점에 최소 5점을 받을 것으로 예측된 6억 개의 캡션 이미지 하위 집합인 LAION-Aesthetics v2 5+로 진행되었다. 이 하위 집합은 저해상도 이미지와 예측 워터마크 확률이 80%를 초과하는 이미지를 제외했다. 마지막 훈련 라운드에서는 Classifier-Free Diffusion Guidance를 개선하기 위해 텍스트 조건의 10%를 삭제했다. 모델은 Amazon Web Services에서 256개의 Nvidia A100 GPU를 사용하여 150,000 GPU-시간 동안 훈련되었으며, 비용은 600,000달러였다.

한계

Stable Diffusion은 손과 텍스트 렌더링의 어려움과 같은 저하 문제가 알려져 있으며, 훈련 데이터로 인해 편향되거나 유해한 콘텐츠를 생성할 수 있다. 공개 출시는 딥페이크 및 저작권 침해를 포함한 오용에 대한 우려를 제기했으며, 머신 러닝 커뮤니티에서 규제 및 윤리적 사용에 대한 지속적인 논쟁으로 이어졌다.

영향

2022년 Stable Diffusion의 출시는 딥러닝 아트 운동을 크게 가속화하여 취미 사용자와 예술가가 개인 하드웨어에서 고품질 이미지를 생성할 수 있게 했다. 이후 텍스트-이미지 모델에 영향을 주었고, 예술, 디자인, 콘텐츠 제작 분야에 적용되며 더 넓은 AI 붐에 기여했다. 모델의 오픈소스 특성은 대규모 커뮤니티 도구 및 미세 조정 변형 생태계를 조성했지만, 지적 재산권과 창의적 작업의 미래에 대한 논의도 촉발했다.

평가 및 유산

이 모델은 기술적 성과와 접근성으로 폭넓은 주목을 받았다. 효율성과 품질로 칭찬을 받았지만, 잠재적 오용에 대해서도 비판을 받았다. 2025년 현재 Stable Diffusion은 생성형 AI의 기초적 참조 모델로 남아 있으며, Stability AI와 오픈소스 커뮤니티에 의해 지속적인 개발이 이루어지고 있다. 그 아키텍처와 훈련 접근 방식은 이후 수많은 모델에 적용되어 이 분야에서의 유산을 공고히 했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·text-to-image·deep-learning·open-source-software
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사