Stable Diffusion 릴리스

영어에서 번역됨

Stable Diffusion은 2022년 Stability AI가 출시한 오픈소스 딥러닝 텍스트-이미지 모델로, 소비자 하드웨어에서 실행되어 생성 예술을 대중화했습니다. 잠재 확산(latent diffusion)을 사용하여 텍스트 프롬프트에서 상세한 이미지를 생성합니다.

Stable Diffusion은 2022년에 출시된 확산 기법 기반의 딥러닝 텍스트-이미지 모델이다. 이 생성형 AI 기술은 Stability AI의 대표 제품으로, 진행 중인 AI 붐의 일부로 간주된다. 주로 텍스트 설명에 따라 세부 이미지를 생성하는 데 사용되지만, 인페인팅, 아웃페인팅, 텍스트 프롬프트에 따라 안내되는 이미지-이미지 변환 생성과 같은 다른 작업에도 적용될 수 있다. 개발에는 뮌헨 루트비히 막시밀리안 대학교(LMU Munich)의 CompVis 그룹과 Runway의 연구자들이 참여했으며, Stability의 계산 자원 기부와 비영리 단체의 훈련 데이터가 사용되었다.

Stable Diffusion은 잠재 확산 모델(latent diffusion model)로, 일종의 심층 생성 인공 신경망이다. 코드와 모델 가중치는 공개적으로 배포되었으며, 최적화된 버전은 2.4GB VRAM만으로도 대부분의 소비자 하드웨어에서 실행될 수 있다. 이는 클라우드 서비스로만 접근 가능했던 DALL-E 및 Midjourney와 같은 이전의 독점 텍스트-이미지 모델과는 차별화된 점이다.

개발

Stable Diffusion은 독일 뮌헨의 LMU 뮌헨과 하이델베르크 대학교 연구자들이 개발한 잠재 확산이라는 프로젝트에서 시작되었다. 원래 저자 5명 중 4명(로빈 롬바흐, 안드레아스 블라트만, 패트릭 에서, 도미니크 로렌츠)은 이후 Stability AI에 합류하여 이후 버전의 Stable Diffusion을 출시했다. 모델의 기술 라이선스는 LMU 뮌헨의 CompVis 그룹에서 배포했다. 개발은 Runway의 패트릭 에서와 CompVis의 로빈 롬바흐가 주도했으며, 이들은 Stable Diffusion에 사용된 잠재 확산 모델 아키텍처를 이전에 발명한 연구자들 중 일부였다. Stability AI는 또한 프로젝트의 지지자로 EleutherAI와 Stable Diffusion 훈련에 사용된 데이터셋을 구성한 독일 비영리 단체인 LAION을 언급했다.

2022년 Stable Diffusion의 출시는 Generative AI 도구의 접근성에 중요한 전환점을 마련했다. 클라우드 접근이 필요했던 초기 모델과 달리 Stable Diffusion은 로컬에서 실행될 수 있어 더 넓은 예술가 및 개발자 커뮤니티가 텍스트-이미지 생성을 실험할 수 있게 했다. 이는 빠른 채택과 다양한 온라인 플랫폼에서 AI 생성 예술의 확산에 기여했다.

기술

아키텍처

2015년에 도입된 확산 모델은 훈련 이미지에 가우시안 노이즈를 연속적으로 적용하는 것을 제거하는 목표로 훈련되며, 이는 일련의 노이즈 제거 오토인코더로 생각할 수 있다. 확산이라는 이름은 열역학적 확산에서 유래했는데, 처음에 열역학에서 영감을 받아 개발되었기 때문이다. SD 3 이전의 Stable Diffusion 시리즈 모델은 모두 2021년 LMU 뮌헨의 CompVis(컴퓨터 비전 및 학습) 그룹이 개발한 변형인 잠재 확산 모델(LDM)을 사용했다.

Stable Diffusion은 세 부분으로 구성된다: 변분 오토인코더(VAE), U-Net, 선택적 텍스트 인코더. VAE 인코더는 이미지를 픽셀 공간에서 더 작은 차원의 잠재 공간으로 압축하여 이미지의 더 근본적인 의미론적 의미를 포착한다. 가우시안 노이즈는 순방향 확산 동안 압축된 잠재 표현에 반복적으로 적용된다. ResNet 백본으로 구성된 U-Net 블록은 순방향 확산의 출력을 역방향으로 노이즈 제거하여 잠재 표현을 얻는다. 마지막으로 VAE 디코더는 표현을 픽셀 공간으로 다시 변환하여 최종 이미지를 생성한다.

노이즈 제거 단계는 텍스트 문자열, 이미지 또는 다른 양식에 유연하게 조건화될 수 있다. 인코딩된 조건화 데이터는 교차 주의 메커니즘을 통해 노이즈 제거 U-Net에 노출된다. 텍스트 조건화의 경우 고정된 사전 훈련된 CLIP ViT-L/14 텍스트 인코더가 텍스트 프롬프트를 임베딩 공간으로 변환하는 데 사용된다. 연구자들은 훈련 및 생성의 계산 효율성 증가를 LDM의 장점으로 지적한다. U-Net에 8억 6천만 개의 매개변수와 텍스트 인코더에 1억 2,300만 개의 매개변수를 가진 Stable Diffusion은 2022년 기준으로 비교적 가벼운 모델로 간주되며, 다른 확산 모델과 달리 소비자 GPU에서 실행될 수 있고 OpenVINO 버전을 사용하면 CPU 전용에서도 실행될 수 있다.

#### SD XL

XL 버전은 이전 버전과 동일한 LDM 아키텍처를 사용하지만 더 크다: 더 큰 UNet 백본, 더 큰 교차 주의 컨텍스트, 하나 대신 두 개의 텍스트 인코더, 그리고 정사각형 종횡비뿐만 아니라 여러 종횡비로 훈련되었다. 동시에 출시된 SD XL Refiner는 SD XL과 동일한 아키텍처를 가지지만 텍스트 조건 img2img를 통해 기존 이미지에 세부 사항을 추가하도록 훈련되었다.

#### SD 3.0

3.0 버전은 백본을 완전히 변경한다. UNet이 아니라 Transformer (architecture)로 정류 흐름 방법을 구현하는 정류 흐름 트랜스포머(Rectified Flow Transformer)이다. SD 3.0에 사용된 트랜스포머 아키텍처는 원본 텍스트 인코딩, 변환된 텍스트 인코딩, 이미지 인코딩(잠재 공간)을 위한 세 개의 "트랙"을 가진다. 변환된 텍스트 인코딩과 이미지 인코딩은 각 트랜스포머 블록에서 혼합된다. 이 아키텍처는 "멀티모달 확산 트랜스포머(MMDiT)"라고 불리며, 여기서 "멀티모달"은 작업 내에서 텍스트와 이미지 인코딩을 혼합한다는 것을 의미한다. 이는 텍스트 인코딩이 이미지 인코딩에 영향을 주지만 그 반대는 아닌 이전 DiT 버전과 다르다.

훈련 데이터

Stable Diffusion은 웹에서 스크랩된 Common Crawl 데이터에서 파생된 공개 데이터셋인 LAION-5B에서 가져온 이미지와 캡션 쌍으로 훈련되었다. 여기서 50억 개의 이미지-텍스트 쌍은 언어별로 분류되고 해상도, 워터마크 포함 예측 가능성, 예측된 "미적" 점수(예: 주관적 시각적 품질)에 따라 별도의 데이터셋으로 필터링되었다. 이 데이터셋은 Stability AI로부터 자금을 지원받는 독일 비영리 단체인 LAION이 만들었다. Stable Diffusion 모델은 LAION-5B의 세 가지 하위 집합인 laion2B-en, laion-high-resolution, laion-aesthetics v2 5+로 훈련되었다. 모델 훈련 데이터에 대한 제3자 분석에 따르면 원래 더 넓은 데이터셋에서 가져온 1,200만 개의 이미지 중 약 47%가 100개의 다른 도메인에서 왔으며, Pinterest가 하위 집합의 8.5%를 차지하고 WordPress, Blogspot, Flickr, DeviantArt 및 Wikimedia Commons와 같은 웹사이트가 그 뒤를 이었다. Bayerischer Rundfunk의 조사에 따르면 Hugging Face에 호스팅된 LAION 데이터셋에는 많은 양의 개인 및 민감한 데이터가 포함되어 있다.

훈련 절차

모델은 처음에 laion2B-en 및 laion-high-resolution 하위 집합으로 훈련되었으며, 마지막 몇 라운드의 훈련은 LAION-Aesthetics v2 5+에서 수행되었다. 이는 6억 개의 캡션 이미지 하위 집합으로, LAION-Aesthetics Predictor V2가 인간이 평균적으로 10점 만점에 5점 이상의 점수를 줄 것으로 예측한 이미지들이다. LAION-Aesthetics v2 5+ 하위 집합은 또한 저해상도 이미지와 LAION-5B-WatermarkDetection이 80% 이상의 확률로 워터마크를 포함하는 것으로 식별한 이미지를 제외했다. 마지막 훈련 라운드에서는 Classifier-Free Diffusion Guidance를 개선하기 위해 텍스트 조건화의 10%를 추가로 제거했다. 모델은 256개의 Nvidia A100 GPU를 사용하여 Amazon Web Services에서 총 150,000 GPU-시간 동안 훈련되었으며, 비용은 60만 달러였다.

영향과 유산

Stable Diffusion의 코드와 가중치 공개는 Artificial intelligence 및 디지털 예술 분야에 깊은 영향을 미쳤다. 강력한 텍스트-이미지 생성에 대한 접근을 민주화하여 개인과 소규모 팀이 값비싼 클라우드 인프라 없이 고품질 이미지를 만들 수 있게 했다. 이는 콘셉트 아트와 일러스트레이션에서 광고 및 게임 디자인에 이르기까지 창의적 응용의 급증으로 이어졌다. 모델은 또한 개발자가 점점 더 저렴한 하드웨어에서 모델을 실행하려고 함에 따라 모델 압축 및 효율적 추론과 같은 Machine learning 분야의 추가 연구를 촉진했다.

Stable Diffusion은 또한 저작권, 데이터 프라이버시 및 오용 가능성에 관한 중요한 윤리적 및 법적 질문을 제기했다. 저작권 이미지와 개인 정보를 포함한 스크랩된 웹 데이터의 훈련 사용은 논쟁과 소송의 주제가 되었다. 이러한 우려는 생성 모델 개발에서 더 투명하고 책임 있는 데이터 관행의 필요성에 대한 논의를 촉발했으며, 이후 분야의 작업에 영향을 미쳤다.

한계

Stable Diffusion은 특히 복잡한 장면이나 텍스트를 생성할 때 저하 및 아티팩트 문제가 있다. 해부학적 정확성에 어려움을 겪어 손이나 얼굴이 왜곡된 이미지를 생성할 수 있으며, 이미지 내 텍스트를 정확히 렌더링하지 못할 수 있다. 모델의 성능은 훈련 데이터의 품질과 다양성에 의존하므로 생성된 이미지에 편향이 발생할 수 있다. 또한 SD 3.0과 같은 대규모 모델의 훈련 및 미세 조정의 계산 비용은 여전히 상당하여 일부 연구자와 개발자의 실험을 제한한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·text-to-image·deep-learning·open-source
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사