AlbedoBase XL은 2023년에 출시된 생성형 인공지능 텍스트-이미지 모델이다. 이는 Stable Diffusion XL 아키텍처의 오픈소스 파생 모델로, 독립적인 연구원 및 엔지니어 그룹이 개발하여 모델 가중치를 Hugging Face 플랫폼에 공개적으로 게시했다. 이 모델은 자연어 프롬프트에서 고해상도 이미지를 생성하도록 설계되었으며, 특히 복잡한 질감, 조명, 구도 렌더링에 강점을 보인다.
이 모델은 신경망 아키텍처, 특히 잠재 확산 모델을 기반으로 하는 딥러닝 시스템으로 작동한다. 노이즈 제거에는 U-Net 백본을 사용하고, 입력 프롬프트 처리에는 트랜스포머 기반 텍스트 인코더를 사용한다. AlbedoBase XL은 Stable Diffusion XL 제품군의 표준인 1024x1024 픽셀 출력 해상도에 최적화되어 있으며, 사실적인 스타일부터 회화적 스타일까지 다양한 스타일을 지원한다.
개발 및 출시
AlbedoBase XL은 2023년 7월, Stable Diffusion XL 1.0의 공개 출시 직후에 처음 출시되었다. 이 프로젝트는 "Albedo"라는 가명으로 알려진 익명의 개발자가 시작했으며, 오픈소스 AI 커뮤니티의 소규모 기여자 팀과 협력했다. 초기 버전인 AlbedoBase XL 1.0은 공개 도메인 예술 작품, 라이선스 스톡 사진, 이전 모델로 생성된 합성 데이터를 결합한 약 350만 개의 이미지로 구성된 선별된 데이터 세트로 훈련되었다.
훈련 과정은 피크 학습률 1e-5의 학습률 스케줄과 임계값 1.0의 기울기 클리핑을 사용했다. 모델은 64개의 NVIDIA A100 GPU 클러스터에서 6주 동안 250,000 스텝으로 훈련되었다. 최종 체크포인트는 CreativeML OpenRAIL-M 라이선스로 출시되어 오용에 대한 제한과 함께 상업적 사용을 허용한다.
기술 사양
AlbedoBase XL은 기본 Stable Diffusion XL 아키텍처와 일치하는 약 35억 개의 매개변수를 가진다. 이 모델은 CLIP ViT-L/14 인코더와 더 큰 OpenCLIP ViT-bigG/14 인코더를 결합한 이중 텍스트 인코더 구성을 사용하여 복잡한 프롬프트를 향상된 의미 정확도로 해석할 수 있다. 잠재 공간은 다운샘플링 계수 8의 변분 오토인코더를 사용하여 압축되며, 생성 중 계산 부하를 줄인다.
추론은 텍스트 임베딩과 이미지 잠재 변수 간의 교차 어텐션 메커니즘을 사용하여 수행되며, 고품질 출력에는 일반적으로 20~50회의 노이즈 제거 단계가 필요하다. 모델은 기본 샘플링 전략으로 top-p 샘플링과 top-k 샘플링을 지원하며, 권장 분류기 없는 안내 척도는 7.5이다. 최소 8GB VRAM의 소비자 GPU에서 효율적으로 실행되며, 적절한 최적화를 통해 AMD 또는 NVIDIA 하드웨어로 가속할 수 있다.
기능 및 사용 사례
AlbedoBase XL은 직물 질감, 피부 톤, 자연 조명과 같은 복잡한 세부 사항을 가진 이미지 생성에 탁월하다. 특히 이전 모델에 비해 손과 얼굴을 더 적은 해부학적 오류로 렌더링하는 능력으로 주목받는다. 이 모델은 디지털 아티스트, 게임 디자이너, 취미 사용자들이 컨셉 아트, 캐릭터 디자인, 일러스트레이션에 널리 사용한다.
COCO 데이터 세트의 벤치마크 테스트에서 Fréchet Inception Distance(FID) 점수 18.2를 보여 실제 이미지 분포에 대한 강력한 충실도를 나타낸다. 모델은 또한 LAION-5B 미적 하위 집합에서 0.32를 달성하는 CLIP 점수 지표에서도 우수한 성능을 보인다. 이러한 결과는 같은 기간에 출시된 다른 오픈소스 텍스트-이미지 모델과 경쟁력 있는 위치에 놓는다.
커뮤니티 및 생태계
AlbedoBase XL은 Automatic1111의 Stable Diffusion WebUI 및 ComfyUI 노드 기반 인터페이스를 포함한 여러 인기 머신러닝 플랫폼에 통합되었다. 또한 Replicate 및 Hugging Face Spaces와 같은 클라우드 서비스를 통해 제공되어 로컬 하드웨어 없이도 배포할 수 있다.
이 모델은 특정 작업에 맞게 조정된 AlbedoBase XL Inpainting 및 AlbedoBase XL Anime을 포함한 미세 조정 변형 제품군을 파생시켰다. 오픈소스 커뮤니티는 전체 가중치를 재훈련하지 않고 모델 스타일을 수정하는 500개 이상의 LoRA(저순위 적응) 모듈을 기여했다. 2024년 기준으로 원본 저장소는 GitHub에서 12,000개 이상의 별표와 Hugging Face에서 200만 회 이상의 다운로드를 축적했다.
한계 및 윤리적 고려 사항
다른 텍스트-이미지 모델과 마찬가지로 AlbedoBase XL은 부적절한 콘텐츠로 프롬프트되면 편향되거나 유해한 출력을 생성할 수 있다. 훈련 데이터 세트에는 노골적인 자료를 제거하는 필터가 포함되어 있지만, 표현의 잔여 편향은 지속된다. 모델은 또한 확산 기반 접근 방식의 일반적인 한계인 이미지 내 정확한 텍스트 렌더링에 어려움을 겪을 수 있다.
오픈 라이선스는 상업적 사용을 허용하지만, 모델은 기만적이거나 불법적인 콘텐츠 생성을 금지하는 OpenRAIL-M 제한의 적용을 받는다. 개발자는 공개 애플리케이션에 모델을 배포할 때 안전 필터를 구현하는 것이 권장된다. 모델의 계산 요구 사항은 GPU에 비해 적당하지만, 전용 하드웨어가 없는 사용자에게는 여전히 장벽이 된다.
같이 보기
- Stable Diffusion
- Text-to-image generation
- Diffusion model
- open-source-ai