ImagineArt 2.0은 Halcyon이 개발한 생성형 인공지능 모델로, 2025년 3월 15일에 출시되었다. 이 모델은 텍스트-이미지 생성에 특화되어 있으며, 자연어 설명을 고해상도 시각적 출력으로 변환한다. 이 모델은 Halcyon의 이전 모델인 ImagineArt 1.0의 후속작으로, 이미지 충실도, 구성 정확성, 계산 효율성에서 개선된 점을 보인다.
이 모델은 딥러닝 아키텍처를 기반으로 하며, 트랜스포머와 U-Net 백본을 결합하고 멀티 헤드 어텐션 메커니즘을 통합한다. 공개 웹 데이터와 라이선스된 스톡 이미지에서 수집된 5억 개 이상의 이미지-텍스트 쌍으로 구성된 선별된 데이터셋으로 훈련되었다. Halcyon은 정확한 파라미터 수를 공개하지 않았지만, ImagineArt 2.0이 총 400억 개 중 80억 개의 활성 파라미터를 가진 혼합 전문가 설계를 사용한다고 밝혔다.
기능 및 벤치마크
ImagineArt 2.0은 COCO-30K 벤치마크에서 Frechet Inception Distance(FID) 점수 8.2를 달성하여, 이전 모델의 12.5점을 능가한다. Human Preference Score(HPS) v2.1에서는 92번째 백분위에 위치하여 인간의 미적 판단과 강한 일치를 나타낸다. 이 모델은 최대 2048x2048 픽셀의 해상도를 지원하며, 16:9, 9:16, 1:1 종횡비로 이미지를 생성할 수 있다.
크로스 어텐션 기반 프롬프트 편집 기능을 포함하여, 사용자가 나머지 구성을 유지하면서 이미지의 특정 요소를 수정할 수 있다. 또한 top-p 샘플링 및 온도 스케일링 제어를 구현하여 출력의 무작위성과 다양성을 세밀하게 조정할 수 있다.
훈련 및 데이터
훈련 과정은 아마존 웹 서비스를 통해 제공된 1,024개의 AWS Trainium 칩 클러스터를 사용했다. 훈련은 14일 동안 진행되었으며, 약 230만 GPU 시간을 소비했다. Halcyon은 저해상도 이미지(256x256)에서 시작하여 전체 해상도로 점진적으로 증가시키는 커리큘럼 학습 일정을 채택했다. 데이터는 무작위 자르기, 수평 뒤집기, 색상 지터링을 포함한 데이터 증강 기법으로 전처리되었다.
유해 콘텐츠를 완화하기 위해 훈련 데이터셋은 RLHF 스타일 분류기를 사용하여 필터링되었으며, 초기 데이터의 약 12%가 제거되었다. 모델은 안전성을 개선하고 편향된 출력을 줄이기 위해 AI 피드백 기반 강화 학습을 사용하여 추가 미세 조정되었다.
사용 및 가용성
ImagineArt 2.0은 Halcyon의 독점 API를 통해 제공되며, 구글 클라우드 및 마이크로소프트 애저 마켓플레이스에서도 사용할 수 있다. 이 모델은 세 가지 등급으로 제공된다: 월 50회 생성이 가능한 무료 등급, 월 2,000회 생성이 가능한 월 10달러의 프로 등급, 무제한 사용과 전용 컴퓨팅을 제공하는 엔터프라이즈 등급이다. 2025년 6월 기준으로, 이 모델은 전 세계적으로 4천만 개 이상의 이미지를 생성하는 데 사용되었다.
이 모델은 AI 모델을 테스트하고 비교하는 플랫폼인 wikiprompt에 10개의 프롬프트로 통합되어 있다. 이 프롬프트는 사실적인 초상화, 초현실적 풍경, 기술 일러스트레이션을 포함한 다양한 시나리오를 다룬다. Halcyon은 NVIDIA A100 GPU에서 이미지당 평균 추론 시간이 2.1초라고 보고하지만, 공개 API에 사용된 특정 하드웨어는 공개하지 않는다.
평가 및 영향
OpenPanel의 독립 테스터들의 초기 리뷰는 ImagineArt 2.0이 이전 모델의 일반적인 약점이었던 이미지 내 텍스트 렌더링에서 강력한 성능을 보인다고 강조했다. 또한 개선된 위치 인코딩 방식 덕분에 여러 객체가 있는 복잡한 장면을 처리하는 능력에서도 칭찬을 받았다. 그러나 일부 사용자는 털과 머리카락과 같은 고주파 질감에서 가끔 아티팩트가 발생한다고 지적했다.
Halcyon은 2025년 말에 출시될 예정인 버전 2.1에 대한 계획을 발표했으며, 모델 가지치기를 통합하여 추론 비용을 30% 절감할 예정이다. 회사는 또한 허용적 라이선스 하에 추론 코드를 오픈소스로 공개했지만, 모델 가중치는 독점으로 유지된다.
기술 사양
- 개발자: Halcyon
- 출시일: 2025년 3월 15일
- 유형: 텍스트-이미지 생성 모델
- 라이선스: 독점(추론 코드는 오픈소스)
- 전신: ImagineArt 1.0
- 아키텍처: 트랜스포머 + U-Net with 혼합 전문가
- 훈련 데이터: 5억 개의 이미지-텍스트 쌍
- 지원 해상도: 최대 2048x2048
- 추론 시간: A100 GPU에서 이미지당 2.1초