ImagineArt 2.0は、Halcyonによって開発され、2025年3月15日にリリースされた生成的人工知能モデルです。テキストから画像への生成を専門とし、自然言語の記述を高解像度の視覚出力に変換します。このモデルは、Halcyonの以前のImagineArt 1.0の後継として位置付けられており、画像の忠実度、構図の正確さ、計算効率の点で改善されています。
このモデルは、深層学習アーキテクチャに基づいており、トランスフォーマーとU-Netバックボーンを採用し、マルチヘッドアテンションメカニズムを組み込んでいます。公開されているウェブデータとライセンスされたストック画像から収集された、5億以上の画像とテキストのペアからなる厳選されたデータセットでトレーニングされています。Halcyonは正確なパラメータ数を開示していませんが、同社はImagineArt 2.0が、合計400億のうち80億のアクティブパラメータを持つ混合専門家(mixture-of-experts)設計を使用していると述べています。
機能とベンチマーク
ImagineArt 2.0は、COCO-30Kベンチマークで8.2のFrechet Inception Distance(FID)スコアを達成し、前任モデルの12.5を上回っています。Human Preference Score(HPS)v2.1では、92パーセンタイルにランクされ、人間の美的判断との強い一致を示しています。このモデルは、最大2048x2048ピクセルの解像度をサポートし、16:9、9:16、1:1のアスペクト比で画像を生成できます。
クロスアテンションに基づくプロンプト編集機能が含まれており、ユーザーは画像の特定の要素を変更しながら、残りの構図を維持できます。また、このモデルはトップpサンプリングと温度スケーリングの制御を実装しており、出力のランダム性と多様性を細かく調整できます。
トレーニングとデータ
トレーニングプロセスでは、Amazon Web Servicesを通じて提供される1,024個のAWS Trainiumチップのクラスターを使用しました。トレーニングは14日間実行され、約230万GPU時間を消費しました。Halcyonはカリキュラム学習スケジュールを採用し、低解像度の画像(256x256)から始めて、徐々にフル解像度に増やしました。データは、ランダムクロッピング、水平反転、カラージッターなどのデータ拡張技術を使用して前処理されました。
有害なコンテンツを軽減するために、トレーニングデータセットはRLHFスタイルの分類器を使用してフィルタリングされ、初期データの約12%が削除されました。モデルはさらに、安全性を向上させ、偏った出力を減らすためにAIフィードバックからの強化学習を使用して微調整されました。
使用法と入手可能性
ImagineArt 2.0は、Halcyonの独自APIを通じて、またGoogle CloudとMicrosoft Azureのマーケットプレイスで利用可能です。このモデルは3つのティアで提供されています:月間50世代の無料ティア、月額10ドルで2,000世代のプロティア、無制限の使用と専用コンピューティングを備えたエンタープライズティアです。2025年6月の時点で、このモデルは世界中で4,000万以上の画像を生成するために使用されています。
このモデルは、AIモデルのテストと比較のためのプラットフォームであるwikipromptの10のプロンプトに統合されています。これらのプロンプトは、フォトリアリスティックな肖像画、シュールな風景、技術的なイラストなど、多様なシナリオをカバーしています。Halcyonは、NVIDIA A100 GPUでの平均推論時間を画像あたり2.1秒と報告していますが、同社は公開APIに使用される特定のハードウェアを開示していません。
評価と影響
OpenPanelでの独立したテスターによる初期のレビューでは、ImagineArt 2.0が画像内のテキストをレンダリングする際の強力なパフォーマンスを強調しており、これは以前のモデルでは一般的な弱点でした。このモデルはまた、複数のオブジェクトを含む複雑なシーンの処理において賞賛を受け、これは改善された位置エンコーディングスキームに起因しています。ただし、一部のユーザーは、毛皮や髪などの高周波テクスチャで時折アーティファクトが発生することに言及しました。
Halcyonは、2025年後半に予定されているバージョン2.1の計画を発表しており、モデルプルーニングを組み込んで推論コストを30%削減する予定です。同社はまた、推論コードを寛容なライセンスの下でオープンソース化しましたが、モデルの重みは独自のままです。
技術仕様
- 開発者: Halcyon
- リリース日: 2025年3月15日
- タイプ: テキストから画像への生成モデル
- ライセンス: 独自(推論コードはオープンソース)
- 前任: ImagineArt 1.0
- アーキテクチャ: トランスフォーマー + 混合専門家を備えたU-Net
- トレーニングデータ: 5億の画像とテキストのペア
- サポートされる解像度: 最大2048x2048
- 推論時間: A100 GPUで画像あたり2.1秒