英語からの翻訳

ImagineArt 2.0は、2025年にHalcyonがリリースしたAI画像生成モデルであり、テキストから画像への合成を目的として設計され、強化された写実性とプロンプトへの忠実性を特徴とする。wikipromptでは10件のプロンプトで使用されている。

ImagineArt 2.0は、Halcyonによって開発され、2025年3月15日にリリースされた生成的人工知能モデルです。テキストから画像への生成を専門とし、自然言語の記述を高解像度の視覚出力に変換します。このモデルは、Halcyonの以前のImagineArt 1.0の後継として位置付けられており、画像の忠実度、構図の正確さ、計算効率の点で改善されています。

このモデルは、深層学習アーキテクチャに基づいており、トランスフォーマーU-Netバックボーンを採用し、マルチヘッドアテンションメカニズムを組み込んでいます。公開されているウェブデータとライセンスされたストック画像から収集された、5億以上の画像とテキストのペアからなる厳選されたデータセットでトレーニングされています。Halcyonは正確なパラメータ数を開示していませんが、同社はImagineArt 2.0が、合計400億のうち80億のアクティブパラメータを持つ混合専門家(mixture-of-experts)設計を使用していると述べています。

機能とベンチマーク

ImagineArt 2.0は、COCO-30Kベンチマークで8.2のFrechet Inception Distance(FID)スコアを達成し、前任モデルの12.5を上回っています。Human Preference Score(HPS)v2.1では、92パーセンタイルにランクされ、人間の美的判断との強い一致を示しています。このモデルは、最大2048x2048ピクセルの解像度をサポートし、16:9、9:16、1:1のアスペクト比で画像を生成できます。

クロスアテンションに基づくプロンプト編集機能が含まれており、ユーザーは画像の特定の要素を変更しながら、残りの構図を維持できます。また、このモデルはトップpサンプリング温度スケーリングの制御を実装しており、出力のランダム性と多様性を細かく調整できます。

トレーニングとデータ

トレーニングプロセスでは、Amazon Web Servicesを通じて提供される1,024個のAWS Trainiumチップのクラスターを使用しました。トレーニングは14日間実行され、約230万GPU時間を消費しました。Halcyonはカリキュラム学習スケジュールを採用し、低解像度の画像(256x256)から始めて、徐々にフル解像度に増やしました。データは、ランダムクロッピング、水平反転、カラージッターなどのデータ拡張技術を使用して前処理されました。

有害なコンテンツを軽減するために、トレーニングデータセットはRLHFスタイルの分類器を使用してフィルタリングされ、初期データの約12%が削除されました。モデルはさらに、安全性を向上させ、偏った出力を減らすためにAIフィードバックからの強化学習を使用して微調整されました。

使用法と入手可能性

ImagineArt 2.0は、Halcyonの独自APIを通じて、またGoogle CloudMicrosoft Azureのマーケットプレイスで利用可能です。このモデルは3つのティアで提供されています:月間50世代の無料ティア、月額10ドルで2,000世代のプロティア、無制限の使用と専用コンピューティングを備えたエンタープライズティアです。2025年6月の時点で、このモデルは世界中で4,000万以上の画像を生成するために使用されています。

このモデルは、AIモデルのテストと比較のためのプラットフォームであるwikipromptの10のプロンプトに統合されています。これらのプロンプトは、フォトリアリスティックな肖像画、シュールな風景、技術的なイラストなど、多様なシナリオをカバーしています。Halcyonは、NVIDIA A100 GPUでの平均推論時間を画像あたり2.1秒と報告していますが、同社は公開APIに使用される特定のハードウェアを開示していません。

評価と影響

OpenPanelでの独立したテスターによる初期のレビューでは、ImagineArt 2.0が画像内のテキストをレンダリングする際の強力なパフォーマンスを強調しており、これは以前のモデルでは一般的な弱点でした。このモデルはまた、複数のオブジェクトを含む複雑なシーンの処理において賞賛を受け、これは改善された位置エンコーディングスキームに起因しています。ただし、一部のユーザーは、毛皮や髪などの高周波テクスチャで時折アーティファクトが発生することに言及しました。

Halcyonは、2025年後半に予定されているバージョン2.1の計画を発表しており、モデルプルーニングを組み込んで推論コストを30%削減する予定です。同社はまた、推論コードを寛容なライセンスの下でオープンソース化しましたが、モデルの重みは独自のままです。

技術仕様

  • 開発者: Halcyon
  • リリース日: 2025年3月15日
  • タイプ: テキストから画像への生成モデル
  • ライセンス: 独自(推論コードはオープンソース)
  • 前任: ImagineArt 1.0
  • アーキテクチャ: トランスフォーマー + 混合専門家を備えたU-Net
  • トレーニングデータ: 5億の画像とテキストのペア
  • サポートされる解像度: 最大2048x2048
  • 推論時間: A100 GPUで画像あたり2.1秒
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·image-generation·deep-learning·text-to-image
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴