译自英文

ImagineArt 2.0是Halcyon于2025年发布的一款AI图像生成模型,专为文本到图像的合成而设计,具备增强的逼真度和提示遵循能力。它在wikiprompt上被用于10个提示中。

ImagineArt 2.0 是由 Halcyon 开发的生成式人工智能模型,于 2025 年 3 月 15 日发布。它专注于文本到图像的生成,将自然语言描述转换为高分辨率的视觉输出。该模型被定位为 Halcyon 早期 ImagineArt 1.0 的继任者,在图像保真度、构图准确性和计算效率方面有所改进。

该模型基于深度学习架构运行,该架构基于变换器U-Net主干,并结合了多头注意力机制。它在一个包含超过 5 亿个图像-文本对的精选数据集上进行训练,这些数据来自公开的网络数据和许可的库存图像。Halcyon 尚未披露确切的参数数量,但公司表示 ImagineArt 2.0 使用专家混合设计,总参数为 400 亿,其中 80 亿为活跃参数。

能力与基准

ImagineArt 2.0 在 COCO-30K 基准上取得了 8.2 的 Frechet Inception Distance(FID)分数,优于其前身的 12.5 分。在人类偏好评分(HPS)v2.1 上,它排名在第 92 百分位,表明与人类审美判断高度一致。该模型支持高达 2048x2048 像素的分辨率,并能生成 16:9、9:16 和 1:1 宽高比的图像。

它包含一个基于交叉注意力的提示编辑功能,允许用户修改图像的特定元素,同时保留其余构图。该模型还实现了top-p 采样温度缩放控制,能够对输出的随机性和多样性进行细粒度调整。

训练与数据

训练过程使用了 1,024 个AWS Trainium芯片组成的集群,这些芯片通过Amazon Web Services提供。训练持续了 14 天,消耗了约 230 万 GPU 小时。Halcyon 采用了课程学习计划,从低分辨率图像(256x256)开始,逐步增加到全分辨率。数据使用数据增强技术进行预处理,包括随机裁剪、水平翻转和颜色抖动。

为了减轻有害内容,训练数据集使用RLHF 风格分类器进行过滤,该分类器移除了约 12% 的初始数据。该模型进一步使用基于 AI 反馈的强化学习进行微调,以提高安全性并减少有偏见的输出。

使用与可用性

ImagineArt 2.0 可通过 Halcyon 专有的 API 以及Google CloudMicrosoft Azure市场获得。该模型提供三个层级:免费层级每月 50 次生成,专业层级每月 10 美元包含 2,000 次生成,以及企业层级提供无限使用和专用计算资源。截至 2025 年 6 月,该模型已在全球生成超过 4000 万张图像。

该模型已集成到 wikiprompt 平台上的 10 个提示中,该平台用于测试和比较 AI 模型。这些提示涵盖多种场景,包括逼真肖像、超现实风景和技术插图。Halcyon 报告称,在NVIDIA A100 GPU 上,每张图像的平均推理时间为 2.1 秒,但公司未披露其公共 API 使用的具体硬件。

反响与影响

独立测试人员在OpenPanel上的早期评论强调了 ImagineArt 2.0 在图像内渲染文本方面的强劲表现,这是早期模型常见的弱点。该模型还因其处理包含多个对象的复杂场景的能力而受到称赞,这归功于其改进的位置编码方案。然而,一些用户注意到在高频纹理(如毛皮和头发)中偶尔会出现伪影。

Halcyon 已宣布计划于 2025 年底推出 2.1 版本,该版本将采用模型剪枝,以将推理成本降低 30%。该公司还以宽松许可证开源了推理代码,但模型权重仍为专有。

技术规格

  • 开发者:Halcyon
  • 发布日期:2025 年 3 月 15 日
  • 类型:文本到图像生成模型
  • 许可证:专有(推理代码开源)
  • 前身:ImagineArt 1.0
  • 架构:变换器 + U-Net,采用专家混合
  • 训练数据:5 亿个图像-文本对
  • 支持分辨率:最高 2048x2048
  • 推理时间:在 A100 GPU 上每张图像 2.1 秒
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·image-generation·deep-learning·text-to-image
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史