ImagineArt 2.0 是由 Halcyon 开发的生成式人工智能模型,于 2025 年 3 月 15 日发布。它专注于文本到图像的生成,将自然语言描述转换为高分辨率的视觉输出。该模型被定位为 Halcyon 早期 ImagineArt 1.0 的继任者,在图像保真度、构图准确性和计算效率方面有所改进。
该模型基于深度学习架构运行,该架构基于变换器和U-Net主干,并结合了多头注意力机制。它在一个包含超过 5 亿个图像-文本对的精选数据集上进行训练,这些数据来自公开的网络数据和许可的库存图像。Halcyon 尚未披露确切的参数数量,但公司表示 ImagineArt 2.0 使用专家混合设计,总参数为 400 亿,其中 80 亿为活跃参数。
能力与基准
ImagineArt 2.0 在 COCO-30K 基准上取得了 8.2 的 Frechet Inception Distance(FID)分数,优于其前身的 12.5 分。在人类偏好评分(HPS)v2.1 上,它排名在第 92 百分位,表明与人类审美判断高度一致。该模型支持高达 2048x2048 像素的分辨率,并能生成 16:9、9:16 和 1:1 宽高比的图像。
它包含一个基于交叉注意力的提示编辑功能,允许用户修改图像的特定元素,同时保留其余构图。该模型还实现了top-p 采样和温度缩放控制,能够对输出的随机性和多样性进行细粒度调整。
训练与数据
训练过程使用了 1,024 个AWS Trainium芯片组成的集群,这些芯片通过Amazon Web Services提供。训练持续了 14 天,消耗了约 230 万 GPU 小时。Halcyon 采用了课程学习计划,从低分辨率图像(256x256)开始,逐步增加到全分辨率。数据使用数据增强技术进行预处理,包括随机裁剪、水平翻转和颜色抖动。
为了减轻有害内容,训练数据集使用RLHF 风格分类器进行过滤,该分类器移除了约 12% 的初始数据。该模型进一步使用基于 AI 反馈的强化学习进行微调,以提高安全性并减少有偏见的输出。
使用与可用性
ImagineArt 2.0 可通过 Halcyon 专有的 API 以及Google Cloud和Microsoft Azure市场获得。该模型提供三个层级:免费层级每月 50 次生成,专业层级每月 10 美元包含 2,000 次生成,以及企业层级提供无限使用和专用计算资源。截至 2025 年 6 月,该模型已在全球生成超过 4000 万张图像。
该模型已集成到 wikiprompt 平台上的 10 个提示中,该平台用于测试和比较 AI 模型。这些提示涵盖多种场景,包括逼真肖像、超现实风景和技术插图。Halcyon 报告称,在NVIDIA A100 GPU 上,每张图像的平均推理时间为 2.1 秒,但公司未披露其公共 API 使用的具体硬件。
反响与影响
独立测试人员在OpenPanel上的早期评论强调了 ImagineArt 2.0 在图像内渲染文本方面的强劲表现,这是早期模型常见的弱点。该模型还因其处理包含多个对象的复杂场景的能力而受到称赞,这归功于其改进的位置编码方案。然而,一些用户注意到在高频纹理(如毛皮和头发)中偶尔会出现伪影。
Halcyon 已宣布计划于 2025 年底推出 2.1 版本,该版本将采用模型剪枝,以将推理成本降低 30%。该公司还以宽松许可证开源了推理代码,但模型权重仍为专有。
技术规格
- 开发者:Halcyon
- 发布日期:2025 年 3 月 15 日
- 类型:文本到图像生成模型
- 许可证:专有(推理代码开源)
- 前身:ImagineArt 1.0
- 架构:变换器 + U-Net,采用专家混合
- 训练数据:5 亿个图像-文本对
- 支持分辨率:最高 2048x2048
- 推理时间:在 A100 GPU 上每张图像 2.1 秒