Imagen 是一系列由 Google DeepMind 开发的文生图模型,旨在根据自然语言文本提示生成高保真图像。这些模型结合了基于 Transformer 的语言理解与 扩散模型 图像生成技术,使其在 DALL-E 和 Stable Diffusion 等主流生成式 AI 工具中占有一席之地。Imagen 可通过包括 Gemini 和 Vertex AI 在内的多种 Google 服务访问,并且自推出以来已进行了多次重大版本更新。
最初的 Imagen 模型首次发表于 2022 年 5 月的一篇研究论文中,由 Google Brain 团队在 2023 年 4 月与 DeepMind 合并之前开发。后续版本 Imagen 2 和 Imagen 3 分别于 2023 年 12 月和 2024 年 8 月发布,每一代都在图像质量、文本渲染和用户控制方面有所提升。2025 年 5 月,Google 在其年度 I/O 大会上发布了 Imagen 4,进一步推动了模型能力的边界。
技术
Imagen 的架构依赖于两项关键技术:一个用于文本编码的冻结 大型语言模型(LLM)和一个级联扩散模型用于图像生成。文本编码器基于 T5 Transformer 家族,将输入提示转换为引导图像合成过程的语义嵌入。扩散模型则分阶段运行,从低分辨率图像(64×64 像素)开始,逐步上采样至更高分辨率,早期版本最终达到 1024×1024 像素。Imagen 4 将该能力扩展至生成高达 2K 分辨率的图像,增强了细节表现和视觉保真度。
级联设计允许模型逐步细化图像,提高与文本提示的对齐度。与单阶段模型相比,这种方法实现了更高效的训练和更高质量的输出。使用冻结的 LLM 还利用了自然语言处理领域的最新进展,使 Imagen 能够理解复杂提示,包括抽象概念和风格化指令。
能力
Imagen 擅长根据文本描述生成逼真图像,同时也支持多种艺术风格,如电影感、35mm 胶片、超现实主义和插画风格。这种多样性使其适用于创意应用,包括数字艺术、广告和概念设计。该模型能够生成多种宽高比的图像,如 9:16、3:4、1:1、4:3 和 16:9,以适应不同的显示格式和使用场景。
除了初始生成,Imagen 还提供编辑功能,允许用户通过提供新的文本提示来优化现有图像。此功能支持迭代式创意工作流,用户无需重新生成整个图像即可调整构图、风格或特定元素。然而,与其他文生图模型类似,Imagen 也存在局限性,例如在准确渲染人手、文字、连体字和其他复杂排版方面仍有困难。这些挑战是该领域的普遍问题,也是持续研究的重点方向。
另见
- 人工智能艺术
- 计算机艺术
- 生成艺术
- DALL-E
- Midjourney
- Recraft
- Stable Diffusion