译自英文

Imagen是由Google DeepMind开发的一系列文本到图像模型,以其能够从自然语言提示生成高保真图像而闻名。它源自Google Brain的研究,并已集成到Gemini和Vertex AI等Google服务中。

Imagen 是一系列由 Google DeepMind 开发的文生图模型,旨在根据自然语言文本提示生成高保真图像。这些模型结合了基于 Transformer 的语言理解与 扩散模型 图像生成技术,使其在 DALL-EStable Diffusion 等主流生成式 AI 工具中占有一席之地。Imagen 可通过包括 Gemini 和 Vertex AI 在内的多种 Google 服务访问,并且自推出以来已进行了多次重大版本更新。

最初的 Imagen 模型首次发表于 2022 年 5 月的一篇研究论文中,由 Google Brain 团队在 2023 年 4 月与 DeepMind 合并之前开发。后续版本 Imagen 2 和 Imagen 3 分别于 2023 年 12 月和 2024 年 8 月发布,每一代都在图像质量、文本渲染和用户控制方面有所提升。2025 年 5 月,Google 在其年度 I/O 大会上发布了 Imagen 4,进一步推动了模型能力的边界。

技术

Imagen 的架构依赖于两项关键技术:一个用于文本编码的冻结 大型语言模型(LLM)和一个级联扩散模型用于图像生成。文本编码器基于 T5 Transformer 家族,将输入提示转换为引导图像合成过程的语义嵌入。扩散模型则分阶段运行,从低分辨率图像(64×64 像素)开始,逐步上采样至更高分辨率,早期版本最终达到 1024×1024 像素。Imagen 4 将该能力扩展至生成高达 2K 分辨率的图像,增强了细节表现和视觉保真度。

级联设计允许模型逐步细化图像,提高与文本提示的对齐度。与单阶段模型相比,这种方法实现了更高效的训练和更高质量的输出。使用冻结的 LLM 还利用了自然语言处理领域的最新进展,使 Imagen 能够理解复杂提示,包括抽象概念和风格化指令。

能力

Imagen 擅长根据文本描述生成逼真图像,同时也支持多种艺术风格,如电影感、35mm 胶片、超现实主义和插画风格。这种多样性使其适用于创意应用,包括数字艺术、广告和概念设计。该模型能够生成多种宽高比的图像,如 9:16、3:4、1:1、4:3 和 16:9,以适应不同的显示格式和使用场景。

除了初始生成,Imagen 还提供编辑功能,允许用户通过提供新的文本提示来优化现有图像。此功能支持迭代式创意工作流,用户无需重新生成整个图像即可调整构图、风格或特定元素。然而,与其他文生图模型类似,Imagen 也存在局限性,例如在准确渲染人手、文字、连体字和其他复杂排版方面仍有困难。这些挑战是该领域的普遍问题,也是持续研究的重点方向。

另见

参考资料

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-image·google-deepmind·diffusion-models
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史