Muse 是由 Google 开发的一种文本到图像生成模型,于 2023 年 1 月在一篇研究论文中首次公布。它属于基于 Transformer (architecture) 的模型家族,旨在根据文本描述生成高分辨率图像。与 Stable Diffusion 或 DALL-E 等基于扩散的模型不同,Muse 在压缩图像空间中操作离散标记,采用受 Large language model 中掩码语言建模启发的掩码生成方法。
该模型由 Google 和 Google DeepMind 的研究人员开发,基于向量量化和 transformer 架构的先前工作。其详细内容在论文“Muse: Text-To-Image Generation via Masked Generative Transformers”中公开,该论文展示了在 MS-COCO 等基准测试上的最先进结果,以及零样本生成能力。Google 将 Muse 定位为扩散模型的高效替代方案,声称在保持竞争性图像质量的同时,推理速度更快。
架构
Muse 采用两阶段流程。首先,一个预训练的变分自编码器(VAE)将图像压缩为离散标记网格,类似于 VQGAN 或 VQ-VAE 中使用的方法。其次,一个 transformer 模型被训练用于预测这些标记中的掩码部分,条件是基于冻结的 Large language model(具体为 T5)生成的文本嵌入。在生成过程中,模型从所有标记被掩码开始,迭代地预测最自信的标记,并在多个步骤中填充其余部分。这种掩码建模技术支持并行解码,从而比自回归模型更快地生成图像。
文本编码器是一个冻结的 T5-XXL 模型,提供丰富的语义表示。图像分词器是一个在大型图像数据集上训练的 VAE,根据配置生成 256x256 或 512x512 的标记网格。transformer 本身采用标准的编码器-解码器架构,其中文本嵌入作为编码器输入,掩码图像标记作为解码器输入。
训练与数据
Muse 在大量图像-文本对上进行训练,包括公开可用的 LAION-5B 数据集和 Google 内部数据集。训练过程分为两个阶段:首先,VAE 单独在图像上进行训练;然后,transformer 被训练用于在给定文本和未掩码上下文的情况下预测掩码标记。该模型在 TPU v4 集群上训练,最大变体拥有 30 亿参数。论文报告称,Muse 在 MS-COCO 上实现了 7.9 的零样本 FID 分数,优于当时像 GLIDE 和 DALL-E 2 这样的早期扩散模型。
能力
该模型支持除文本到图像生成之外的多种任务。它可以执行图像编辑,通过部分掩码输入图像并提供文本提示,实现局部更改。它还支持外绘(扩展图像边界)和内绘(填充缺失区域)。此外,Muse 可以生成具有可变宽高比的图像,并可针对特定风格或领域进行微调。论文证明,Muse 可以在单个 TPU 上约 1.5 秒内生成高质量的 512x512 图像,这比需要多次去噪步骤的扩散模型快得多。
与其他模型的比较
Muse 经常与 DALL-E 2 和 Imagen 进行比较,后两者都使用扩散过程。扩散模型逐步添加和去除噪声,需要数百步。相比之下,Muse 使用离散标记方法和迭代去掩码,通常只需 10-20 步。这使得它在推理时计算效率更高。然而,扩散模型在生产系统中被更广泛采用,部分原因是其简单性和鲁棒性。Muse 对离散标记空间的依赖有时会导致伪影,尤其是在复杂纹理或精细细节方面。
反响与影响
Muse 在研究社区中因其在图像领域创新性地使用掩码建模而受到好评。它影响了后续关于离散扩散和基于标记生成的研究。然而,Google 并未将 Muse 作为公开产品或 API 发布,这与后来的模型如 Imagen 或 Gemini 不同。其代码和权重未开源,限制了可复现性。尽管如此,Muse 的思想已被纳入 Google 后来的模型中,并启发了像 Parti 和 MuseGAN 这样的开源努力。
另见
参考文献
- Chang, H., et al. (2023). "Muse: Text-To-Image Generation via Masked Generative Transformers." arXiv:2301.00704.
- Google AI Blog. (2023). "Muse: A New Text-to-Image Model."