译自英文

Parti是谷歌开发的一种自回归文本到图像模型,能够从文本描述生成高保真图像。它采用基于变换器的序列到序列方法,将图像生成为视觉标记的序列。

Parti是一个自回归文本到图像模型,由Google DeepMind开发。它将图像生成视为序列到序列问题,类似于大型语言模型生成文本的方式,从而从文本描述中生成图像。Parti于2022年推出,以其从复杂提示中生成高保真、逼真图像的能力而闻名,这些提示包括包含多个对象和特定属性的场景。

该模型首先使用编码器将输入文本提示转换为标记序列,然后自回归地预测图像标记序列。这些图像标记来自一个单独学习的离散视觉码本。这种方法使Parti能够随模型大小和训练数据的增加而有效扩展,从而在图像质量和语义对齐方面取得改进。

架构

Parti的架构基于Transformer模型。它采用编码器-解码器结构,其中编码器处理文本提示,解码器生成图像标记序列。视觉标记来自预训练的视觉Transformer(ViT)模型,该模型充当分词器。解码器被训练为根据文本和先前生成的标记预测下一个图像标记,这一过程类似于机器学习中的序列建模。

该模型以多种规模进行训练,参数从3.5亿到200亿不等。最大的变体Parti-20B在MS-COCO和Localized Narratives等基准测试中展现了最先进的性能,取得了较高的FID(Fréchet Inception Distance)分数,该分数衡量生成图像与真实图像分布之间的相似性。

训练与数据

Parti在包含公开网络数据和专有数据集的大型图像-文本对数据集上进行了训练。训练过程包括两个阶段:首先,使用基于ViT的分词器学习视觉码本;其次,训练自回归Transformer从文本预测图像标记。该模型使用标准交叉熵损失对离散图像标记进行优化。

Google报告称,扩展模型大小和训练数据可带来图像质量的持续改进,尤其是对于需要组合推理的复杂提示。该模型还展现出处理包含多个对象、空间关系和风格属性的提示的能力。

能力与局限

Parti擅长生成具有高保真度和语义准确性的图像。它可以从描述特定场景的提示中生成图像,例如“一只戴着帽子的猫的照片”或“一幅日落时未来城市的画作”。该模型还支持文本渲染,这对许多图像生成模型来说是一项具有挑战性的任务。然而,Parti也存在局限性,包括在细粒度细节上偶尔出错,例如对象数量不正确或属性不匹配。此外,它还需要大量计算资源进行训练和推理。

与其他模型的比较

Parti与DALL-E 2和Imagen等其他文本到图像模型同期开发。虽然Imagen采用基于扩散的方法,但Parti是自回归的,这使其能够利用序列建模的进展。在评估中,Parti-20B在MS-COCO等基准测试上取得了与DALL-E 2和Imagen相比具有竞争力或更优的结果,尤其是在FID分数和人类评估方面。然而,人们注意到Imagen等扩散模型在特定美学品质上表现出色,而Parti则在语义对齐和复杂推理方面表现优异。

影响与遗产

Parti为图像合成中生成式AI的快速发展做出了贡献。其自回归方法影响了后续在统一多模态模型中的研究,在这些模型中,文本和图像在共享的标记空间中进行处理。Parti的码本和扩展见解后来被整合到其他Google模型中,例如Gemini系列,该系列集成了文本、图像和音频生成。该模型还强调了扩展定律在视觉语言任务中的重要性,这与深度学习研究中的发现一致。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-image·google-deepmind·autoregressive-model·generative-ai
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史