Parti-20B是一个拥有200亿参数的AI模型,用于文本到图像的生成,由Google Research开发。它属于Parti系列,该系列将图像生成视为序列到序列的问题,其中Transformer (architecture)编码器处理文本,解码器预测视觉标记。Parti-20B是该系列中最大的变体,旨在从复杂提示中生成高度详细且语义对齐的图像。
该模型基于Sequence-to-Sequence (Seq2Seq)学习的概念,利用神经网络架构将文本输入映射到图像标记的网格。与基于扩散的方法不同,Parti-20B使用自回归解码器,顺序生成图像块。这种设计使其能够随模型规模有效扩展,提高保真度和组合理解能力。
架构与训练
Parti-20B采用Encoder-Decoder Architecture变换器,其中编码器使用Multi-Head Attention和Positional Encoding处理文本提示。解码器随后预测一系列离散的视觉标记,这些标记通过学习的码本映射到像素。训练涉及大量图像-文本对的数据集,并使用Adam (Optimizer)和Learning Rate Scheduling进行优化。模型使用Layer Normalization和Dropout以保持稳定性,并使用Gradient Clipping来处理大规模训练。
自回归生成过程依赖于Beam Search或采样策略,如Top-K Sampling和Top-P (Nucleus) Sampling,并使用Temperature Scaling来控制多样性。Parti-20B的规模使其能够捕捉较小模型遗漏的细粒度细节,如纹理和空间关系。
能力与性能
Parti-20B擅长遵循复杂提示,包括包含多个对象、属性和空间约束的提示。它可以生成逼真的图像、艺术风格和新颖的构图。与早期模型相比,它在零样本泛化方面表现出显著改进,这意味着它可以在无需微调的情况下处理未见过的提示。该模型还在训练期间支持Data Augmentation以增强鲁棒性。
在基准评估中,Parti-20B在文本到图像任务上取得了最先进的结果,在FID(Fréchet Inception Distance)和人类偏好评分方面优于许多同期模型。其200亿参数使其能够表示更广泛的视觉概念,尽管推理需要大量计算资源。
与其他模型的关系
Parti-20B是Generative AI更广泛趋势的一部分,与DALL-E和Stable Diffusion等模型并列。它与扩散模型的不同之处在于使用自回归方法,一些研究人员认为这提供了更好的可控性。该模型与Large language model技术相关,因为它共享变换器骨干和针对图像调整的训练目标。它还连接到关于缩放定律的Machine learning研究,其中更大的模型持续提高性能。
谷歌尚未公开发布Parti-20B,限制了访问仅限于内部研究和选定的合作伙伴。这与开源努力形成对比,但符合该公司开发专有AI系统的策略。该模型的架构已影响后续文本到图像生成的工作,包括标记化和解码效率的改进。
局限性与伦理考量
与许多文本到图像模型一样,Parti-20B如果在未过滤的互联网数据上训练,可能会产生有偏见或有害的输出。它也可能在罕见概念或模糊提示上表现不佳,有时生成无意义的结果。运行200亿参数模型的计算成本很高,需要专用硬件,如Google Cloud TPU或GPU,这限制了可访问性。
研究人员强调了安全措施的必要性,如提示过滤和输出审核。Parti-20B的开发也引发了关于版权和滥用创建欺骗性图像的潜在问题。截至2023年,这些担忧在AI社区中仍然活跃,促使人们呼吁负责任地部署。
遗产与影响
Parti-20B证明了将自回归模型扩展到数百亿参数对于图像生成是可行的,为后来的模型如Imagen和Gemini铺平了道路。它的成功强化了模型规模在Deep learning中的重要性,并激发了对高效变换器的进一步研究。虽然未公开可用,但其技术贡献已在研究论文中记录,影响了学术和工业界的努力。
该模型将图像视为序列的方法也已应用于其他领域,如视频生成和3D场景合成。Parti-20B仍然是理解自回归和基于扩散的生成模型之间权衡的参考点,其发现继续为下一代系统的设计提供信息。