译自英文

LAION-5B是一个大规模开放数据集,包含58.5亿个图像-文本对,由非营利组织LAION于2022年发布。它被广泛用于训练诸如Stable Diffusion等生成模型。

LAION-5B是一个包含58.5亿图像-文本对的大规模开放数据集,由非营利组织LAION(大规模人工智能开放网络)创建。该数据集于2022年发布,是同类中最大的公开可用数据集之一,并已被广泛用于训练诸如Stable Diffusion等生成模型。它是人工智能机器学习领域的关键资源。

历史与创建

LAION-5B之前有LAION-400M,这是一个于2021年8月发布的包含4亿图像-文本对的数据集。更大的LAION-5B通过爬取Common Crawl网络语料库构建,该语料库存档了数十亿个网页。团队使用由OpenAI开发的CLIP模型来计算图像及其相关替代文本或标题的嵌入。保留图像和文本嵌入之间余弦相似度高的配对,而丢弃低质量或不匹配的配对。最终数据集于2022年10月在一篇题为“LAION-5B:用于训练下一代图像-文本模型的开放大规模数据集”的论文中发布。创建过程依赖于深度学习神经网络的技术,特别是CLIP中使用的Transformer架构。

构成与子集

LAION-5B包含三个子集:LAION-2B-en(23.2亿英文配对)、LAION-2B-multi(22.7亿多语言配对)和LAION-1B-nolang(12.6亿无语言过滤配对)。该数据集不直接存储图像,而是提供元数据,如图像URL、替代文本、尺寸和相似度分数。这种设计允许研究人员按需下载图像,但也意味着某些URL可能随时间变得不可访问。这些子集的组织旨在支持多语言和跨语言学习的研究,这与大型语言模型和多模态系统相关。

应用

LAION-5B已被用于训练多种生成式AI模型。最显著的例子是Stable Diffusion,这是一种由Stability AI于2022年8月发布的文本到图像模型。Stable Diffusion使用带有U-Net交叉注意力层的潜在扩散架构,从文本提示生成图像。该模型在LAION-5B的一个子集上训练,并证明了通过开放数据和开源方法可以实现高质量的图像生成。LAION-5B也被用于训练图像-文本模型、对比模型和其他多模态系统。它作为评估这些模型在大规模数据上性能的基准。该数据集的规模和多样性对基于多头注意力的架构特别有价值,这些架构受益于大量配对数据。

争议与局限性

该数据集引发了关于隐私、版权和偏见的担忧。由于它源自网络爬取,因此包含个人照片、受版权保护的艺术作品以及可能冒犯性或有害的内容。LAION已尝试过滤已知的有问题材料,但数据集的庞大规模使得完全移除变得困难。2023年,该数据集在收到法律投诉后暂时下线,但后来在增加过滤后恢复。研究人员还指出,该数据集反映了网络中的偏见,包括性别和种族刻板印象。这些问题在大型网络抓取数据集中很常见,并且仍然是一个活跃的研究领域。

影响与遗产

LAION-5B已成为开源AI社区中的标准资源。它证明了大规模数据集可以由志愿者组织构建和共享,这与私营公司持有的专有数据集形成鲜明对比。该数据集影响了后续创建开放多模态数据集的努力,并推动了生成式AI和机器学习领域的研究浪潮。其发布也突显了数据治理的重要性以及负责任数据集管理的必要性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:datasets·image-text-pairs·multimodal-learning·open-source-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史