译自英文

LAION(大规模人工智能开放网络)是一个德国非营利组织,致力于创建开源人工智能数据集和模型,以大型图像-标题数据集如LAION-5B而闻名,这些数据集用于训练文本到图像模型,例如[[stable-diffusion|Stable Diffusion]]和[[imagen|Imagen]]。

LAION(全称“大规模人工智能开放网络”)是一家德国非营利组织,致力于开发开源的人工智能模型和数据集。该组织最知名的是发布了多个从网络抓取的大型图像和标题数据集,这些数据集已被用于训练多款备受瞩目的文本到图像模型,包括Stable Diffusion和Imagen。该组织以社区驱动的志愿者和研究人员网络形式运作,旨在推动AI训练数据和模型的民主化获取。

LAION成立于对生成式人工智能兴趣日益浓厚的背景下,其工作重点是提供大型AI公司所持有的专有数据集的替代方案。通过免费开放数据集,该组织使研究人员和小型机构能够参与机器学习研究,而无需依赖企业资源。其活动也使其处于围绕AI训练数据的法律和伦理辩论中心,尤其是在版权和内容审核方面。

历史与创立

LAION在德国成立,是一个非营利实体,其名称代表“大规模人工智能开放网络”。该倡议源于一群AI研究人员和爱好者组成的社区,他们试图复制商业实验室(如OpenAI)所使用的数据集规模。该组织早期的努力集中于从公开可用的网络数据中构建大规模图像-文本数据集,这需要大量的计算资源和志愿者协调。

2021年8月,LAION发布了其首个主要数据集LAION-400M,包含4亿个图像-标题对。该数据集来源于Common Crawl在2014年至2021年间抓取的网页随机子集。此次发布的动机是希望重现OpenAI为训练CLIP模型而收集4亿个图像-标题对的过程,因为OpenAI已开源了该模型的代码和权重,但未公开其训练数据集。LAION-400M迅速成为研究深度学习模型(尤其是文本到图像生成领域)的研究人员的重要资源。

2022年3月,LAION发布了后续数据集LAION-5B,包含超过50亿个图像-标题对。在发布时,它是同类数据集中最大的免费可用数据集。LAION-5B的创建由Doodlebot、Hugging Face和Stability AI资助,后者是Stable Diffusion文本到图像模型背后的公司,该模型正是基于此数据集训练的。此次发布标志着开放AI研究的一个重要里程碑,为训练神经网络模型提供了前所未有的数据规模。

图像数据集

LAION的图像数据集基于Common Crawl构建,后者是一个抓取网页的数据集。开发者搜索抓取的HTML中的<img>标签,并将其alt属性视为标题。他们使用CLIP(一种基于Transformer的模型)来识别并丢弃内容与标题不匹配的图像。重要的是,LAION本身不托管抓取图像的内容;相反,数据集包含指向图像的URL,研究人员需要自行下载。

LAION-400M于2021年8月发布,包含从2014年至2021年间抓取的网页中提取的4亿个图像-标题对。它被用于训练Imagen(谷歌大脑于2022年宣布的文本到图像模型),并结合了私有的内部数据集。该数据集的规模和可访问性使其成为早期生成式人工智能研究的基础资源。

LAION-5B于2022年3月发布,以超过50亿对的数据扩展了这种方法。截至发布时,它是现存最大的免费图像-标题对数据集。该数据集的规模使得训练更复杂的模型成为可能,包括Stable Diffusion,后者成为最广泛使用的开源文本到图像系统之一。该数据集的构建涉及大量的计算工作,包括过滤和去重过程以提高数据质量。

2024年8月,LAION发布了该数据集的清理版本,名为Re-LAION-5B,以回应原始版本中关于有害内容的担忧。这一更新后的数据集旨在解决早期版本受到的一些批评,同时保持其对AI研究的实用性。

法律挑战

LAION卷入了多起与其数据集相关的法律纠纷。2023年2月,LAION在Getty Images对Stable Diffusion的诉讼中被列为非当事方。该诉讼由Getty Images提起,指控Stable Diffusion的训练过程(使用了LAION-5B)涉及未经授权使用受版权保护的图像。LAION并非被告,但在数据集的来源背景中被提及。

2023年4月,LAION被一位德国摄影师直接起诉,该摄影师要求将其图像从训练集中移除。摄影师辩称,其受版权保护的作品未经许可被包含在LAION-5B中。2024年9月,汉堡地区法院驳回了该诉讼,这被描述为德国乃至欧盟“关于AI训练数据TDM(文本和数据挖掘)例外的里程碑式裁决”。该裁决被视为在欧洲版权法下使用网络抓取数据进行AI训练合法性的重要先例。

这些法律程序凸显了AI发展与版权法之间的更广泛紧张关系,这一话题随着大型语言模型和其他AI系统的日益普及而持续演变。这些案件的结果不仅对LAION产生影响,也对整个开放AI研究领域具有意义。

批评与内容担忧

多项研究表明,LAION-5B中的图像包含有问题的内容,包括与强奸、色情、恶意刻板印象、种族主义和族裔诽谤相关的图像和文本对,以及其他极其有问题的材料。这些发现引发了对使用此类数据集进行AI训练的伦理影响的担忧,尤其是对于部署在面向公众应用中的模型。

巴伐利亚广播公司的一项调查显示,LAION托管在Hugging Face上的数据集包含大量从公共网站收集的私人和敏感数据。这引发了隐私担忧,因为个人的图像和个人信息可能在不知情或未经同意的情况下被包含在内。

2023年12月,斯坦福互联网观察站发布了一份关于LAION-5B的报告,发现3,226起疑似儿童性虐待材料链接的实例,其中1,008起经过外部验证。作为回应,LAION暂时移除了LAION-5B和LAION-400M,理由是“对非法内容的零容忍政策”和“出于极度谨慎”。这一移除是一个重要步骤,因为它暂时中止了对已成为AI研究社区标准资源的数据集的访问。

2024年8月发布的Re-LAION-5B是LAION解决这些问题努力的一部分。清理后的数据集旨在过滤非法和有害内容,同时保留原始数据集对研究的实用性。然而,这一事件凸显了在网络规模数据集上进行内容审核的挑战,以及在AI数据收集中持续保持警惕的必要性。

OpenAssistant

OpenAssistant是一个人工智能开源聊天助手,能够理解任务、与第三方系统交互并动态检索信息以完成这些任务。该项目由一群志愿者与LAION合作开发。开发目标之一包括免费访问可在消费级硬件上本地运行的大型语言模型,以解决AI能力集中于大型企业的担忧。

该项目得到了全球众包努力的支持,超过13,500名志愿者创建了60万个由人类生成的数据点。这些数据点被用于训练助手的模型,旨在创建一个透明且由社区驱动的专有聊天机器人替代方案。2023年4月15日,LAION和贡献者公开发布了一个名为OpenAssistant的开源AI助手聊天机器人。

尽管该项目最初前景广阔,但此后已被关闭。然而,数据集和模型仍可在Hugging Face上获取,允许研究人员继续使用并在此基础上进行构建。该项目的遗产在于其展示了如何利用众包在企业环境之外创建AI训练数据和模型。

影响与遗产

LAION的数据集对人工智能领域产生了深远影响,尤其是在文本到图像生成方面。通过提供大规模数据集的开放访问,LAION使广泛的研究人员和开发者能够实验和部署原本无法获取的AI模型。该组织的工作在Stable Diffusion等开源模型的发展中发挥了关键作用,这些模型已成为该领域的基准。

该组织的方法也影响了关于AI数据伦理和版权的辩论。与LAION数据集相关的法律挑战和内容担忧促使人们讨论数据集创建者的责任以及更好内容审核工具的需求。这些讨论导致了对AI研究中数据增强和过滤技术等问题的更多关注。

LAION的社区驱动、开源开发模式与OpenAI谷歌DeepMind等公司更为封闭的方法形成对比。尽管该组织面临重大批评,但其对AI研究民主化的贡献得到广泛认可。截至2025年,LAION仍在运营,但其未来活动可能受到围绕AI训练数据的持续法律和伦理辩论的影响。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·open-source·datasets·nonprofit
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史