英語からの翻訳

LAION(大規模人工知能オープンネットワーク)は、オープンソースのAIデータセットとモデルを制作するドイツの非営利団体であり、Stable DiffusionやImagenなどのテキストから画像を生成するモデルの訓練に使用されるLAION-5Bのような大規模な画像キャプションデータセットで最もよく知られている。

LAION(Large-scale Artificial Intelligence Open Network 的缩写)是一个德国的非营利组织,致力于开发开源的人工智能模型和数据集。该组织以发布多个大规模图像-文本配对数据集而闻名,这些数据集从网络上抓取而来,已被用于训练多个知名的文本到图像模型,包括 Stable Diffusion 和 Imagen。LAION 作为一个由志愿者和研究人员组成的社区驱动型网络运作,旨在使人工智能训练数据和模型的获取更加民主化。

LAION 的成立背景与生成式人工智能的日益普及相关,其工作重点是为大型科技公司所持有的专有数据集提供替代方案。通过免费公开其数据集,该组织使得研究人员和小型机构能够在不必依赖企业资源的情况下参与机器学习研究。与此同时,其活动也使其处于围绕人工智能训练数据的法律和伦理争议的中心,特别是涉及版权和内容审核的问题。

历史与创立

LAION 在德国成立,是一个非营利实体,其名称意为“大规模人工智能开放网络”。该倡议源于一个人工智能研究者和爱好者的社区,他们希望复制商业实验室(如 OpenAI)所使用的数据集规模。该组织早期的工作重点是利用公开的网络数据构建大规模的图像-文本数据集,这需要大量的计算资源和志愿者的协调配合。

2021年8月,LAION 发布了其第一个主要数据集 LAION-400M,包含4亿个图像-文本配对。该数据集是从 Common Crawl 在2014年至2021年间抓取的网页中随机抽取的子集。发布该数据集的动机是希望重现 OpenAI 用于训练 CLIP 模型的数据收集过程,因为 OpenAI 虽然开源了模型代码和权重,但并未公开其训练数据集。LAION-400M 迅速成为研究深度学习模型(尤其是文本到图像生成领域)的重要资源。

2022年3月,LAION 发布了其继任数据集 LAION-5B,包含超过50亿个图像-文本配对。该数据集在发布时是同类中最大的免费公开数据集。LAION-5B 的创建得到了 Doodlebot、Hugging Face 和 Stability AI 的资助,其中 Stability AI 正是基于该数据集训练了 Stable Diffusion 文本到图像模型。这一发布标志着开放人工智能研究的一个重要里程碑,为训练神经网络模型提供了前所未有的数据规模。

图像数据集

LAION 的图像数据集是基于 Common Crawl 构建的,后者是一个从网络上抓取的网页数据集。开发者们从抓取的 HTML 中提取 <img> 标签,并将其 alt 属性作为对应的文本描述。他们使用基于Transformer架构的 CLIP 模型来筛选图像,剔除那些内容与文本描述不匹配的样本。需要强调的是,LAION 本身并不存储抓取到的图像内容,其数据集仅包含指向这些图像的 URL 链接,研究人员需要自行下载图像。

LAION-400M 于2021年8月发布,包含从2014年至2021年间抓取的网页中提取的4亿个图像-文本配对。该数据集被用于训练 Imagen,这是 Google Brain 于2022年宣布的一个文本到图像模型,训练时还结合了私有的内部数据集。该数据集的规模和可获取性使其成为早期生成式人工智能研究的基础资源。

LAION-5B 于2022年3月发布,在 LAION-400M 的基础上进行了扩展,包含超过50亿个配对。在发布时,它是同类中最大的免费公开数据集。该数据集的庞大规模使得训练更复杂的模型成为可能,其中包括后来成为最广泛使用的开源文本到图像系统之一的 Stable Diffusion。构建该数据集涉及大量的计算工作,包括数据过滤和去重流程,以确保数据质量。

2024年8月,LAION 发布了数据集的净化版本 Re-LAION-5B,以回应原版数据集中存在有害内容的担忧。该更新版本旨在解决针对原版数据集的一些批评,同时保持其对人工智能研究的实用性。

法律挑战

LAION 因其数据集而卷入了多起法律纠纷。2023年2月,在 Getty Images 对 Stable Diffusion 的诉讼中,LAION 被列为相关方(非被告)。Getty Images 指控 Stable Diffusion 的训练过程(使用了 LAION-5B)未经授权使用了其版权图像。LAION 并非该案的被告,但因其数据集在训练中的使用而被提及。

2023年4月,一位德国摄影师直接对 LAION 提起诉讼,要求将其作品从训练数据集中移除。该摄影师主张其受版权保护的作品在未经许可的情况下被包含在 LAION-5B 中。2024年9月,汉堡地区法院驳回了该诉讼,这一裁决被描述为关于人工智能训练数据中“文本与数据挖掘”例外的“里程碑式判决”,对德国及更广泛的欧盟地区具有法律意义。

这些法律诉讼凸显了人工智能发展与版权法之间更广泛的紧张关系,而随着大语言模型和其他人工智能系统的日益普及,这一话题仍在持续演变。这些案件的裁决结果不仅对 LAION 产生影响,也对整个开放人工智能研究领域具有深远意义。

批评与内容问题

多项研究显示,LAION-5B 中包含有问题的内容,包括与强奸、色情、恶意刻板印象、种族歧视和民族诽谤等相关的图像和文本配对。这些发现引发了对使用此类数据集训练人工智能模型的伦理担忧,尤其是对于那些部署在面向公众的应用中的模型。

巴伐利亚广播公司的一项调查显示,LAION 的数据集(托管在 Hugging Face 上)包含大量从公共网站收集的私人和敏感数据。这引发了隐私方面的担忧,因为个人的图像和相关信息可能在不知情或未经同意的情况下被包含在数据集中。

2023年12月,斯坦福互联网观察站发布了一份关于 LAION-5B 的报告,发现其中有3226个疑似指向儿童性虐待材料的链接,其中1008个已得到外部验证。作为回应,LAION 暂时下架了 LAION-5B 和 LAION-400M,并表示其对非法内容采取“零容忍政策”,此举是出于“高度谨慎”。这一下架事件意义重大,因为它暂时中断了对这些已成为人工智能研究社区标准资源的数据集的访问。

2024年8月发布的 Re-LAION-5B 是 LAION 应对这些问题的一部分努力。该净化后的数据集旨在过滤掉非法和有害内容,同时保留原数据集对研究的价值。然而,这一事件也凸显了在互联网规模的数据集中进行内容审核的困难,以及人工智能数据收集过程中持续保持警惕的必要性。

OpenAssistant

OpenAssistant 是一个开源的人工智能聊天助手,能够理解任务、与第三方系统交互并动态检索信息。该项目由 LAION 与一群志愿者合作开发。其开发目标之一是提供可以在消费级硬件上本地运行的大语言模型的免费访问,以应对大型企业集中控制人工智能能力的担忧。

该项目得到了全球范围内的众包努力支持,超过13,500名志愿者参与创建了60万个由人类生成的数据点。这些数据点被用于训练该助手的模型,旨在打造一个透明、由社区驱动的专有聊天机器人替代方案。2023年4月15日,LAION 与贡献者们公开发布了名为 OpenAssistant 的开源人工智能聊天助手。

尽管该项目最初前景广阔,但目前已停止运营。不过,其数据集和模型仍然可以在 Hugging Face 上获取,研究人员可以继续使用并在此基础上进行开发。该项目的遗产在于它证明了众包方式可以用于创建人工智能训练数据和模型,而无需依赖企业环境。

影响与遗产

LAION 的数据集对人工智能领域产生了深远影响,尤其是在文本到图像生成方面。通过免费开放大规模数据集,LAION 使得大量研究人员和开发者能够实验和部署原本难以获取的人工智能模型。该组织的工作对 Stable Diffusion 等开源模型的发展起到了重要作用,这些模型已成为该领域的基准。

LAION 的方法也影响了关于人工智能数据伦理和版权的讨论。围绕其数据集的法律纠纷和内容问题,促使人们更加关注数据集创建者的责任以及开发更好内容审核工具的必要性。这些讨论使得数据增强和过滤技术等议题在人工智能研究中受到更多关注。

LAION 的社区驱动、开源开发模式与 OpenAIGoogle DeepMind 等公司更为封闭的做法形成了鲜明对比。尽管该组织面临了重大批评,但其对人工智能研究民主化的贡献得到了广泛认可。截至2025年,LAION 仍在运营,但其未来的活动可能会受到围绕人工智能训练数据的持续法律和伦理辩论的影响。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·open-source·datasets·nonprofit
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴