LAION(Large-scale Artificial Intelligence Open Network的缩写)是一个德国非营利组织,致力于开发开源人工智能模型和数据集。它最为人所知的是发布了多个从网络抓取的大规模图像与标题数据集,这些数据集已被用于训练多个备受瞩目的文本到图像模型,包括Stable Diffusion和Imagen。该组织旨在使AI资源的获取民主化,为研究人员和开发者提供免费可用的数据和工具。
LAION的工作处于更广泛的人工智能和机器学习领域之中,专注于创建能够训练复杂模型的大规模数据集。其数据集已成为生成式AI研究的基础资源,尤其是在文本到图像合成领域。
历史与创立
LAION在德国成立,是一个非营利组织,旨在促进人工智能领域的开放研究与发展。确切的成立日期并未被广泛记载,但该组织在2021年发布其首个主要数据集后声名鹊起。创始人为一群AI研究者和爱好者,他们旨在解决公开可获取的大规模数据集匮乏的问题,这些数据集用于训练像OpenAI的CLIP这样的模型,,该模型发布了代码和权重,但未公开其训练数据。
该组织以志愿者为基础运作,依赖AI社区的贡献。其项目通常通过来自公司和个人的合作伙伴关系及捐赠获得资金支持,这些捐助者认同其开放获取的使命。
图像数据集
LAION已公开发布了多个大规模图像-标题对数据集,这些数据集已被AI研究人员广泛使用。数据来源于Common Crawl,这是一个抓取网页的数据集。开发者搜索抓取的HTML中的<img>标签,并将其alt属性作为标题。他们使用CLIP来识别并丢弃内容与标题不匹配的图像。LAION本身不托管抓取图像的内容;相反,数据集包含指向图像的URL,研究人员需要自行下载。
第一个此类数据集LAION-400M于2021年8月发布,包含4亿个图像-标题对。这些配对是从Common Crawl在2014年至2021年间抓取的网页随机子集中提取的。这是为了重现OpenAI收集4亿个图像-标题对以训练CLIP模型的过程,,该公司选择开源模型的代码和权重,但未公开其训练数据集。Imagen是Google Brain于2022年宣布的文本到图像模型,它结合私有内部数据集在LAION-400M上进行了训练。
其继任者LAION-5B包含超过50亿个配对,于2022年3月发布。截至发布时,它是现存最大的免费可获取的图像-标题对数据集。其创建由Doodlebot、Hugging Face和Stability AI资助,Stability AI是资助Stable Diffusion文本到图像模型的AI公司,该模型正是在此数据集上训练的。
OpenAssistant
OpenAssistant是一个人工智能(AI)开源聊天助手,能够理解任务、与第三方系统交互并动态检索信息以完成任务。该项目由一群志愿者与LAION合作开发。开发目标之一包括免费获取可以在消费级硬件上本地运行的大型语言模型。该项目得到了全球众包努力的支持,超过13,500名志愿者创建了60万个由人类生成的数据点。该项目此后已关闭;然而,数据集和模型仍在Hugging Face上可用。
法律与伦理问题
2023年2月,LAION在Getty Images对Stable Diffusion的诉讼中被列为非当事方。2023年4月,一名德国摄影师直接起诉LAION,要求将其图像从训练集中移除。2024年9月,汉堡地区法院驳回了该诉讼,这被描述为德国乃至欧盟范围内“关于AI训练数据TDM(文本和数据挖掘)例外的里程碑式裁决”。
批评与争议
多项研究表明,LAION-5B中的图像包含强奸、色情、恶意刻板印象、种族主义和族裔诽谤等问题的图像和文本配对,以及其他极其有问题的内容。
巴伐利亚广播公司的一项调查显示,LAION托管在Hugging Face上的数据集包含大量从公共网站收集的私人和敏感数据。
2023年12月,斯坦福互联网观察站发布了一份关于LAION-5B的报告,发现3,226个疑似指向儿童性虐待材料的链接,其中1,008个已通过外部验证。作为回应,LAION暂时移除了LAION-5B和LAION-400M,理由是“对非法内容的零容忍政策”和“出于极度谨慎”。2024年8月,LAION发布了一个名为Re-LAION-5B的清理后数据集。
影响与遗产
LAION的数据集对AI领域产生了重大影响,使研究人员无需专有数据即可训练模型。LAION-400M和LAION-5B的发布推动了文本到图像生成的创新,像Stable Diffusion这样的模型在研究和商业应用中都得到了广泛使用。该组织对开源的承诺也影响了其他倡议,例如开源大型语言模型的开发。
尽管存在争议,LAION仍然是开放AI生态系统中的关键参与者,提供推进最先进技术所必需的资源。其在德国的法律胜利为在AI训练中使用网络抓取数据树立了先例,这可能对整个行业产生更广泛的影响。
未来方向
截至2025年,LAION继续致力于新数据集和模型的开发,重点关注提高数据质量和解决伦理问题。该组织还参与有关AI监管和数据负责任使用的讨论。其正在进行中的项目旨在平衡大规模数据的需求与保护个人权利及防止有害内容之间的关系。
LAION在AI社区中的作用仍然至关重要,因为它为OpenAI、Anthropic和Google DeepMind等主要科技公司的专有方法提供了对立面。通过提供开放替代方案,LAION有助于确保AI开发保持可及性和透明度。