LAION,全称“大规模人工智能开放网络”,是一个德国非营利组织,由克里斯托夫·舒曼于2021年与一群分布式的志愿者研究人员共同创立。该组织的核心使命是构建并公开发布包含图像及其关联文本描述的超大规模数据集,这些数据从公开网页中抓取,旨在让大型企业实验室之外的研究人员也能获得此前仅OpenAI和谷歌等公司内部才有的训练数据规模。
数据集及其作用
LAION最具影响力的发布是2021年的LAION-400M和2022年的LAION-5B,这两个数据集分别包含约4亿和50亿个图像-文本对,通过基于CLIP的相似度评分进行过滤,源页面主要来自与Common Crawl相关的索引。LAION-5B成为Stable Diffusion的主要训练数据来源,该扩散模型由Stability AI于2022年发布,同时它也支持了OpenCLIP,这是OpenAI原始CLIP模型的开放复现版本,广泛用于图像-文本嵌入及下游生成流程中的引导,包括围绕ControlNet和其他条件化技术构建的工具。
CSAM发现与清理
2023年12月,斯坦福互联网观察站的研究人员发布了一份审计报告,发现LAION-5B中包含少量但非零的儿童性虐待材料链接,这些链接通过与已知非法图像数据库的哈希匹配被识别。由于LAION仅分发URL和元数据,而非托管图像本身,数据集并未直接存储非法内容,但这一发现意味着,基于完整数据集训练的模型(包括广泛使用的Stable Diffusion检查点)在训练过程中可能受到了问题材料的影响。报告发布后,LAION立即将数据集从公开分发中移除,并与互联网观察基金会及斯坦福研究人员合作,过滤违规链接后重新发布了清理版本。这一事件成为AI伦理和AI治理讨论中广泛引用的案例,凸显了通过自动化大规模网页抓取构建训练数据而缺乏充分内容审核的风险。
更广泛的影响
尽管存在争议,LAION的数据集仍是开放生成式AI研究的基础设施,该组织继续发布其他资源,包括音频和多语言数据集,与EleutherAI等团体并肩,成为更广泛开放数据运动的一部分,旨在使前沿相关研究在少数资源充足的公司之外保持可及性。CSAM事件推动了行业范围内关于数据集审计标准的更广泛讨论,并促使对生成式AI行业使用的网页抓取训练语料库进行更严格的审查。