LAION,即大规模人工智能开放网络的简称,是一个德国非营利组织,由克里斯托夫·舒曼于2021年与一群分散的志愿者研究人员共同创立。该组织的核心使命是构建并公开发布非常大的数据集,将图像与其相关的文本说明配对,这些数据从公共网页上抓取,以便让大型企业实验室之外的研究人员能够获得那种Training data规模的训练数据,而这种规模此前仅对OpenAI和Google等公司内部开放。
数据集及其作用
LAION最具影响力的发布是2021年的LAION-400M和2022年的LAION-5B,这两个数据集分别包含约4亿和50亿个图像-文本对,通过基于CLIP的相似度评分进行过滤,源页面主要来自与Common Crawl相关的索引。LAION-5B成为Stable Diffusion的主要训练数据来源,该模型是由Stability AI于2022年发布的Diffusion model,同时它也支持了OpenCLIP,这是OpenAI原始CLIP模型的一个开放复现版本,广泛用于图像-文本Embedding以及下游生成流程中的引导,包括围绕ControlNet和其他条件化技术构建的工具。
CSAM的发现与清理
2023年12月,斯坦福互联网观察站的研究人员发布了一份审计报告,发现LAION-5B中包含少量但非零的儿童性虐待材料链接,这些链接通过与已知非法图像数据库的哈希匹配被识别出来。由于LAION仅分发URL和元数据,而非托管图像本身,因此数据集并未直接存储非法内容,但这一发现意味着,在完整数据集上训练的模型,包括广泛使用的Stable Diffusion检查点,可能在训练过程中受到了有问题材料的影响。LAION在报告发布后立即将数据集从公开分发中移除,并与互联网观察基金会及斯坦福研究人员合作,过滤掉违规链接,然后重新发布了清理后的版本。这一事件成为讨论AI ethics和AI governance时广泛引用的案例研究,涉及通过自动化大规模网络抓取组装训练数据而缺乏充分内容审核所带来的风险。
更广泛的影响
尽管存在争议,LAION的数据集仍然是开放生成式AI研究的基础设施,该组织继续发布额外资源,包括音频和多语言数据集,与EleutherAI等团体一起,将自己定位为更广泛开放数据运动的一部分,旨在让前沿相关研究在少数资源充足的公司之外保持可及性。CSAM事件促使整个行业就数据集审计标准展开更广泛的对话,并增加了对生成式AI行业中使用网络抓取训练语料的审查力度。