CASIA-WebFace是一个大规模人脸识别数据集,由中国科学院自动化研究所的研究人员于2014年提出。该数据集包含从网络收集的494,414张人脸图像,涵盖10,575个不同身份。该数据集的创建旨在满足公开可用的大规模训练资源需求,用于人脸识别模型,特别是需要大量标注数据的深度学习方法。它已成为计算机视觉领域的标准基准,尤其是在人脸验证和识别等任务中,并广泛应用于机器学习研究。
该数据集由董易、雷震、廖胜才和李子青开发,作为MegaFace挑战训练集等大型专有数据集的免费替代品发布。每张图像都是裁剪后的人脸,通常对齐到标准姿态,并包含光照、表情和遮挡方面的变化。身份具有多样性,涵盖不同年龄、种族和背景,这使得该数据集适用于训练能够跨人群泛化的模型。CASIA-WebFace已在学术研究中广泛使用,并为面部识别准确性的显著进步做出了贡献。
构建与标注
CASIA-WebFace中的图像通过搜索引擎从网络自动收集,然后使用半自动流程进行过滤。该过程涉及人脸检测、聚类和人工验证,以确保每个身份包含一致的图像。最终数据集包括10,575个对象,每个对象平均约47张图像。图像以JPEG格式存储,并附带指示对象ID的元数据。该数据集不包含边界框或关键点,因为人脸已裁剪并对齐到250x250像素的标准尺寸。
对人脸识别研究的影响
CASIA-WebFace对现代人脸识别系统的发展起到了关键作用。在其发布之前,许多研究人员依赖像Labeled Faces in the Wild(LFW)这样的小型数据集进行评估,但训练深度神经网络需要更大的数据集。CASIA-WebFace提供了足够的数据量,能够有效训练卷积神经网络(CNN)。它已被用于训练FaceNet、SphereFace和CosFace等模型,这些模型在LFW和其他基准上取得了最先进的性能。该数据集还促进了三元组损失和角度间隔损失等损失函数的探索,这些损失函数改善了身份之间的区分能力。
局限性与伦理考量
尽管有其用途,CASIA-WebFace仍存在局限性。图像是从公共网络来源收集的,未获得所描绘个人的明确同意,这引发了隐私和伦理问题。该数据集可能在人口统计代表性方面存在偏差,因为网络抓取过程可能过度代表某些种族或年龄组。此外,自动过滤可能引入标签噪声,其中一些图像被错误地分配到身份。研究人员已注意到这些问题,并呼吁使用更具伦理性的数据集。作为回应,一些较新的数据集已通过明确同意或合成数据生成的方式创建。
在深度学习模型中的使用
CASIA-WebFace通常用作深度学习人脸识别模型的训练集。典型流程包括预处理图像(例如归一化、数据增强),然后训练带有输出身份概率的分类层的CNN。训练后,移除分类层,倒数第二层的激活作为人脸嵌入。这些嵌入随后用于验证或识别任务。该数据集还用于迁移学习,即在CASIA-WebFace上预训练的模型会在较小的领域特定数据集上进行微调。其规模和多样性使其成为计算资源有限的研究人员的实用选择,因为可以在单个GPU上几天内处理完成。
遗产与替代方案
自发布以来,CASIA-WebFace已被MS-Celeb-1M、VGGFace2和WebFace260M等更大数据集所取代。然而,它仍然是基准测试和需要可管理数据集规模的研究人员的流行选择。该数据集也用于竞赛,并作为许多论文的基线。其影响超越了人脸识别,延伸至一般计算机视觉研究,作为大规模数据收集和标注的示例。截至2025年,CASIA-WebFace仍可供学术使用,但鼓励研究人员考虑伦理影响,并在可能的情况下使用更新、更负责任的数据集。