MS-Celeb-1M是微软于2016年推出的大规模人脸识别数据集。它包含约1000万张来自10万位名人的图像,每个身份约有100张图像。该数据集旨在支持人脸识别研究,特别是解决大规模识别和验证的挑战。它已被广泛用作评估人脸识别算法的基准,尤其是在深度学习的背景下。
该数据集通过使用搜索引擎自动从网络收集图像,然后应用人脸检测和对齐技术来提取人脸。身份对应名人,提供了姿态、表情、光照和遮挡的多样化集合。MS-Celeb-1M包含训练集和测试集,测试集包含1000个不在训练集中出现的身份,从而能够评估泛化能力。
构建与标注
MS-Celeb-1M的构建涉及多个步骤。首先,从包括维基百科和娱乐数据库在内的各种来源编制了10万个名人姓名的列表。对于每个姓名,从Bing和Google等搜索引擎检索图像。使用商用的人脸检测器进行人脸检测,并将检测到的人脸对齐到规范姿态。然后人工验证图像以确保它们对应正确的身份,最后进行清理步骤以移除重复和低质量的图像。
标注主要是自动化的,但人工标注者被用于验证数据子集的身份标签。该数据集为每张人脸提供了边界框和面部关键点,便于进行人脸对齐和裁剪等任务。最终数据集包含1000万张图像,每个身份平均有100张图像,但分布呈长尾状,某些身份的图像数量远多于其他身份。
对人脸识别研究的影响
MS-Celeb-1M对人脸识别领域产生了重大影响。它提供了大规模的训练资源,使得开发具有更高准确率的深度学习模型成为可能。在其发布之前,人脸识别数据集相对较小,限制了神经网络的容量。MS-Celeb-1M的规模使研究人员能够训练具有数百万参数的深度卷积神经网络(CNN),从而在LFW(野外标注人脸)等基准上取得了准确率的突破。
该数据集还引入了大规模人脸识别的挑战,其中库的大小可达到一百万身份。这推动了高效索引和检索方法的研究,以及为开放集识别设计的损失函数。许多最先进的人脸识别系统,包括基于ResNet架构和基于边距的损失(如ArcFace)的系统,都在MS-Celeb-1M上进行了训练或评估。
挑战与争议
尽管取得了成功,MS-Celeb-1M仍面临挑战和争议。一个主要问题是存在偏见,因为该数据集主要由西方国家的名人组成,导致其他种族和性别的代表性不足。这可能导致人脸识别系统在代表性不足的群体上表现不佳,引发关于公平性和偏见的伦理担忧。
另一个争议涉及隐私和同意。这些图像是在未经个人明确同意的情况下从网络抓取的,其中许多人虽然是公众人物,但仍对其肖像拥有权利。2019年,微软将数据集从公共访问中移除,理由是担心隐私和潜在的滥用风险。这引发了关于在AI研究中使用大规模网络抓取数据集的伦理讨论。
遗产与替代方案
尽管已被移除,MS-Celeb-1M仍留下了持久的遗产。许多衍生数据集,如MS1MV2和MS1MV3,是通过清理和重新标注原始数据创建的,并且这些数据集继续在研究中使用。该数据集还启发了其他大规模人脸数据集的创建,如VGGFace2和WebFace260M,这些数据集旨在解决MS-Celeb-1M的一些局限性,包括多样性和同意问题。
在机器学习的更广泛背景下,MS-Celeb-1M体现了使用大规模数据集训练深度模型的趋势。它还强调了数据集创建中伦理考虑的重要性,这一主题已成为生成式AI和深度学习社区的核心。研究人员现在通常寻求具有适当同意和平衡代表性的数据集,并且已经启动了多项举措来创建更符合伦理的人脸识别基准。