IMDB-WIKI是一个用于面部年龄和性别估计的大规模数据集,包含从互联网电影数据库(IMDB)和维基百科收集的523,051张人脸图像。每张图像都标注了性别标签和从相关元数据(如电影上映日期或传记信息)推导出的年龄值。该数据集由苏黎世联邦理工学院的研究人员Rasmus Rothe、Radu Timofte和Luc Van Gool于2015年提出,并已成为评估计算机视觉模型在人口统计属性识别方面的标准基准。
该数据集以其规模和在真实世界中的多样性而著称,因为图像来源于名人照片和传记肖像。然而,年龄标签存在噪声,因为年龄是根据图像拍摄日期与主体出生日期之间的差值估算的,对于较旧的照片或拍摄日期未知的情况,这种估算可能不准确。尽管如此,IMDB-WIKI在推动年龄估计的深度学习方法方面发挥了重要作用,通常作为在更干净的数据集上进行微调之前的预训练语料库。
构建与标注
IMDB-WIKI数据集是通过自动爬取IMDB和维基百科上的图像构建的。对于IMDB,图像与演员和女演员相关联,年龄计算为电影上映年份与演员出生年份之间的差值。对于维基百科,图像链接到传记页面,年龄根据页面的最后修改日期或主体的出生日期推导。性别根据主体的已知性别进行分配。最终数据集包含来自IMDB的460,723张图像和来自维基百科的62,328张图像,总计523,051张图像。使用人脸检测器检测人脸,并将每张图像裁剪到面部区域,尽管部分裁剪包含错误或多张人脸。
在深度学习中的使用
IMDB-WIKI被广泛用于Deep learning社区,用于训练和评估神经网络在年龄和性别分类任务上的表现。许多最先进的模型,包括基于残差网络和其他卷积架构的模型,都在IMDB-WIKI上进行了预训练。数据集的大规模有助于模型学习面部外观的鲁棒特征,但其标签噪声通常需要鲁棒的损失函数或数据清理策略。研究人员还使用IMDB-WIKI来研究年龄估计误差、域偏移以及不同人口统计群体之间的公平性影响。
基准与评估
IMDB-WIKI通常用作年龄估计的基准,使用平均绝对误差(MAE)和累积分数等指标。数据集被分为训练集和测试集,尽管官方划分在不同研究中并不总是一致。许多论文在更干净的数据集(如Adience或UTKFace)上进行微调后,报告IMDB-WIKI测试集上的结果。噪声标签使其成为一个具有挑战性的基准,在IMDB-WIKI上实现低MAE的模型通常能很好地泛化到其他年龄估计任务。IMDB-WIKI上的性别分类准确率也有报告,现代模型通常超过95%。
局限性与伦理考量
该数据集存在几个局限性。年龄标签存在噪声,并且偏向名人,因为名人可能拥有与普通人群不同的专业照片和化妆。性别标签是二元的,不考虑非二元身份。此外,数据集是在未获得个人明确同意的情况下收集的,引发了隐私问题。使用IMDB-WIKI的研究人员应意识到这些问题,并考虑基于其训练的模型在部署时的伦理影响,尤其是在监控或人口统计画像等敏感应用中。该数据集可供研究使用,但在商业产品中的使用可能需要额外的审查。
相关数据集与影响
IMDB-WIKI启发了多个后续数据集,例如过滤噪声标签的IMDB-Clean和Wiki-Clean版本,并且经常与Adience数据集进行比较,后者具有更准确的年龄组但图像较少。该数据集还被用于研究Data Augmentation和Curriculum Learning以提高年龄估计准确性。其影响超出了计算机视觉领域,因为它已被用于Artificial intelligence中关于面部分析公平性和偏见的研究。尽管存在已知局限性,该数据集仍然是研究人员在人口统计属性识别方面的重要资源。
参见
- Machine learning
- Computer vision
- facial-recognition
参考文献
- Rothe, R., Timofte, R., & Van Gool, L. (2015). DEX: Deep EXpectation of apparent age from a single image. In Proceedings of the IEEE International Conference on Computer Vision Workshops.
- Rothe, R., Timofte, R., & Van Gool, L. (2016). Deep expectation of real and apparent age from a single image without facial landmarks. International Journal of Computer Vision.