IMDB-WIKI는 영화 데이터베이스(IMDB)와 위키백과에서 수집한 523,051개의 얼굴 이미지를 포함하는 대규모 얼굴 나이 및 성별 추정 데이터셋이다. 각 이미지는 영화 개봉일이나 전기 정보와 같은 관련 메타데이터에서 파생된 성별 라벨과 나이 값으로 주석이 달려 있다. 이 데이터셋은 2015년 취리히 연방 공과대학교(ETH Zurich)의 연구자 라스무스 로테(Rasmus Rothe), 라두 티모프테(Radu Timofte), 룩 반 굴(Luc Van Gool)이 소개했으며, 인구통계 속성 인식에서 컴퓨터 비전 모델을 평가하는 표준 벤치마크가 되었다.
이 데이터셋은 유명인 사진과 전기 초상화에서 이미지를 가져왔기 때문에 규모와 실제 세계의 다양성으로 유명하다. 그러나 나이 라벨은 이미지 촬영 날짜와 대상의 출생 날짜 간의 차이로 추정되기 때문에 노이즈가 많으며, 오래된 사진이나 촬영 날짜를 알 수 없는 경우에는 부정확할 수 있다. 그럼에도 불구하고 IMDB-WIKI는 나이 추정을 위한 딥러닝 접근법을 발전시키는 데 중요한 역할을 했으며, 더 깨끗한 데이터셋에서 미세 조정하기 전에 사전 훈련 코퍼스로 자주 사용된다.
구축 및 주석
IMDB-WIKI 데이터셋은 IMDB와 위키백과에서 이미지를 자동으로 크롤링하여 구축되었다. IMDB의 경우 이미지는 배우와 여배우와 연결되었고, 나이는 영화 개봉 연도와 배우의 출생 연도 간의 차이로 계산되었다. 위키백과의 경우 이미지는 전기 페이지와 연결되었고, 나이는 페이지의 마지막 수정 날짜 또는 대상의 출생 날짜에서 파생되었다. 성별은 대상의 알려진 성별에 따라 할당되었다. 최종 데이터셋에는 IMDB의 460,723개 이미지와 위키백과의 62,328개 이미지가 포함되어 총 523,051개 이미지가 된다. 얼굴은 얼굴 감지기를 사용하여 감지되었고, 각 이미지는 얼굴 영역으로 잘렸지만 일부 잘린 이미지에는 오류나 여러 얼굴이 포함되어 있다.
딥러닝에서의 사용
IMDB-WIKI는 나이 및 성별 분류 작업에서 Deep learning 커뮤니티에서 neural networks를 훈련하고 평가하는 데 널리 사용된다. residual networks 및 기타 합성곱 아키텍처를 기반으로 하는 많은 최첨단 모델이 IMDB-WIKI에서 사전 훈련되었다. 데이터셋의 대규모는 모델이 얼굴 외모에 대한 강력한 특징을 학습하는 데 도움이 되지만, 라벨 노이즈는 종종 강건한 손실 함수나 데이터 정리 전략을 필요로 한다. 연구자들은 또한 IMDB-WIKI를 사용하여 나이 추정 오류, 도메인 이동, 인구통계 그룹 간 공정성의 영향을 연구했다.
벤치마크 및 평가
IMDB-WIKI는 평균 절대 오차(MAE) 및 누적 점수와 같은 지표로 나이 추정 벤치마크로 일반적으로 사용된다. 데이터셋은 훈련 및 테스트 세트로 분할되지만, 공식 분할은 연구마다 항상 일관되지는 않다. 많은 논문은 Adience 또는 UTKFace와 같은 더 깨끗한 데이터셋에서 미세 조정한 후 IMDB-WIKI 테스트 세트에 대한 결과를 보고한다. 노이즈 라벨은 도전적인 벤치마크를 만들며, IMDB-WIKI에서 낮은 MAE를 달성하는 모델은 종종 다른 나이 추정 작업에 잘 일반화된다. IMDB-WIKI에 대한 성별 분류 정확도도 보고되며, 현대 모델의 경우 일반적으로 95%를 초과한다.
한계 및 윤리적 고려 사항
데이터셋에는 여러 한계가 있다. 나이 라벨은 노이즈가 많고 일반 인구와 다른 전문 사진이나 화장을 가질 수 있는 유명인에게 편향되어 있다. 성별 라벨은 이진적이며 비이진 정체성을 고려하지 않는다. 또한 데이터셋은 개인의 명시적 동의 없이 수집되어 개인정보 보호 문제를 제기한다. IMDB-WIKI를 사용하는 연구자는 이러한 문제를 인식하고 감시나 인구통계 프로파일링과 같은 민감한 응용 프로그램에서 이를 기반으로 훈련된 모델을 배포하는 윤리적 영향을 고려해야 한다. 데이터셋은 연구 목적으로 제공되지만, 상업 제품에서의 사용은 추가 검토가 필요할 수 있다.
관련 데이터셋 및 영향
IMDB-WIKI는 노이즈 라벨을 필터링하는 IMDB-Clean 및 Wiki-Clean 버전과 같은 여러 후속 데이터셋에 영감을 주었으며, 더 정확한 연령 그룹을 가지지만 이미지 수가 적은 Adience 데이터셋과 자주 비교된다. 데이터셋은 또한 나이 추정 정확도를 개선하기 위한 Data Augmentation 및 Curriculum Learning 연구에 사용되었다. 그 영향은 컴퓨터 비전을 넘어 얼굴 분석의 공정성과 편향에 대한 Artificial intelligence 연구에도 사용되었다. 데이터셋은 알려진 한계에도 불구하고 인구통계 속성 인식 연구자에게 핵심 자원으로 남아 있다.
같이 보기
- Machine learning
- Computer vision
- facial-recognition
참고 문헌
- Rothe, R., Timofte, R., & Van Gool, L. (2015). DEX: Deep EXpectation of apparent age from a single image. In Proceedings of the IEEE International Conference on Computer Vision Workshops.
- Rothe, R., Timofte, R., & Van Gool, L. (2016). Deep expectation of real and apparent age from a single image without facial landmarks. International Journal of Computer Vision.