VGGFace2는 옥스퍼드 대학교의 Visual Geometry Group에서 개발한 대규모 얼굴 인식 데이터셋이다. 이 데이터셋은 9,000명 이상의 개인에 대한 331만 개 이상의 이미지를 포함하며, 얼굴 인식 작업에서 딥 뉴럴 네트워크를 훈련하고 평가하는 데 가장 널리 사용되는 벤치마크 중 하나이다. 이 데이터셋은 2017년에 소개되었으며, 이후 컴퓨터 비전 및 딥 러닝 분야에서 표준 자원이 되었다.
이 데이터셋은 LFW 및 MegaFace와 같은 초기 얼굴 데이터셋의 한계를 해결하기 위해 만들어졌으며, 포즈, 나이, 조명, 민족성의 변화를 포함하는 더 크고 다양한 이미지 세트를 제공한다. VGGFace2 이미지는 Google 이미지 검색에서 수집되었으며 유명인 얼굴에 국한되지 않아 개인의 다양성이 증가한다. 각 개인은 평균 362개의 이미지를 가지며, 사람당 최소 80개에서 최대 843개의 이미지를 포함한다.
데이터 수집 및 주석
수집 과정은 자동화된 웹 스크래핑과 수동 필터링을 결합하여 정확성을 보장한다. 데이터셋에는 훈련 및 테스트 분할이 모두 포함되며, 테스트 세트에는 훈련 세트에 없는 500명의 개인이 포함된다. 주석에는 개인 식별 레이블, 얼굴 경계 상자, 주요 얼굴 랜드마크가 포함된다. 데이터셋은 연구 전용 라이선스로 공개되었으며, 사용에는 상업적 재배포를 금지하는 조건에 동의해야 한다.
아키텍처 및 훈련 사용
VGGFace2는 주로 얼굴 인식을 위한 합성곱 신경망(CNN)을 훈련하는 데 사용된다. 기준 모델은 종종 VGGFace2 네트워크라고 불리며, ResNet-50 또는 ResNet-50 유사 아키텍처를 가진 깊은 CNN으로, 큰 마진을 가진 소프트맥스 손실을 사용하여 훈련된다. 훈련 과정은 일반적으로 무작위 잘라내기, 수평 뒤집기, 색상 지터링과 같은 데이터 증강 기법을 사용하여 일반화를 개선한다. 이 데이터셋은 MegaFace 챌린지 및 IJB-C 프로토콜과 같은 벤치마크에서 최첨단 결과를 달성하는 데 중요한 역할을 했다.
얼굴 인식 연구에 미친 영향
VGGFace2는 다양한 인구 통계에 걸쳐 높은 정확도를 가진 모델 훈련을 가능하게 하는 대규모의 다양한 데이터셋을 제공함으로써 얼굴 인식 분야를 크게 발전시켰다. 이 데이터셋은 Google DeepMind 및 Samsung Research와 같은 회사를 포함한 수많은 연구 논문과 상용 시스템에서 사용되었다. 데이터셋의 설계는 MS-Celeb-1M 및 WebFace260M과 같은 후속 데이터셋에 영향을 주었으며, 이들은 개인 및 이미지 수를 더욱 확장하는 것을 목표로 한다.
한계 및 윤리적 고려 사항
유용성에도 불구하고 VGGFace2에는 한계가 있다. 이미지는 개인의 명시적 동의 없이 웹에서 수집되어 개인 정보 보호 문제를 제기한다. 데이터셋은 또한 편향을 나타내며, 개인의 분포가 전 세계 인구 통계를 완전히 대표하지 않을 수 있어 다양한 민족 그룹 간의 성능 차이를 초래할 수 있다. 연구자들은 더 윤리적으로 출처가 명확한 데이터셋과 편향을 완화하기 위한 얼굴 인식 시스템의 신중한 평가를 요구해 왔다.
관련 작업 및 확장
Visual Geometry Group은 또한 더 초기이자 더 작은 데이터셋인 VGGFace를 공개했으며, 두 데이터셋 모두에 대해 사전 훈련된 모델을 제공했다. VGGFace2의 확장에는 이미지의 고해상도 버전을 포함하는 VGGFace2-HQ 데이터셋이 있다. 이 데이터셋은 종종 잔차 네트워크 아키텍처 및 배치 정규화 기법과 같은 다른 자원과 함께 사용되어 훈련 안정성과 성능을 개선한다.