영어에서 번역됨

CASIA-WebFace는 10,575명의 대상에 대한 494,414개의 이미지를 포함하는 대규모 얼굴 인식 데이터셋으로, 딥러닝 기반 얼굴 검증 시스템의 훈련 및 평가에 널리 사용됩니다.

CASIA-WebFace는 2014년 중국과학원 자동화연구소의 연구자들이 도입한 대규모 얼굴 인식 데이터셋이다. 이 데이터셋은 웹에서 수집된 10,575명의 서로 다른 개체에 대한 494,414개의 얼굴 이미지를 포함한다. 이 데이터셋은 특히 상당한 양의 레이블된 데이터를 요구하는 딥러닝 접근법을 위한 얼굴 인식 모델의 공개적으로 이용 가능한 대규모 훈련 자원에 대한 필요성을 해결하기 위해 만들어졌다. 이는 컴퓨터 비전 분야, 특히 얼굴 검증 및 식별과 같은 작업에서 표준 벤치마크가 되었다.

이 데이터셋은 Dong Yi, Zhen Lei, Shengcai Liao, Stan Z. Li에 의해 개발되었으며, MegaFace 챌린지의 훈련 세트와 같은 더 큰 독점 데이터셋에 대한 무료 대안으로 공개되었다. 각 이미지는 일반적으로 표준 포즈에 정렬된 잘린 얼굴이며, 조명, 표정, 가림에 변화가 있다. 개체는 다양한 연령, 민족, 배경을 포함하여 다양하므로, 이 데이터셋은 다양한 인구 집단에 걸쳐 일반화되는 모델을 훈련하는 데 적합하다. CASIA-WebFace는 학술 연구에서 널리 사용되었으며 얼굴 인식 정확도의 상당한 발전에 기여했다.

구축 및 주석

CASIA-WebFace의 이미지는 검색 엔진을 사용하여 웹에서 자동으로 수집된 후 반자동 파이프라인을 통해 필터링되었다. 이 과정은 얼굴 감지, 클러스터링, 수동 검증을 포함하여 각 개체가 일관된 이미지를 포함하도록 보장했다. 최종 데이터셋에는 10,575명의 대상이 포함되며, 대상당 평균 약 47개의 이미지가 있다. 이미지는 JPEG 형식으로 저장되며 대상 ID를 나타내는 메타데이터가 함께 제공된다. 데이터셋에는 경계 상자나 랜드마크가 포함되지 않으며, 얼굴은 이미 250x250 픽셀의 표준 크기로 잘리고 정렬되어 있다.

얼굴 인식 연구에 미치는 영향

CASIA-WebFace는 현대 얼굴 인식 시스템의 개발에 중요한 역할을 했다. 공개되기 전에는 많은 연구자들이 평가를 위해 Labeled Faces in the Wild (LFW)와 같은 더 작은 데이터셋에 의존했지만, 깊은 신경망을 훈련하려면 더 큰 데이터셋이 필요했다. CASIA-WebFace는 합성곱 신경망(CNN)을 효과적으로 훈련하기에 충분한 데이터 양을 제공했다. 이는 FaceNet, SphereFace, CosFace와 같은 모델을 훈련하는 데 사용되었으며, 이 모델들은 LFW 및 다른 벤치마크에서 최첨단 성능을 달성했다. 이 데이터셋은 또한 트리플렛 손실 및 각도 마진 손실과 같은 손실 함수의 탐구를 가능하게 하여 개체 간의 구별을 개선했다.

한계 및 윤리적 고려 사항

유용성에도 불구하고 CASIA-WebFace에는 한계가 있다. 이미지는 묘사된 개인의 명시적 동의 없이 공개 웹 소스에서 수집되어 개인 정보 보호 및 윤리적 우려를 제기한다. 데이터셋은 인구 통계적 대표성 측면에서 편향을 포함할 수 있으며, 웹 스크래핑 과정이 특정 민족이나 연령대를 과도하게 대표할 수 있다. 또한 자동 필터링은 일부 이미지가 개체에 잘못 할당되는 레이블 노이즈를 도입할 수 있다. 연구자들은 이러한 문제를 지적하고 더 윤리적으로 출처가 명확한 데이터셋을 요구해 왔다. 이에 대응하여 일부 최신 데이터셋은 명시적 동의 또는 합성 데이터 생성을 통해 만들어졌다.

딥러닝 모델에서의 사용

CASIA-WebFace는 얼굴 인식의 딥러닝 모델을 위한 훈련 세트로 일반적으로 사용된다. 일반적인 파이프라인은 이미지 전처리(예: 정규화, 데이터 증강)를 포함한 후, 개체 확률을 출력하는 분류 계층을 가진 CNN을 훈련하는 것이다. 훈련 후 분류 계층은 제거되고, 마지막에서 두 번째 계층의 활성화가 얼굴 임베딩으로 사용된다. 이러한 임베딩은 검증 또는 식별 작업에 사용된다. 데이터셋은 또한 전이 학습에 사용되며, CASIA-WebFace에서 사전 훈련된 모델은 더 작은 도메인 특정 데이터셋에 미세 조정된다. 그 크기와 다양성은 제한된 계산 자원을 가진 연구자에게 실용적인 선택이 되며, 단일 GPU에서 며칠 내에 처리할 수 있다.

유산 및 대안

공개 이후 CASIA-WebFace는 MS-Celeb-1M, VGGFace2, WebFace260M과 같은 더 큰 데이터셋으로 대체되었다. 그러나 이는 여전히 벤치마킹과 관리 가능한 데이터셋 크기를 요구하는 연구자들에게 인기 있는 선택으로 남아 있다. 데이터셋은 또한 대회와 많은 논문의 기준선으로 사용되었다. 그 영향은 얼굴 인식을 넘어 일반 컴퓨터 비전 연구로 확장되며, 대규모 데이터 수집 및 주석의 예로 사용된다. 2025년 현재 CASIA-WebFace는 학술 사용을 위해 여전히 접근 가능하지만, 연구자들은 윤리적 영향을 고려하고 가능할 때 더 책임감 있게 출처가 명확한 최신 데이터셋을 사용하도록 권장된다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:face-recognition·dataset·computer-vision·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사