영어에서 번역됨

MS-Celeb-1M은 2016년 마이크로소프트가 대규모 얼굴 인식 연구를 촉진하기 위해 공개한 백만 개의 유명인 이미지를 포함한 대규모 얼굴 인식 데이터셋으로, 얼굴 식별 및 검증 연구를 위한 것이다.

MS-Celeb-1M은 2016년 마이크로소프트가 도입한 대규모 얼굴 인식 데이터셋이다. 약 1천만 개의 이미지와 10만 명의 유명인을 포함하며, 각 개체는 평균 약 100개의 이미지를 가진다. 이 데이터셋은 얼굴 인식 연구를 지원하기 위해 설계되었으며, 특히 대규모 식별 및 검증의 과제를 다룬다. 딥러닝 맥락에서 얼굴 인식 알고리즘을 평가하는 벤치마크로 널리 사용되어 왔다.

이 데이터셋은 검색 엔진을 사용하여 웹에서 이미지를 자동으로 수집한 후, 얼굴 감지 및 정렬 기법을 적용하여 얼굴을 추출하는 방식으로 생성되었다. 개체는 유명인에 해당하며, 다양한 포즈, 표정, 조명, 가림을 제공한다. MS-Celeb-1M은 훈련 및 테스트 분할을 모두 포함하며, 테스트 세트는 훈련 세트에 없는 1,000개의 개체를 포함하여 일반화 평가를 가능하게 한다.

구축 및 주석

MS-Celeb-1M의 구축은 여러 단계를 거쳤다. 먼저, 위키백과 및 엔터테인먼트 데이터베이스를 포함한 다양한 출처에서 10만 명의 유명인 이름 목록을 편집했다. 각 이름에 대해 빙(Bing) 및 구글(Google)과 같은 검색 엔진에서 이미지를 검색했다. 상용 얼굴 감지기를 사용하여 얼굴 감지를 수행하고, 감지된 얼굴을 표준 포즈로 정렬했다. 그런 다음 이미지를 수동으로 검증하여 올바른 개체에 해당하는지 확인했으며, 중복 및 저품질 이미지를 제거하는 최종 정리 단계를 거쳤다.

주석은 주로 자동화되었지만, 데이터의 하위 집합에 대해 개체 레이블을 검증하기 위해 인간 주석자가 사용되었다. 데이터셋은 각 얼굴에 대한 경계 상자와 얼굴 랜드마크를 제공하여 얼굴 정렬 및 크롭과 같은 작업을 용이하게 한다. 최종 데이터셋은 1천만 개의 이미지를 포함하며, 각 개체는 평균 100개의 이미지를 가지지만, 일부 개체는 다른 개체보다 훨씬 많은 이미지를 가지는 긴 꼬리 분포를 보인다.

얼굴 인식 연구에 미친 영향

MS-Celeb-1M은 얼굴 인식 분야에 상당한 영향을 미쳤다. 이는 개선된 정확도를 가진 딥러닝 모델 개발을 가능하게 하는 대규모 훈련 자원을 제공했다. 출시 이전에는 얼굴 인식 데이터셋이 상대적으로 작아 신경망의 용량을 제한했다. MS-Celeb-1M의 규모는 연구자들이 수백만 개의 매개변수를 가진 심층 합성곱 신경망(CNN)을 훈련할 수 있게 하여, LFW(Labeled Faces in the Wild)와 같은 벤치마크에서 정확도의 획기적인 발전을 이끌었다.

이 데이터셋은 또한 갤러리 크기가 최대 1백만 개체에 달할 수 있는 대규모 얼굴 식별의 과제를 도입했다. 이는 효율적인 인덱싱 및 검색 방법, 그리고 개방 집합 인식을 위한 손실 함수에 대한 연구를 촉진했다. ResNet 아키텍처와 마진 기반 손실 (예: ArcFace)을 기반으로 한 많은 최첨단 얼굴 인식 시스템이 MS-Celeb-1M에서 훈련되거나 평가되었다.

과제 및 논란

성공에도 불구하고, MS-Celeb-1M은 과제와 논란에 직면했다. 주요 문제 중 하나는 편향의 존재로, 데이터셋이 주로 서양 국가의 유명인으로 구성되어 다른 민족과 성별의 과소 대표를 초래한다. 이는 과소 대표된 집단에서 성능이 저조한 얼굴 인식 시스템을 초래할 수 있으며, 공정성과 편향에 대한 윤리적 우려를 제기한다.

또 다른 논란은 개인정보 보호와 동의와 관련된다. 이미지는 개인의 명시적 동의 없이 웹에서 수집되었으며, 많은 사람이 공인으로 간주되지만 초상권을 가진다. 2019년, 마이크로소프트는 개인정보 보호 및 오용 가능성에 대한 우려를 이유로 데이터셋을 공개 접근에서 내렸다. 이는 AI 연구에서 대규모 웹 스크래핑 데이터셋의 윤리적 사용에 대한 논의로 이어졌다.

유산 및 대안

제거에도 불구하고, MS-Celeb-1M은 지속적인 유산을 남겼다. MS1MV2 및 MS1MV3와 같은 많은 파생 데이터셋이 원본 데이터를 정리하고 재주석하여 생성되었으며, 이러한 데이터셋은 계속 연구에 사용된다. 이 데이터셋은 또한 VGGFace2 및 WebFace260M과 같은 다른 대규모 얼굴 데이터셋의 생성을 영감을 주었으며, 이는 다양성과 동의를 포함한 MS-Celeb-1M의 일부 한계를 해결하는 것을 목표로 한다.

머신 러닝의 더 넓은 맥락에서, MS-Celeb-1M은 딥 모델 훈련을 위한 대규모 데이터셋의 추세를 예시한다. 또한 데이터셋 생성에서 윤리적 고려 사항의 중요성을 강조하며, 이는 생성 AI딥 러닝 커뮤니티의 중심 주제가 되었다. 연구자들은 이제 적절한 동의와 균형 잡힌 표현을 가진 데이터셋을 종종 찾으며, 더 윤리적인 얼굴 인식 벤치마크를 만들기 위한 여러 이니셔티브가 시작되었다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:face-recognition·dataset·computer-vision·microsoft
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사