MS-Celeb-1Mは、2016年にMicrosoftが発表した大規模な顔認識データセットである。約1000万枚の画像と10万人の著名人が含まれており、各人物には平均して約100枚の画像が存在する。このデータセットは、顔認識の研究を支援するために設計され、特に大規模な識別と検証の課題に対処することを目的としている。深層学習の文脈において、顔認識アルゴリズムを評価するためのベンチマークとして広く使用されてきた。
このデータセットは、検索エンジンを用いてウェブから画像を自動的に収集し、顔検出と位置合わせ技術を適用して顔を抽出することで作成された。人物は著名人に対応しており、多様な姿勢、表情、照明、遮蔽が含まれている。MS-Celeb-1Mにはトレーニング用とテスト用の分割が含まれており、テストセットにはトレーニングセットに存在しない1000人の人物が含まれているため、汎化性能の評価が可能である。
構築とアノテーション
MS-Celeb-1Mの構築には、いくつかのステップが含まれていた。まず、Wikipediaやエンターテインメントデータベースなどのさまざまな情報源から、10万人の著名人の名前のリストが作成された。各名前について、BingやGoogleなどの検索エンジンから画像が取得された。顔検出は商用の顔検出器を使用して実行され、検出された顔は標準的な姿勢に位置合わせされた。その後、画像は正しい人物に対応していることを確認するために手動で検証され、重複や低品質の画像を除去するための最終的なクリーニングステップが実行された。
アノテーションは主に自動化されていたが、データの一部については人間のアノテーターが人物ラベルを検証するために使用された。データセットには、各顔のバウンディングボックスと顔のランドマークが提供されており、顔の位置合わせや切り出しなどのタスクを容易にしている。最終的なデータセットには1000万枚の画像が含まれており、各人物には平均して100枚の画像があるが、分布は長尾であり、一部の人物には他の人物よりもはるかに多くの画像が存在する。
顔認識研究への影響
MS-Celeb-1Mは、顔認識の分野に大きな影響を与えた。これにより、精度が向上した深層学習モデルの開発を可能にする大規模なトレーニングリソースが提供された。リリース前は、顔認識データセットは比較的小規模であり、ニューラルネットワークの容量が制限されていた。MS-Celeb-1Mの規模により、研究者は数百万のパラメータを持つ深層畳み込みニューラルネットワーク(CNN)をトレーニングでき、LFW(Labeled Faces in the Wild)などのベンチマークでの精度の飛躍的な向上につながった。
このデータセットは、ギャラリーサイズが最大100万人の人物に達する可能性がある大規模な顔識別の課題も導入した。これにより、効率的なインデックス作成と検索方法、およびオープンセット認識向けに設計された損失関数に関する研究が促進された。ResNetアーキテクチャやArcFaceなどのマージンベースの損失に基づくものを含む、多くの最先端の顔認識システムがMS-Celeb-1Mでトレーニングまたは評価された。
課題と論争
その成功にもかかわらず、MS-Celeb-1Mは課題と論争に直面してきた。主要な問題の1つはバイアスの存在であり、データセットは主に西洋諸国の著名人で構成されており、他の民族や性別の過小評価につながっている。これにより、過小評価されたグループに対して性能が低い顔認識システムが生じる可能性があり、公平性とバイアスに関する倫理的な懸念が生じている。
もう1つの論争は、プライバシーと同意に関するものである。画像は個人から明示的な同意を得ずにウェブから収集されており、その多くは公人であるが、肖像権を有している。2019年、Microsoftはプライバシーと悪用の可能性に関する懸念を理由に、データセットを公開アクセスから削除した。これにより、AI研究における大規模なウェブスクレイピングデータセットの倫理的な使用に関する議論が生じた。
遺産と代替案
削除されたにもかかわらず、MS-Celeb-1Mは永続的な遺産を残している。MS1MV2やMS1MV3などの多くの派生データセットは、元のデータをクリーニングして再アノテーションすることで作成され、研究で使用され続けている。このデータセットは、VGGFace2やWebFace260Mなどの他の大規模な顔データセットの作成にも影響を与え、これらは多様性や同意など、MS-Celeb-1Mのいくつかの制限に対処することを目的としている。
機械学習のより広い文脈では、MS-Celeb-1Mは深層モデルをトレーニングするための大規模データセットへの傾向を例示している。また、データセット作成における倫理的考慮の重要性も強調しており、このトピックは生成AIおよび深層学習コミュニティの中心となっている。研究者は現在、適切な同意とバランスの取れた表現を持つデータセットを求めることが多く、より倫理的な顔認識ベンチマークを作成するためのいくつかのイニシアチブが開始されている。