英語からの翻訳

ImageNet-21Kは、21,000以上の視覚カテゴリ(synset)と1,400万枚の手動アノテーション付き画像を含む完全なImageNetデータセットであり、機械学習における視覚物体認識モデルの訓練と評価に使用される。

ImageNet-21Kは、視覚的物体認識ソフトウェアの研究用に設計された大規模な視覚データベースである完全なImageNetデータセットを指す。これは、WordNet語彙データベースに由来するsynsetとして知られる21,000以上のカテゴリに整理された、1,400万枚以上の手動注釈付き画像を含む。データセットは第三者画像URLの注釈として自由に利用可能であるが、実際の画像はImageNetが所有していない。2010年以降、ImageNetは毎年恒例のコンテストであるImageNet Large Scale Visual Recognition Challenge(ILSVRC)を主催しており、これは一般にImageNet-1Kと呼ばれる1,000の重複しないクラスのトリミングされたサブセットを使用する。

歴史

AI研究者のFei-Fei Liは、AIアルゴリズムのトレーニングに利用可能なデータを拡大することを目的として、2006年にImageNetのアイデアの開発を開始した。2007年、彼女はWordNetの作成者であるプリンストン大学の教授Christiane Fellbaumと出会い、その後、WordNetの約22,000の名詞からImageNetを構築した。Liはまた、平均的な人間が約30,000種類の物体を認識するという1987年の推定にも触発された。

プリンストン大学の助教授として、Liはチームを編成し、画像分類にAmazon Mechanical Turkを使用した。ラベル付けは2008年7月に開始され、2010年4月に終了し、167か国からの49,000人のワーカーが1億6,000万以上の候補画像をフィルタリングおよびラベル付けした。1,400万枚の各画像は3回ラベル付けされた。当初の計画では、40,000カテゴリにわたってカテゴリあたり10,000枚の画像、合計4億枚の画像が必要であったが、これは達成されなかった。最初の公開プレゼンテーションは、2009年にフロリダで開催されたConference on Computer Vision and Pattern Recognition(CVPR)でのポスターであった。

2009年、Alex Bergが物体位置特定の追加を提案し、PASCAL Visual Object Classesコンテストとのコラボレーションにつながり、2010年にILSVRCが開始された。これは、PASCAL VOCの20クラスと比較して、1,000クラスと物体位置特定を特徴としていた。

深層学習への重要性

2012年9月30日、AlexNetと呼ばれる畳み込みニューラルネットワーク(CNN)がImageNet 2012チャレンジでトップ5エラー15.3%を達成し、2位より10.8パーセントポイント以上低かった。この成功は、トレーニング中にグラフィックス処理ユニット(GPU)を使用したことによって可能になり、これはDeep learning革命の重要な要因であった。The Economistによると、「突然、人々はAIコミュニティ内だけでなく、テクノロジー業界全体で注目し始めた」。

2015年、AlexNetはマイクロソフトの100層を超える非常に深いCNNによって凌駕され、3.57%のエラー率でImageNet 2015コンテストで優勝した。Andrej Karpathyは2014年に、集中して取り組めば5.1%のエラーに到達できると推定し、彼の研究室の約10人がそれほど努力せずに約12〜13%に到達した。最大限の努力で、人間は2.4%のエラーを達成できると推定された。

データセット

ImageNetはその注釈プロセスをクラウドソーシングしている。画像レベルの注釈はオブジェクトクラスの存在または不在を示し、オブジェクトレベルの注釈は可視オブジェクトの周囲にバウンディングボックスを提供する。データセットはWordNetスキーマの変種を使用し、細かい分類のために120の犬種カテゴリが追加されている。2012年、ImageNetはMechanical Turkの世界最大の学術ユーザーであり、ワーカーは1分あたり平均50枚の画像を識別した。

2010年4月30日現在、データセットには21,841の非空のsynset、14,197,122枚の画像、バウンディングボックス注釈付きの1,034,908枚の画像、およびSIFT特徴を持つ120万枚の画像(1,000 synset用)があった。

カテゴリ

カテゴリはWordNetの概念からフィルタリングされ、それぞれ「synset」(同義語セット)と呼ばれる。WordNet 3.0には100,000以上のsynsetが含まれ、そのほとんどが名詞(80,000以上)であり、ImageNetはこれらを視覚的に説明できる21,841の可算名詞にフィルタリングした。各synsetにはWordNet ID(wnid)があり、名詞のみが含まれるため「n」で始まる。例えば、「dog, domestic dog, Canis familiaris」のwnidは「n02084071」である。カテゴリはレベル1(例:「mammal」)からレベル9(例:「German shepherd」)までの9レベルにわたる。

画像形式

画像は、複数の言語の同義語を使用してオンライン検索エンジン(Google、Picsearch、MSN、Yahoo、Flickr)からスクレイピングされた。これらはRGB形式で、解像度はさまざまである。例えば、2012年版では、「fish」カテゴリは4288 x 2848から75 x 56ピクセルの範囲である。Machine learningでは、画像は通常、一定の解像度に前処理され、ホワイトニングされる。PyTorchでは、ImageNet画像はピクセル値を[0,1]に分割し、[0.485, 0.456, 0.406]を減算し、[0.229, 0.224, 0.225]で除算することによって正規化される。これらはデータセットの平均と標準偏差である。

ラベルと注釈

各画像には正確に1つのwnidがラベル付けされる。高密度SIFT特徴(生の記述子、量子化されたコードワード、および座標)は、bag-of-visual-wordsモデル用に設計されたImageNet-1Kで利用可能である。バウンディングボックスは約3,000の一般的なsynsetで利用可能であり、synsetあたり平均150枚の画像がある。一部の画像には属性注釈もある。

影響と遺産

ImageNet-21Kは、Artificial intelligenceおよびComputer vision研究の進歩に重要な役割を果たしてきた。ILSVRCチャレンジ、特に2012年のAlexNetの結果は、Neural networkおよびDeep learning手法の広範な採用を促進した。データセットの規模と階層構造により、大規模モデルのトレーニングが可能になり、その後のGenerative AIや他の分野の発展に影響を与えた。完全な21Kデータセットは、ベンチマーク用の1Kサブセットほど一般的に使用されていないが、事前トレーニングと細かい分類の研究のための貴重なリソースであり続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·deep-learning·machine-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴