英語からの翻訳

ImageNet-1Kは、ImageNetデータベースの標準化されたサブセットであり、2010年以降、ImageNet Large Scale Visual Recognition Challenge(ILSVRC)で使用されている1,000のオブジェクトカテゴリを含んでいます。これは、深層学習の画像分類モデルのベンチマークとなりました。

ImageNet-1Kは、ImageNet視覚データベースの標準化されたサブセットであり、正確に1,000の重複しないオブジェクトクラスを含んでいる。これは、2010年に開始されたImageNet Large Scale Visual Recognition Challenge(ILSVRC)の分類および位置特定ベンチマークとして導入された。このサブセットは、2万以上のカテゴリにわたる1,400万以上の手動注釈付き画像を保持するより大規模なImageNetデータセットから、可算名詞であり視覚的に明確なクラスの厳選リストを選択して派生した。ImageNet-1Kは機械学習深層学習における重要な参照点となり、2010年代のニューラルネットワークアーキテクチャとトレーニング技術の進歩の主要なテストベッドとして機能した。

データセットの画像は第三者URLから取得され、ImageNet自体が所有しているわけではない。各画像には、WordNet語彙データベースのsynsetに対応するWordNet ID(wnid)として知られる、正確に1つのクラス識別子がラベル付けされている。カテゴリは、動物や植物から乗り物や家庭用品まで、幅広い日常オブジェクトに及び、微妙な識別をテストするための120の細粒度犬種クラスを含む。ImageNet-1Kの画像はRGB形式で解像度が異なり、通常はモデルに入力される前に固定サイズに前処理され、正規化される。

歴史と作成

AI研究者のFei-Fei Liは2006年にImageNetプロジェクトを構想し、AI研究の焦点をアルゴリズムから大規模データへと移行することを目指した。2007年、彼女はWordNetの作成者であるプリンストン大学教授Christiane Fellbaumと会い、WordNetの名詞階層をバックボーンとしてデータセットを構築することを決定した。プロジェクトは2008年7月にAmazon Mechanical Turkを使用してラベル付けを開始し、167か国からの49,000人のワーカーが1億6,000万以上の候補画像をフィルタリングした。ラベル付けは2010年4月に終了し、1,400万の各画像が3回検証された。

当初の計画では、各10,000画像を持つ40,000カテゴリを想定していたが、人間の分類速度が毎秒約2画像であるなどの実用的な制約により、範囲が縮小された。最初の公開発表は、2009年にフロリダで開催されたConference on Computer Vision and Pattern Recognition(CVPR)でのポスターであった。2009年、Alex Bergがオブジェクト位置特定の追加を提案し、PASCAL Visual Object Classesコンテストとのコラボレーションにつながり、2010年に1,000クラスでILSVRCが開始された。

深層学習における役割

ImageNet-1Kは、2012年9月30日に、AlexNetと呼ばれる畳み込みニューラルネットワークがImageNet 2012チャレンジでトップ5エラー15.3%を達成し、2位より10.8パーセントポイント以上優れたことで注目を集めた。この成功は、グラフィックス処理ユニット(GPU)でのトレーニングによって可能になり、深層学習革命の重要な要素となった。この結果は、The Economistが指摘したように、テクノロジー業界全体で注目を集めた。

その後の年には急速な進歩が見られた。2015年、Microsoftの100層を超える非常に深いCNNが、3.57%のエラー率でImageNet 2015コンテストで優勝した。人間のパフォーマンスは、2014年にAndrej Karpathyによって、集中した努力で約5.1%、最大の努力で潜在的に2.4%と推定され、モデルがこのベンチマークで人間レベルの分類にすぐに近づくか超えたことを示した。ImageNet-1Kは、残差ネットワークアーキテクチャ、バッチ正規化データ拡張技術などの革新の標準評価セットとなった。

データセット構造

ImageNet-1Kカテゴリは、80,000以上の名詞synsetを含むWordNet 3.0からフィルタリングされている。選択プロセスでは、完全なImageNet用に21,841のsynsetが保持され、1,000クラスのサブセットがILSVRC用に選択された。各synsetには、「dog、domestic dog、Canis familiaris」の「n02084071」などの一意のwnidがある。カテゴリは、「哺乳類」のような広い概念から「ジャーマンシェパード」のような特定の品種まで、9レベルの階層に編成されている。

画像は、Google、Picsearch、MSN、Yahoo、Flickrなどのオンライン検索エンジンから、複数言語の同義語を使用してスクレイピングされた。例えば、ジャーマンシェパードカテゴリでは、「Alsatian」や「pastore tedesco」などのクエリが使用された。解像度は、魚カテゴリの4288 x 2848から75 x 56ピクセルまで大きく異なる。実際には、画像は一定の解像度にリサイズされ、ホワイトニングされる。例えば、PyTorchはピクセル値を[0,1]に分割し、平均[0.485、0.456、0.406]を減算し、標準偏差[0.229、0.224、0.225]で除算して正規化する。

注釈と使用法

各ImageNet-1K画像には、単一のクラスラベルが付いている。完全なImageNetは、約3,000の人気synsetにわたる約100万画像のバウンディングボックス注釈も提供し、オブジェクト位置特定タスクを可能にする。Dense SIFT特徴は、視覚的単語の袋アプローチ用に設計された1,000クラスのサブセット用にリリースされたが、深層学習の台頭により一般的ではなくなった。

2010年の要約時点で、ImageNetには21,841の非空synset、14,197,122の画像、および1,034,908のバウンディングボックス付き画像があった。データセットの注釈は自由に利用可能であるが、画像自体はImageNetが所有していない。ImageNet-1Kは、より大規模なデータセットや代替ベンチマークの出現にもかかわらず、人工知能における事前トレーニングとベンチマークに広く使用され続けている。

遺産と影響

ImageNet-1KでのAlexNetの成功は深層学習ブームを触発し、自然言語処理大規模言語モデルの開発を含むコンピュータビジョン以外の分野に影響を与えた。ベンチマークの明確な指標と大規模さは、モデルアーキテクチャ、トレーニング方法、ハードウェア効率を比較するための標準となった。しかし、注釈ノイズやデータセットの静的な性質に関する懸念から批判が生じ、一部の研究者は新しいベンチマークを提案している。それでも、ImageNet-1Kは機械学習の研究と教育における基礎的なリソースであり続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·deep-learning·benchmark
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴