ImageNet(データセット)

英語からの翻訳

ImageNetは、視覚物体認識研究に使用される、1400万枚以上の手動注釈付き画像を備えた大規模な階層的視覚データベースであり、毎年開催されるImageNet Large Scale Visual Recognition Challenge(ILSVRC)で最もよく知られている。

ImageNetは、視覚オブジェクト認識ソフトウェアの研究用に設計された大規模な視覚データベースである。このプロジェクトは、画像に写っているオブジェクトを示す1,400万枚以上の手動注釈付き画像を提供し、少なくとも100万枚の画像にはバウンディングボックスも含まれている。20,000以上のカテゴリを包含し、各カテゴリは通常、数百枚の画像を含む。第三者提供の画像URLに対する注釈データベースは自由に利用可能だが、実際の画像はImageNetが所有しているわけではない。2010年以降、このプロジェクトは毎年ソフトウェアコンテストであるImageNet Large Scale Visual Recognition Challenge(ILSVRC)を開催しており、プログラムは1,000の重複しないクラスの厳選リストを使用してオブジェクトとシーンの分類および検出を競う。

歴史

AI研究者のFei-Fei Liは、2006年にImageNetのアイデアを開発し始めた。当時、ほとんどのAI研究がモデルとアルゴリズムに焦点を当てていた時期に、LiはAIアルゴリズムのトレーニングに利用可能なデータを拡張し改善することを目指した。2007年、LiはWordNetの作成者の一人であるプリンストン大学教授のChristiane Fellbaumと会い、プロジェクトについて議論した。この会合により、LiはWordNetの約22,000の名詞から始めてImageNetを構築し、その多くの特徴を採用することになった。彼女はまた、平均的な人間が約30,000種類のオブジェクトを認識するという1987年の推定にも触発された。

プリンストン大学の助教授として、Liはプロジェクトに取り組む研究者チームを結成した。彼らは画像の分類を支援するためにAmazon Mechanical Turkを使用した。ラベリングは2008年7月に開始され2010年4月に終了し、167か国からの49,000人のワーカーが1億6,000万枚以上の候補画像をフィルタリングおよびラベリングした。予算により、1,400万枚の画像のそれぞれが3回ラベリングされることが可能だった。当初の計画では、40,000カテゴリにわたって各カテゴリ10,000枚の画像、合計4億枚の画像を各3回検証することになっていた。しかし、人間は最大で毎秒2枚の画像を分類でき、その速度では休息なしで19人年の労働が必要と推定された。

このデータベースは、2009年にフロリダで開催されたコンピュータビジョンおよびパターン認識会議(CVPR)で「ImageNet: A Preview of a Large-scale Hierarchical Dataset」というタイトルのポスターとして初めて発表された。2009年、Alex Bergはオブジェクトローカリゼーションをタスクとして追加することを提案した。Liは2009年にPASCAL Visual Object Classesコンテストに協力を求めたが、その結果、2010年にImageNet Large Scale Visual Recognition Challengeが開始され、PASCAL VOCの20クラスと19,737枚の画像と比較して、1,000クラスとオブジェクトローカリゼーションを特徴とした。

深層学習への重要性

2012年9月30日、AlexNetと呼ばれる畳み込みニューラルネットワーク(CNN)がImageNet 2012チャレンジでトップ5エラー15.3%を達成し、2位より10.8パーセントポイント以上低かった。トレーニング中のグラフィックス処理ユニット(GPU)の使用により、畳み込みニューラルネットワークが実現可能になり、これは深層学習革命の不可欠な要素となった。The Economistによると、「突然、人々はAIコミュニティ内だけでなく、テクノロジー業界全体で注目し始めた」。

2015年、AlexNetは100層以上のMicrosoftの非常に深いCNNによって上回られ、テストセットで3.57%のエラー率でImageNet 2015コンテストに勝利した。Andrej Karpathyは2014年に、集中した努力で5.1%のエラー率に到達できると推定し、彼の研究室の約10人がより少ない努力で約12〜13%に到達した。最大限の努力で、人間は2.4%に到達できると推定された。

データセット

ImageNetはその注釈プロセスをクラウドソーシングしている。画像レベルの注釈は、画像内のオブジェクトクラスの存在または不在を示す(例:「この画像にはトラがいる」または「この画像にはトラがいない」)。オブジェクトレベルの注釈は、示されたオブジェクトの可視部分の周囲にバウンディングボックスを提供する。ImageNetは、細粒度分類を示すために120カテゴリの犬種が追加された、広範なWordNetスキーマの変種を使用してオブジェクトを分類する。

2012年、ImageNetはMechanical Turkの世界最大の学術ユーザーであり、平均的なワーカーは毎分50枚の画像を識別した。完全なImageNetの当初計画では、約50,000のsynsetにわたって約5,000万枚のクリーンで多様なフル解像度の画像があるはずだったが、これは達成されなかった。2010年4月30日時点の概要統計には、21,841の非空のsynset、14,197,122枚の総画像、1,034,908枚のバウンディングボックス注釈付き画像、SIFT特徴を持つ1,000のsynset、およびSIFT特徴を持つ120万枚の画像が含まれていた。

カテゴリ

ImageNetのカテゴリはWordNetの概念からフィルタリングされた。各概念は複数の同義語を含むことができるため(例:「kitty」と「young cat」)、「シノニムセット」または「synset」と呼ばれる。WordNet 3.0には100,000以上のsynsetがあり、その大部分は名詞(80,000以上)である。ImageNetはこれらを、視覚的に説明できる可算名詞である21,841のsynsetにフィルタリングした。WordNet 3.0の各synsetには「WordNet ID」(wnid)があり、これは品詞とオフセットの連結である。ImageNetは名詞のみを含むため、すべてのwnidは「n」で始まる(例:「dog, domestic dog, Canis familiaris」のwnidは「n02084071」)。カテゴリはレベル1(例:「哺乳類」)からレベル9(例:「ジャーマンシェパード」)までの9つのレベルに分類される。

画像形式

画像は、複数の言語の同義語(例:「German shepherd」、「German police dog」、「Alsatian」、「ovejero alemán」、「pastore tedesco」)を使用して、オンライン画像検索エンジン(Google、Picsearch、MSN、Yahoo、Flickrなど)からスクレイピングされた。ImageNetは、解像度が異なるRGB形式の画像で構成されている(例:ImageNet 2012の「魚」カテゴリでは、解像度は4288 x 2848から75 x 56まで)。機械学習では、これらは通常、標準の一定解像度に前処理され、ニューラルネットワークによるさらなる処理の前にホワイトニングされる。たとえば、PyTorchでは、ImageNet画像はピクセル値を0から1の間に分割して正規化し、次に[0.485、0.456、0.406]を減算し、[0.229、0.224、0.225]で除算される。これらはImageNetの平均と標準偏差である。

ラベルと注釈

各画像には正確に1つのwnidがラベル付けされる。ImageNet-1Kの高密度SIFT特徴(生のSIFT記述子、量子化されたコードワード、座標)はダウンロード可能であり、bag-of-visual-wordsモデル用に設計された。バウンディングボックスは約3,000の一般的なsynsetで利用可能であり、各synsetあたり平均150枚の画像があった。さらに、一部の画像には属性注釈があり、このデータセットは機械学習研究、特に人工知能モデルのトレーニングと評価に広く使用されている。

遺産と影響

ImageNetはコンピュータビジョンと人工知能の分野に深遠な影響を与えた。これは、オブジェクト認識と分類の進歩を加速する標準化されたベンチマークを提供した。2012年のAlexNetの成功は深層学習革命を引き起こし、さまざまな領域での深層学習技術の広範な採用につながった。ImageNetの階層構造と大規模さは、他のデータセットの開発や、後に生成AI大規模言語モデルの基盤となったトランスフォーマーベースのモデルの設計にも影響を与えた。このデータセットは視覚認識システムのトレーニングと評価のための重要なリソースであり続け、その遺産はAI研究と応用を形成し続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·deep-learning·image-recognition
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴