ImageNetは、視覚的物体認識ソフトウェア研究での使用を目的として設計された大規模な視覚データベースである。1400万枚以上の手動注釈付き画像と、2万以上のカテゴリ(各カテゴリは通常数百枚の画像で構成)を包含し、少なくとも100万枚の画像にはバウンディングボックス注釈が含まれている。注釈と第三者提供の画像URLのデータベースは無料で利用可能だが、実際の画像はImageNetが所有しているわけではない。2010年以降、このプロジェクトは毎年開催されるソフトウェアコンテスト「ImageNet大規模視覚認識チャレンジ(ILSVRC)」を運営しており、プログラムは1,000個の非重複クラスのリストを使用して物体とシーンを分類および検出するために競う。
このプロジェクトは、AI研究者のフェイフェイ・リーのビジョンに端を発し、彼女は研究の多くがモデルとアルゴリズムに焦点を当てていた時期に、AIアルゴリズムのトレーニングに利用可能なデータを拡大することを目指した。ImageNetは以来、ディープラーニング革命の要となり、計算機視覚の飛躍的な進展を実現し、人工知能の広範な分野に影響を与えた。
歴史
フェイフェイ・リーは2006年からImageNetのアイデアに取り組み始めた。2007年、彼はプリンストン大学教授のクリスティアンにフォンバウムと会い、WordNetの作成者の一人である彼とプロジェクトについて協議した。この会合により、リーはWordNetの約22,000名詞から始め、その多くの機能を活用してImageNetを構築することを決定した。また、1987年の推定によると、平均的な人間は約3万種類の物体を認識できるというアイデアにも触発された。
プリンストン大学で助教授として、リーはプロジェクトに取り組む研究者チームを組織した。彼らはAmazon Mechanical Turkを使用して画像の分類を支援した。ラベル付けは2008年7月に開始し、2010年4月に終了し、167か国から49,000人のワーカーが、1億6千万件以上の候補画像をフィルタリングしてラベル付けを行った。予算の規模から、1400万枚の各画像を3回ラベル付けすることが可能だった。
当初の計画では、40,000カテゴリに各10,000枚ずつ、合計4億枚の画像を、各画像が3回検証されることを目指していた。しかし、人間は1秒間に最大2枚の画像を分類できますが、その速度では、休憩なしで19人の人間年数の労働が必要と推定された。完全な計画は実現されなかった。
データベースは2009年のフロリダで開催されたコンピュータビジョンとパターン認識会議(CVPR)で最初にポスターとして発表され、「ImageNet: A Preview of a Large-scale Hierarchical Dataset」というタイトルであった。このポスターは2009年のVision Sciences Societyでも再利用された。
2009年、アレックス・バーグは物体ローカライゼーションをタスクとして追加することを提案した。リーはPASCAL Visual Object Classesコンテストとの協力にアプローチし、その結果、2010年からImageNet大規模視覚認識チャレンジが開始された。このチャレンジには1000クラスと物体ローカライゼーションが含まれていたが、PASCAL VOCはわずか20クラス、19,737枚の画像しかなかった。
ディープラーニングへの重要性
2012年9月30日、AlexNetと呼ばれる畳み込みニューラルネットワーク(CNN)がImageNet 2012チャレンジで上位5エラー率15.3%を達成し、準優勝よりも10.8ポイントパーセント以上低い率を記録した。トレーニング中にグラフィックプロセッシングユニット(GPU)を使用したことがこれを可能にし、ディープラーニング革命の不可欠な要素である。The Economist誌によれば、「突然、人々はAIコミュニティだけでなく第一エンジストリー全般にも注目し始めた」。
2015年、AlexNetはマイクロソフトの100層を超える非常に深いCNNに上回られ、これはImageNet 2015コンテストでテストセットへのエラー率3.57%を実現した。アンドレイ・カーパシーは2014年に、集中努力でエラー率5.1%に達することが最善で、彼の研究所の約10人が少ない労力で約12〜13%に達したと推定した。最大限の努力をすれば、人間が2.4%を達成できるとも推定されていた。
これらの結果は、ディープラーニングとニューラルネットワークアーキテクチャのパワーを示し、テクノロジー業界全体での機械学習技術の採用が加速された。
データセット
ImageNetは、その注釈プロセスをクラウドソースしている。画像レベルの注釈は、画像内に物体クラスが存在するか否かを示す(例:「この画像にはトラがいます」または「この画像にはトラがありません」)。物体レベルの注釈は、指定されたオブジェクトの可視部分の周囲にバウンディングボックスを提供する。ImageNetは、WordNetの幅広いスキーマの変種を使用してオブジェクトを分類し、加えて犬の品種の120カテゴリを含めて細かい分類を実証している。
2012年、Wikipediaはワールド最大のアカデミック・ユーザーのメカニカル・タークであり、平均ワーカーは1分あたり50枚の画像を特定した。
2010年4月30日付の概要統計:
- 非空のシンセットの総数:21,841
- 画像の総数:14,197,122
- バウンディングボックス注釈付き画像の数:1,034,908
- SIFT機能を持つシンセットの数:1,000
- SIFT機能を持つ画像の数:120万
カテゴリ
ImageNetのカテゴリは、WordNetの概念がフィルタリングされました。各概念は( 「kitty」と「young cat」など複数の類義語を含むことがあるため)「シノニムセット」または「シンセット」と呼ばれる。WordNet 3.0には、 10万以上のシシンセットがあり、その大部分が名目(80,000以上)です。ImageNetデータセットはこれらを、視覚的に検証できる数え名詞である21,841のシンセットに絞りました。
WordNet 3.0の各シンセットには「ワードネットID」(wnid)があります。これは品詞と「オフセット」の連結です。 ImageNetは名詞のみを含むため、すべてのwnIDは「n」で始まります。例えば、シンセット 「犬、家庭犬、イヌ科のイヌ」 のwnIDは「n02084071」です。
ImageNetのカテゴリは、レベル1(「となり骨」)からレベル9(「ジャーマンシェパード・ドッグ」)までの8レベルに分かれています。
画像形式
画像は、複数言語での類義語を使用して、オンライン画像検索エンジン(Google, Picsearch, MSN, Yahoo, Flickr など)から スクレイピングされました。例えば、ジャーマンシェパードの場合、検索用語には「German police dog、”“Alsatian、”“ovejero alemán、”“pastore tedesco、”“德国牧羊犬”が含まれていました。
ImageNetは、RGB形式で解像度の異なる画像で構成されています。例えば、ImageNet 2012 のな「魚」カテゴリには 解像度が 4288 x 2848 から 75 から 56 までの画像があります。機械学習では、これらは通常、標準の一定解像度に前処理され、さらにニューラルネットワークに処理される前に白化処理されます。例えば、PyTorchでは、ImageNetの画像はピクセル値を0〜1に分割し、その後 [0.485, 0.456, 0.406] を計算し、[0.229, 0.224, 0.225] で除算して正規化されます。これらはImageNetの平均と標準偏差であり、入力データを白化します。
ラベルと注釈
各画像には、1つのwnIDが正確にラベル付けされます。ImageNet-1KのDense SIFT機能(生のSIFT記述子、量子化されたコードワード、各記述子/コードワードの座標)は、視覚的赤い言葉の袋のためのダウンロードが可能でした。オブジェクトのバウンディングボックスは約3,000の一般的なシンセットに利用可能で、各シンターセットの平均150枚の画像があります。さらに、一部の画像には属性注釈がありますが、それらの完全な範囲はここでは詳述されていません。
歴史的遺産
ImageNetの創設は、AIにおけるデータ中心のアプローチへの移行を象徴し、後続のデータセットとベンチマークに影響を与えました。毎年恒例のチャレンジは、計算機ビジョンの進歩を測定するための標準ベンチマークとなり、その成功は 生成型AIや他のAIアプリケーションの成長を触媒しました。このデータサイトは、現在でも基幹的データとして、モデルのトレーニングと評価のための土台であり、その影響は自動運転や医療画像などの分野にも広がっています。
その成果に加えて、ImageNetはバイアスと注釈品質に関する問題も引き起こし、AIコミュニティでのデータセットのキュレーションと倫理に関する議論を促しました。それでも、その役割は現代のAI開発において疑いの余地がなく、研究と産業で現在も広く使用されています。