英語からの翻訳

ImageNetは、フェイフェイ・リーとその同僚たちによって作成された大規模な視覚データベースであり、1400万枚以上の注釈付き画像を含み、視覚オブジェクト認識アルゴリズムの訓練と評価に使用される。2009年に開始され、2012年のAlexNetの成功後、深層学習革命の中心となった。

ImageNetは、視覚物体認識ソフトウェアの研究を目的として設計された大規模な視覚データベースである。このプロジェクトは、画像に写っている物体を示す手動アノテーションが施された1400万枚以上の画像で構成され、少なくとも100万枚の画像にはバウンディングボックスも提供されている。2万以上のカテゴリを含み、各カテゴリは通常、数百枚の画像で構成される。第三者提供の画像URLとそのアノテーションからなるデータベースは無料で公開されているが、実際の画像自体はImageNetが所有するものではない。2010年以降、ImageNetは毎年恒例のコンペティションであるImageNet Large Scale Visual Recognition Challenge(ILSVRC)を主催しており、ソフトウェアプログラムが重複しない1000クラスの厳選されたリストを用いて、物体の分類と検出を競う。

このプロジェクトは、AI研究者のFei-Fei Liの構想に端を発する。彼女は2006年にこのアイデアに取り組み始め、AIアルゴリズムのトレーニングに利用できるデータを拡張・改善することを目指した。当時、AI研究の多くはモデルとアルゴリズムに焦点を当てていたが、Liはデータのボトルネックに対処しようとした。2007年、LiはWordNetの作成者であるプリンストン大学教授のChristiane Fellbaumと会い、その後、WordNetの約2万2000の名詞を基盤としてImageNetを構築し、その特徴の多くを取り入れた。Liはまた、平均的な人間が約3万種類の物体を認識するという1987年の推定からも着想を得た。プリンストン大学の助教授として、Liは研究チームを結成し、画像分類の支援にAmazon Mechanical Turkを活用した。ラベル付けは2008年7月に開始され、2010年4月に終了した。167か国からの4万9000人のワーカーが1億6000万枚以上の候補画像をフィルタリングおよびラベル付けし、1400万枚の画像それぞれを3回ラベル付けするのに十分な予算があった。

このデータベースは、2009年にフロリダで開催されたConference on Computer Vision and Pattern Recognition(CVPR)で「ImageNet: A Preview of a Large-scale Hierarchical Dataset」というタイトルのポスターとして初めて発表された。2009年、Alex Bergが物体位置特定をタスクとして追加することを提案し、PASCAL Visual Object Classesコンテストとの協力につながり、2010年にImageNet Large Scale Visual Recognition Challengeが開始された。このチャレンジは1000クラスと物体位置特定を特徴とし、2010年のPASCAL VOCの20クラスと1万9737枚の画像をはるかに上回る規模である。

データセットの構築

ImageNetはそのアノテーションプロセスをクラウドソーシングに依存している。画像レベルのアノテーションは、画像内の物体クラスの有無を示す(例:「この画像にはトラがいる」「この画像にはトラがいない」)。物体レベルのアノテーションは、指定された物体の可視部分の周囲にバウンディングボックスを提供する。ImageNetは、物体を分類するために広範なWordNetスキーマの変種を使用し、さらに細かい分類のために120カテゴリの犬種が追加されている。2012年時点で、ImageNetはMechanical Turkの世界最大の学術利用者であり、平均的なワーカーは1分間に50枚の画像を識別していた。完全なImageNetの当初計画は、約5万のsynsetにわたる約5000万枚のクリーンで多様かつフル解像度の画像だったが、これは達成されなかった。

2010年4月30日時点の概要統計:

  • 非空のsynsetの総数:21,841
  • 画像の総数:14,197,122
  • バウンディングボックスアノテーション付き画像数:1,034,908
  • SIFT特徴量を持つsynset数:1,000
  • SIFT特徴量を持つ画像数:120万枚

カテゴリと画像形式

ImageNetのカテゴリは、WordNetの概念からフィルタリングされたものである。同義語を含む可能性のある各概念は「synonym set」または「synset」と呼ばれる。WordNet 3.0には10万以上のsynset(そのほとんどが名詞、8万以上)があったが、ImageNetは視覚的に図示できる可算名詞のsynsetを2万1841に絞り込んだ。各synsetにはWordNet ID(wnid)があり、これは品詞とオフセットの連結であり、ImageNetは名詞のみを含むため、すべてのwnidは「n」で始まる。例えば、「dog、domestic dog、Canis familiaris」のwnidは「n02084071」である。カテゴリはレベル1(「哺乳類」など)からレベル9(「ジャーマン・シェパード」など)までの9つのレベルにわたる。

画像は、多言語の同義語を使用したオンライン画像検索から収集された。RGB形式で、解像度はさまざまである。例えば、ImageNet 2012の「魚」カテゴリでは、解像度は4288 x 2848から75 x 56まで幅がある。機械学習では、これらの画像は通常、トレーニング前に標準的な一定解像度に前処理され、ホワイトニングされる。例えば、PyTorchでは、画像はピクセル値を0から1の間に収まるように除算し、平均[0.485、0.456、0.406]を減算し、標準偏差[0.229、0.224、0.225]で除算することによって正規化される。これらの統計量はImageNetに由来する。

ラベルとアノテーション

各画像には正確に1つのwnidがラベル付けされる。ImageNet-1K用のDense SIFT特徴量(生のSIFT記述子、量子化コードワード、座標を含む)は、bag-of-wordsアプローチ用に設計され、ダウンロード可能だった。物体のバウンディングボックスは約3000のsynsetで利用可能であり、各synsetあたり平均150枚の画像があった。一部の画像には属性アノテーションがあるが、詳細は完全には指定されていない。データセットには、120万枚の画像に対するSIFT特徴量を持ついくつかのsynsetも含まれている。

深層学習への重要性

ImageNetは、深層学習革命において極めて重要な役割を果たした。2012年9月30日、AlexNetと呼ばれる畳み込みニューラルネットワークが、ImageNet 2012チャレンジでトップ5エラー率15.3%を達成し、次点を10.8パーセントポイント以上上回った。この成功は、トレーニング中のグラフィックスプロセッシングユニット(GPU)の使用によって可能となり、GPUは深層学習革命に不可欠な要素となった。The Economistによれば、「突然、人々は注目し始めた。AIコミュニティ内だけでなく、テクノロジー業界全体として」という。2015年、AlexNetは100層を超えるMicrosoftの非常に深いCNNによって凌駕され、ImageNet 2015コンテストで3.57%のエラー率を達成して優勝した。2014年、Andrej Karpathyは、集中的な努力により5.1%のエラー率に到達できると推定し、彼の研究室の約10人はより少ない労力で約12〜13%に到達した。最大限の努力をすれば、人間は約2.4%のエラーに到達できると推定された。

ImageNetの影響は、コンペティション自体をはるかに超えて広がっている。大規模で構造化され、ラベル付けされたデータセットが利用可能になったことで、研究者は前例のない規模と多様性でモデルをトレーニングし、ベンチマークすることが可能になった。これにより、深層学習のイノベーション、例えばニューラルネットワーク残差ネットワーク、そしてデータ拡張バッチ正規化といった技術の採用が促進された。また、機械学習人工知能の進歩を加速させ、分類や位置特定などのベンチマークタスクは、コンピュータビジョンシステムを評価するための基礎となった。WordNetを介したデータセットの構成は、他の大規模データセットや、PyTorchなどの標準的なワークフローに影響を与えた。

ImageNetの公開は、より広範な影響ももたらした。多くの研究グループや企業、例えばGoogle DeepMindOpenAIMicrosoftが、モデルのトレーニングと評価にこれを使用した。その影響は、それ以来言語モデリングの標準となっているトランスフォーマーアーキテクチャの開発にも及んでいる。近年でも、ImageNetはコンピュータビジョン研究の重要な参照点であり続けているが、第三者提供の画像を使用しているため、著作権とプライバシーに関する議論も引き起こしている。これらの懸念にもかかわらず、ImageNetの規模と構造は、ImageNetのような異なるドメインを持つ類似のデータセットに影響を与え続けているが、焦点は元のImageNetと、視覚認識の進歩におけるその役割に置かれている。

情報源と影響

要約すると、ImageNetの作成は人工知能の歴史における画期的な出来事であった。それは、データ駆動型アプローチの重要性を浮き彫りにする、包括的でスケーラブルなデータセットを提供した。深層学習ブームへのその影響は過大評価することはできず、現在の生成AIと大規模モデルの時代をもたらしたアルゴリズムとハードウェアのブレークスルーを可能にした。2025年現在でも、ImageNetは、トランスフォーマー、大規模言語モデル、基盤モデルを含む新しい方法と理論を評価するためのベンチマークとして機能している。このプロジェクトの草の根的なアプローチ、つまりグローバルコミュニティを通じたアノテーションのクラウドソーシングは、その後の多くのデータセットやイニシアチブのモデルも確立した。

ImageNetの成功は、高品質で大規模なデータセットがAIの進歩にとって有益であるだけでなく、しばしば不可欠であることを実証した。それは、Amazon Web ServicesGoogle Cloudなどの分散コンピューティングとクラウドサービスの進歩、そしてNVIDIAAMDなどの企業によるハードウェアの改善を促進した。コンペティション自体であるImageNet Large Scale Visual Recognition Challengeは、コンピュータビジョンの進歩を測定するための機関であり続けている。AIの継続的な進化にもかかわらず、ImageNetの遺産は、学術研究から自動運転車、医用画像、マルチモーダルシステムにおける実用的な展開まで、シンボリックAIからニューラルネットワークと機械学習への分野の軌跡を形成し、存続している。リリース後の数年間で、ImageNetは、COCOやFlickrのような後続のデータセットの設計に影響を与え、同様に機械知能のフロンティアを前進させるための大規模でアノテーションされたデータを提供することを目指している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·deep-learning·ai·dataset
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴