ImageNet LSVRC 2012

英語からの翻訳

ImageNet LSVRC 2012は、毎年開催されるImageNet大規模視覚認識チャレンジであり、そこで畳み込みニューラルネットワークであるAlexNetがトップ5エラー率15.3%を達成し、他のすべてのエントリーを10.8パーセントポイント以上上回り、ディープラーニングブームを引き起こした。

ImageNet Large Scale Visual Recognition Challenge(ILSVRC)2012は、ImageNetデータベースからオブジェクトとシーンを正確に分類・検出するためにプログラムが競う年次ソフトウェアコンテストの第3回大会でした。2012年のチャレンジは、人工知能の歴史における転換点として広く認識されており、優勝エントリーであるAlexNetと呼ばれるニューラルネットワークがテストセットでトップ5エラー15.3%を達成し、2位より10.8パーセントポイント以上低い結果を出しました。この劇的な改善は、深層学習機械学習技術の力を実証し、この分野を形成し続ける研究と投資の波を引き起こしました。

ImageNetプロジェクト自体は、AI研究者のFei-Fei Liによって2006年に開始され、AIアルゴリズムのトレーニングに利用可能なデータを拡大することを目的としていました。Liは2007年にWordNetの作成者の一人であるプリンストン大学教授のChristiane Fellbaumと会い、その後、WordNetの約22,000の名詞を出発点としてImageNetを構築しました。データベースは、Amazon Mechanical Turkを介したクラウドソーシングによるアノテーションの助けを借りて構築され、ラベリングは2008年7月に開始され、2010年4月に終了しました。この取り組みには、167か国からの49,000人のワーカーが関与し、1億6,000万以上の候補画像をフィルタリングおよびラベリングし、その結果、20,000以上のカテゴリにわたる1,400万以上の手動アノテーション画像が得られました。

歴史と発展

ImageNetのアイデアは、当時のAI研究のほとんどがデータではなくモデルとアルゴリズムに焦点を当てていたというLiの観察から生まれました。彼女は、平均的な人間が約30,000種類の異なるオブジェクトを認識するという1987年の推定に触発されました。2007年、LiはChristiane Fellbaumと会ってプロジェクトについて話し合い、その会議がWordNetの名詞シノセットからImageNetを構築する決定につながりました。Liは、彼女が助教授を務めていたプリンストン大学で研究者チームを結成し、Amazon Mechanical Turkを使用して画像を分類しました。

当初の計画では、カテゴリあたり10,000画像、40,000カテゴリで4億画像、それぞれ3回検証されることになっていました。しかし、人間は最大で毎秒2画像を分類でき、その速度では休息なしで19人年の労働が必要と推定されました。チームは、2009年にフロリダで開催されたコンピュータビジョンとパターン認識会議(CVPR)で「ImageNet: A Preview of a Large-scale Hierarchical Dataset」というタイトルのポスターとして初めてデータベースを発表しました。

2009年、Alex Bergがオブジェクトローカリゼーションをタスクとして追加することを提案しました。LiはPASCAL Visual Object Classesコンテストに協力を求め、その結果、2010年にImageNet Large Scale Visual Recognition Challengeが開始されました。このチャレンジでは、2010年のPASCAL VOCの20クラスと19,737画像と比較して、1,000の重複しないクラスのトリミングされたリストを使用します。

深層学習への重要性

2012年9月30日、畳み込みニューラルネットワーク(CNN)であるAlexNetが、ImageNet 2012チャレンジでトップ5エラー15.3%を達成しました。これは、2位より10.8パーセントポイント以上低い結果でした。畳み込みニューラルネットワークの使用は、トレーニング中のグラフィックスプロセッシングユニット(GPU)の使用によって可能になり、これは深層学習革命の重要な要素でした。The Economistによると、「突然、人々はAIコミュニティ内だけでなく、テクノロジー業界全体で注目し始めました」。

AlexNetの勝利は、深層学習ブームの引き金としてよく引用されます。これは、ニューラルネットワークが複雑な視覚タスクで最先端の結果を達成できることを実証し、生成AI大規模言語モデルを含むさまざまな分野での深層学習技術の急速な採用につながりました。2015年、AlexNetは100層以上のマイクロソフトの非常に深いCNNによって上回られ、テストセットで3.57%のエラー率でImageNet 2015コンテストに勝利しました。

Andrej Karpathyは2014年に、集中した努力で5.1%のエラー率に到達できると推定し、彼の研究室の約10人がより少ない努力で約12〜13%に到達しました。最大限の努力で、人間は2.4%のエラーに到達できると推定されました。

データセット構成

ImageNetはそのアノテーションプロセスをクラウドソーシングしています。画像レベルのアノテーションは、画像内のオブジェクトクラスの存在または不在を示します。たとえば、「この画像にはトラがいる」または「この画像にはトラがいない」などです。オブジェクトレベルのアノテーションは、示されたオブジェクトの可視部分の周囲にバウンディングボックスを提供します。ImageNetは、細かい分類を示すために120カテゴリの犬種が追加された、広範なWordNetスキーマの変種を使用してオブジェクトを分類します。

2012年、ImageNetはMechanical Turkの世界最大の学術ユーザーであり、平均的なワーカーは毎分50画像を識別しました。2010年4月30日に与えられた概要統計は、合計21,841の非空シノセット、14,197,122画像、1,034,908のバウンディングボックスアノテーション付き画像、および1.2百万のSIFT特徴付き画像を示しました。

ImageNetのカテゴリは、WordNetの概念からフィルタリングされました。各概念は「シノセット」(同義語セット)と呼ばれ、WordNet 3.0には100,000以上のシノセットがあり、その大部分は名詞(80,000以上)でした。ImageNetはこれらを、視覚的に説明できる可算名詞である21,841のシノセットにフィルタリングしました。各シノセットにはWordNet ID(wnid)があり、ImageNetが名詞のみを含むため「n」で始まります。カテゴリは、「哺乳類」などのレベル1から「ジャーマンシェパード」などのレベル9までの9つのレベルに分類されます。

画像形式と前処理

画像は、複数の言語の同義語を使用して、オンライン画像検索エンジン(Google、Picsearch、MSN、Yahoo、Flickr)からスクレイピングされました。ImageNetは、さまざまな解像度のRGB形式の画像で構成されています。たとえば、ImageNet 2012では、「魚」カテゴリの解像度は4288 x 2848から75 x 56まであります。機械学習では、これらは通常、標準の一定解像度に前処理され、ニューラルネットワークによるさらなる処理の前にホワイトニングされます。

たとえば、PyTorchでは、ImageNet画像はデフォルトでピクセル値を0から1の間に収まるように分割し、次に[0.485、0.456、0.406]を減算し、次に[0.229、0.224、0.225]で除算することによって正規化されます。これらはImageNetの平均と標準偏差であるため、入力データをホワイトニングします。

ラベルとアノテーション

各画像には、正確に1つのwnidがラベル付けされます。ImageNet-1Kの高密度SIFT特徴(生のSIFT記述子、量子化されたコードワード、および各記述子/コードワードの座標)は、視覚的な単語のバッグ用に設計されており、ダウンロード可能でした。オブジェクトのバウンディングボックスは、約3,000の人気シノセットで利用可能であり、各シノセットには平均150画像がありました。一部の画像には属性アノテーションもありますが、その完全な詳細は利用可能なソースでは指定されていません。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·deep-learning·computer-vision·machine-learning
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴