英語からの翻訳

ImageNet Large Scale Visual Recognition Challenge(ILSVRC)2010は、ソフトウェアプログラムがImageNetデータベース内のオブジェクトを分類・検出するために競い合った初の年次コンペティションであり、1,000の重複しないクラスとオブジェクト位置特定を使用しました。

ImageNet大規模視覚認識チャレンジ(ILSVRC)2010は、視覚的物体認識研究用に設計された大規模視覚データベースであるImageNetプロジェクトが主催する年次ソフトウェアコンテストの初回開催であった。このチャレンジでは、参加プログラムが、重複しない1,000クラスの厳選されたリスト内の物体とシーンを正確に分類・検出することが求められ、これは2010年にわずか20クラスと19,737枚の画像を使用したPASCAL Visual Object Classes(VOC)コンテストなどの従来のベンチマークから大幅に規模を拡大したものであった。2010年のチャレンジは、標準化された大規模評価プラットフォームを提供することでコンピュータビジョンの転換点となり、後に深層学習革命を促進することとなった。

起源と発展

ImageNetプロジェクトは、2006年にAI研究者の李飛飛によって構想された。当時、ほとんどのAI研究はデータではなくモデルとアルゴリズムに焦点を当てていた。李は、AIアルゴリズムのトレーニングに利用可能なデータを拡張・改善することを目指した。2007年、彼女はWordNetの作成者であるプリンストン大学教授のクリスティアーネ・フェルバウムと会い、これがWordNetの約22,000の名詞からImageNetを構築するきっかけとなった。李はまた、平均的な人間が約30,000種類の物体を認識するという1987年の推定にも触発された。

プリンストン大学の助教授として、李は研究者チームを結成し、画像分類にAmazon Mechanical Turkを使用した。ラベリングは2008年7月に開始され、2010年4月に終了し、167か国の49,000人のワーカーが1億6,000万以上の候補画像をフィルタリングおよびラベリングした。当初の計画では、40,000カテゴリにわたって各カテゴリあたり10,000枚の画像、合計4億枚の画像が必要であったが、実際的な制約により規模が縮小された。このデータベースは、2009年にフロリダで開催されたコンピュータビジョンおよびパターン認識会議(CVPR)で「ImageNet: A Preview of a Large-scale Hierarchical Dataset」というタイトルのポスターとして初めて発表された。

2009年、アレックス・バーグが物体位置特定をタスクとして追加することを提案し、李はPASCAL VOCコンテストに協力を打診した。これにより、ILSVRCは2010年に開始され、1,000クラスと物体位置特定を備え、PASCAL VOCの20クラスから大幅に拡張された。

データセット構成

ImageNetはそのアノテーションプロセスをクラウドソーシングしている。画像レベルのアノテーションは物体クラスの存在または非存在を示し、物体レベルのアノテーションは物体の可視部分の周囲にバウンディングボックスを提供する。データセットはWordNetスキーマの変種を使用し、細粒度分類用に120カテゴリの犬種が追加されている。2010年4月30日時点で、データセットには21,841の非空のsynset(同義語セット)、14,197,122枚の画像、1,034,908枚のバウンディングボックスアノテーション付き画像、および120万枚のSIFT特徴量付き画像が含まれていた。

カテゴリはWordNetの概念からフィルタリングされ、これらはsynsetと呼ばれる。各synsetには「n」で始まるWordNet ID(wnid)があり、これはImageNetが名詞のみを含むためである。カテゴリはレベル1(例:「哺乳類」)からレベル9(例:「ジャーマンシェパード」)までの9つのレベルに分類される。画像は、Google、Picsearch、MSN、Yahoo、Flickrなどのオンライン検索エンジンから、複数言語の同義語を使用してスクレイピングされた。画像はRGB形式で解像度はさまざまであり、例えば2012年の「魚」カテゴリでは、解像度は4288 x 2848から75 x 56の範囲である。機械学習では、これらは通常、標準解像度に前処理され、ニューラルネットワークによる処理前にホワイトニングされる。

深層学習への重要性

ILSVRC 2010は、2012年の大きなブレークスルーの舞台を整えた。2012年9月30日、AlexNetと呼ばれる畳み込みニューラルネットワーク(CNN)がImageNet 2012チャレンジでトップ5エラー率15.3%を達成し、2位より10.8パーセントポイント以上低かった。この成功は、トレーニング中のグラフィックス処理ユニット(GPU)の使用によって可能となり、これは深層学習革命の必須要素であった。The Economistによると、「突然、人々はAIコミュニティ内だけでなく、テクノロジー業界全体で注目し始めた」。

2015年、AlexNetは100層を超えるマイクロソフトの非常に深いCNNによって凌駕され、これはImageNet 2015コンテストで3.57%のエラー率で優勝した。アンドレイ・カーパシーは2014年に、集中した努力で5.1%のエラー率に到達できると推定し、彼の研究室の約10人が少ない努力で約12〜13%に到達した。最大限の努力で、人間は2.4%のエラー率を達成できると推定された。

遺産

ILSVRC 2010自体は深層学習の勝者を生み出さなかったが、コンピュータビジョンの急速な進歩を促進するベンチマークを確立した。このチャレンジの大規模で標準化された評価は、ニューラルネットワークおよび深層学習技術の発展の触媒となり、人工知能および関連分野のその後の研究に影響を与えた。データセットとチャレンジは影響力を持ち続けており、2010年版は、機械学習アプローチの力を示した後のコンテストの基盤となった。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·image-classification·machine-learning·benchmark
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴