ImageNet Challenge

英語からの翻訳

ImageNetチャレンジ、正式名称ImageNet Large Scale Visual Recognition Challenge(ILSVRC)は、2010年から開催されている画像分類と物体検出を対象とした年次ソフトウェア競技であり、深層学習の進歩を牽引する重要な原動力となっている。

ImageNet挑戰賽,正式名稱為ImageNet大規模視覺識別挑戰賽(ILSVRC),是一項年度軟體競賽,參賽程式需正確分類並檢測圖像中的物體與場景。該挑戰賽始於2010年,使用ImageNet資料庫中精選的1000個不重疊類別,而該資料庫本身包含超過1400萬張人工標註圖像,涵蓋超過20000個類別。此挑戰賽在2012年後成為電腦視覺領域的關鍵基準,並推動了深度學習的革命。

歷史

AI研究員李飛飛於2006年開始構思ImageNet的概念,旨在擴大訓練AI演算法可用的資料量,當時多數研究聚焦於模型本身。2007年,李飛飛結識了普林斯頓大學教授、WordNet的建立者之一克里斯蒂安·費爾鮑姆,並基於WordNet中約22000個名詞建構了ImageNet。她的靈感來自1987年的一項估計,即普通人能辨識約30000種物體。

作為普林斯頓大學的助理教授,李飛飛組建團隊,利用亞馬遜的機械土耳其人平台進行圖像標註。標註工作從2008年7月持續至2010年4月,動員了來自167個國家的49000名工作者,對超過1.6億張候選圖像進行篩選與標註。最終,每張圖像由三人標註,共完成1400萬張圖像的標註。最初的計畫是每個類別包含10000張圖像,共涵蓋40000個類別,但這一目標未能完全實現。

該資料庫最初於2009年在佛羅里達舉行的電腦視覺與模式識別會議(CVPR)上以海報形式發表,題為「ImageNet:一個大規模層級化資料集的預覽」。2009年,亞歷克斯·伯格建議增加物體定位任務,並促成了與PASCAL視覺物體類別競賽的合作。首屆ImageNet挑戰賽於2010年舉辦,設有1000個類別及物體定位任務,而PASCAL VOC僅有20個類別和19737張圖像。

對深度學習的意義

2012年9月30日,一個名為AlexNet的卷積神經網路(CNN)在ImageNet 2012挑戰賽中取得了前五錯誤率15.3%的成績,比第二名低了超過10.8個百分點。這一成功得益於使用圖形處理器(GPU)進行訓練,而GPU是深度學習革命的關鍵要素。《經濟學人》雜誌評論道:「突然之間,人們開始關注,不僅是AI社群,整個科技產業都為之矚目。」

2015年,微軟的深度CNN(超過100層)以3.57%的測試錯誤率贏得了ImageNet 2015競賽。安德烈·卡帕西在2014年估計,憑藉專注的努力,人類可達到5.1%的錯誤率;而若全力以赴,人類錯誤率可低至2.4%。

資料集

ImageNet的標註過程採用群眾外包方式。圖像級標註標明圖像中是否存在某類物體,而物體級標註則提供邊界框。資料集使用WordNet架構的變體,並擴充了120個犬種類別以支援細粒度分類。

截至2010年4月30日,ImageNet包含21841個非空synset(同義詞集)、14197122張圖像、其中1034908張帶有邊界框標註,以及120萬張具有SIFT特徵的圖像。2012年,ImageNet成為全球最大的機械土耳其人學術用戶,工作者平均每分鐘標註50張圖像。

類別

類別是從WordNet概念中篩選出來的,每個類別稱為一個「synset」(同義詞集)。ImageNet包含21841個可視覺化表示的計數名詞synset。每個synset有一個WordNet ID(wnid),以「n」開頭(例如,「n02084071」對應「狗」)。類別分為9個層級,從第1層(如「哺乳動物」)到第9層(如「德國牧羊犬」)。

圖像格式

圖像透過多語言同義詞從線上搜尋引擎(Google、Picsearch、MSN、Yahoo、Flickr)抓取。圖像為RGB格式,解析度各異;例如,ImageNet 2012中「魚」類別的圖像解析度從4288×2848到75×56像素不等。在機器學習中,圖像通常會預處理至標準解析度並進行白化。例如,在PyTorch中,圖像會透過除以像素值[0,1]、減去[0.485, 0.456, 0.406]並除以[0.229, 0.224, 0.225]來進行歸一化。

標註

每張圖像僅標註一個wnid。密集SIFT特徵(原始描述子、量化視覺詞彙及座標)可用於ImageNet-1K,該子集專為詞袋模型設計。約3000個熱門synset提供邊界框標註,每個synset平均有150張圖像。部分圖像還包含屬性標註,但細節有限。

影響

ImageNet挑戰賽對推動機器學習和深度學習技術的發展起到了關鍵作用。它普及了卷積神經網路(如殘差網路)的架構,以及批次歸一化和資料擴增等訓練方法。該競賽的成功激發了人們對人工智慧的廣泛興趣,並影響了後續生成式AI和大語言模型研究的進展,儘管挑戰賽本身專注於視覺任務。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·competition·deep-learning·imagenet
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴