英語からの翻訳

COCO-Stuff 164Kは、セマンティックセグメンテーションとシーン理解のための大規模データセットであり、COCOを拡張して164,000枚の画像と、172のstuffおよびthingクラスに対するピクセルレベルのアノテーションを提供します。

COCO-Stuff 164Kは、セマンティックセグメンテーションとシーン理解のための大規模データセットであり、Microsoft Common Objects in Context(COCO)データセットの拡張として構築された。空、芝生、道路などの非晶質な背景領域を指す「stuff」クラスと、人、車、犬などの数えられるオブジェクトを指す「thing」クラスの両方に対して、密なピクセルレベルのアノテーションを提供する。このデータセットには164,000枚の画像が含まれ、各画像は172のセマンティックカテゴリのいずれかでアノテーションされており、セマンティックセグメンテーション、インスタンスセグメンテーション、シーンパースなどのコンピュータビジョンタスクにおけるモデルのトレーニングと評価のための最も包括的なリソースの1つとなっている。

このデータセットは、2018年にフライブルク大学の研究者であるHolger Caesar、Jasper Uijlings、Vittorio Ferrariによって導入され、論文「COCO-Stuff: Thing and Stuff Classes in Context」で発表された。これは、10,000枚の画像を持つ元のCOCO-Stuffデータセットを基に、COCOのトレーニング分割とバリデーション分割全体にスケールアップしたものである。172のクラスは、80のthingクラス(COCOのthingカテゴリと同一)と92のstuffクラスに分けられ、自然および人工の背景要素が含まれる。

構築とアノテーション

COCO-Stuff 164Kのアノテーションプロセスには、自動ステップと手動ステップの両方が含まれる。初期のstuffアノテーションは、深層学習モデルと人間による修正の組み合わせを用いて生成された。このデータセットは、クラウドワーカーによって作成されたthingクラスの既存のCOCOアノテーションを活用し、stuffクラスのピクセルレベルのマスクを追加する。最終的なアノテーションは、164,000枚の画像全体で一貫性と正確性を確保するために、一連の品質管理チェックを通じて検証された。

データセット内の各画像はピクセルごとに単一のラベルでアノテーションされ、アノテーションはストレージ要件を削減するためにコンパクトなランレングス符号化形式で提供される。データセットは、118,000枚の画像のトレーニングセットと5,000枚の画像のバリデーションセットに分割され、残りの画像はテスト用に確保されている(テストセットのアノテーションは公開されていない)。

深層学習における応用

COCO-Stuff 164Kは、モデルが画像内のすべてのピクセルにクラスラベルを割り当てるタスクであるセマンティックセグメンテーションの標準ベンチマークとなっている。これは、機械学習深層学習におけるニューラルネットワークアーキテクチャ、特に残差ネットワークU-Netベースのモデル、およびトランスフォーマーベースのアプローチの性能を評価するために広く使用されている。stuffクラスとthingクラスの両方の多様性は、モデルが細かいオブジェクトの境界と大規模な文脈領域の両方を理解することを要求する。

このデータセットは、セマンティックセグメンテーションとインスタンスセグメンテーションを統合し、モデルがstuffラベルとthingラベルの両方を同時に予測することを要求するタスクであるパノプティックセグメンテーションにも使用される。これにより、単一のフォワードパスで両方のタイプのクラスを処理できる統合アーキテクチャの研究が促進された。

ベンチマークと評価指標

COCO-Stuff 164Kの主要な評価指標は、平均Intersection over Union(mIoU)であり、これは予測セグメンテーションマスクとグラウンドトゥルースセグメンテーションマスクの重なりを全クラスで平均したものである。研究者はまた、クラスごとのIoUとピクセル精度も報告する。データセットの公式評価サーバーはモデルの公平な比較を可能にし、リーダーボードは時間の経過とともに最先端の技術を追跡する。

リリース以来、このデータセットは数百の研究論文で使用され、トップパフォーマンスのモデルはバリデーションセットで50を超えるmIoUスコアを達成しており、トランスフォーマーベースのアーキテクチャとアテンションメカニズムの進歩によって大きな進展がもたらされている。

他のデータセットとの関係

COCO-Stuff 164Kは、COCO-Stuff 10Kや元のCOCOデータセットを含むCOCOから派生したデータセットファミリーの一部である。これは、都市の運転シーンに焦点を当てたCityscapesや、屋内および屋外のより広範なシーンをカバーするADE20Kなどの他のシーン理解データセットを補完する。文脈とstuffクラスへの重点は、背景領域の理解がオブジェクトの検出と同じくらい重要である自動運転、ロボティクス、拡張現実などのアプリケーションに特に有用である。

このデータセットは研究目的で公開されており、公式のCOCOウェブサイトでホストされている。これは、人工知能研究ラボやクラウドプラットフォームからの事前トレーニング済みモデルと組み合わせて一般的に使用され、コンピュータビジョンの分野を前進させるための重要なリソースであり続けている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·semantic-segmentation·dataset·deep-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴