英語からの翻訳

COCO-Stuffは、COCOのデータセット拡張であり、既存の「thing」オブジェクトアノテーションにピクセルレベルの「stuff」アノテーション(空、草、壁などの背景素材)を追加し、シーン理解とセマンティックセグメンテーションの研究を可能にする。

COCO-Stuffは、セマンティックセグメンテーションとシーン理解のための大規模データセットであり、Microsoft Common Objects in Context(COCO)データセットの拡張として作成された。離散オブジェクト(「things」と呼ばれる)に対するCOCOの既存のアノテーションを、空、草、道路、壁などの非晶質な背景領域(「stuff」と呼ばれる)に対する密なピクセルレベルのラベルで補強する。この二重アノテーション方式により、モデルは数えられるオブジェクトと数えられない背景素材を同時に認識でき、自動運転、ロボティクス、画像キャプション生成などのタスクに不可欠である。

このデータセットは、2018年にフライブルク大学の研究者らによって導入され、Alexander Kirillovが主導した。それ以来、コンピュータビジョンにおける標準的なベンチマークとなっている。2017年のCOCOトレイン/バリデーション分割に基づき、元の80のthingカテゴリに172のstuffカテゴリを追加し、合計182のセマンティッククラスとなっている。アノテーションは、自動アルゴリズムと人間による検証の組み合わせで生成され、手動ラベリングのコストを管理可能に保ちながら高品質を確保している。

アノテーション構造

COCO-Stuffは、各stuffカテゴリのピクセルレベルのマスクと、thingsの元のCOCOインスタンスマスクの2種類のアノテーションを提供する。stuffカテゴリは階層的に編成され、172クラスが自然(例:水、山)と人工(例:建物、フェンス)の背景をカバーする。データセット内の各画像には単一のstuffマスクがあり、ラベル付けされていない領域や曖昧な領域には「void」ラベルを含むクラスIDをすべてのピクセルに割り当てる。この構造により、すべてのピクセルが分類されるセマンティックセグメンテーションと、thingsとstuffが統合された出力に結合されるパノプティックセグメンテーションの両方が可能になる。

ベンチマークとしての役割

COCO-Stuffは、セマンティックセグメンテーションアルゴリズムを評価するためのベンチマークとして広く使用されている。標準的な評価指標は、全172のstuffクラスにわたる平均Intersection over Union(mIoU)であり、182クラス設定を使用する場合はthingクラスについても個別に報告される。COCO-Stuffでトレーニングされたモデルは、インスタンスセグメンテーションやシーングラフ生成などの他のタスクのための事前トレーニング済みバックボーンとして機能することが多い。データセットの多様性(164,000画像にわたる80のオブジェクトカテゴリと172の背景タイプをカバー)は、モデルが少数のトレーニングサンプルにしか現れない「超高層ビル」や「川」などの稀なstuffクラスを処理する必要があるため、一般化のための挑戦的なテストとなっている。

他のデータセットとの関係

COCO-Stuffは、ADE20KやCityscapesなどの他のセグメンテーションデータセットを補完する。ADE20Kは150カテゴリ(thingsとstuffの両方を含む)のより広いセットを提供する一方、COCO-StuffはCOCOから継承したより詳細なthingアノテーションを提供する。Cityscapesは30クラスの都市運転シーンに焦点を当てているのに対し、COCO-Stuffは一般的な日常シーンをカバーする。これにより、COCO-Stuffは中間的な位置づけとなる:COCOの規模(200,000以上の画像)を持ちながら、純粋なオブジェクト検出データセットに欠けている背景理解を追加する。研究者は、COCO-Stuffを使用してモデルをトレーニングし、その後ドメイン固有のデータセットに微調整することが多く、その多様な背景カバレッジを活用している。

技術的影響

COCO-Stuffは、Deep learningのいくつかの分野で進歩を促進した。これは、2019年に形式化されたセマンティックセグメンテーションとインスタンスセグメンテーションを統合するタスクであるパノプティックセグメンテーションの開発に重要な役割を果たした。U-NetバリアントやResNetベースのエンコーダなどのアーキテクチャは、このデータセットで一般的に評価される。データセットはまた、モデルがピクセルマスクの代わりに画像レベルのラベルから学習する弱教師あり学習や、COCO-Stuffでトレーニングされたモデルが異なる分布からの実世界画像でテストされるドメイン適応の研究もサポートする。そのアノテーションは、オブジェクトとその周囲の両方の理解が重要である自動運転やRoboticsにおけるArtificial intelligenceアプリケーションのためのモデルのトレーニングに使用されてきた。

入手可能性と使用法

COCO-Stuffは、元のCOCOデータセットと同じ条件で研究目的に公開されている。公式リポジトリは、アノテーションをダウンロードして前処理するスクリプトと、mIoUの評価コードを提供する。データセットはCOCOウェブサイトでホストされ、学術プラットフォームにもミラーリングされている。2024年現在、コンピュータビジョンで最も引用されているデータセットの1つであり、2,000以上の引用がある。その継続的な関連性は、thingsとstuffの両方のアノテーションを持つ同様に大規模なデータセットがそれ以来リリースされていないため、シーン理解モデルを評価するための事実上の標準となっていることによる。研究者は、2017年の分割で使用された164,000画像の完全なセットを指すCOCO-Stuff 164kと呼ばれるバリアントにもアクセスでき、これはより小さな10,000画像のテストサブセットとは対照的である。

将来の方向性

COCO-Stuffの成功は、深度やビデオなどの追加モダリティで拡張する取り組みを促した。しかし、2025年現在、公式の後継はリリースされていない。データセットの制限には、西洋のシーンへのバイアスと、細かいstuffカテゴリ(例:異なる種類の植生)の欠如が含まれる。これらのギャップは、OpenPanopticHalcyonなどの新しいデータセットによって対処されているが、COCO-Stuffは最も広く使用されているベンチマークのままである。そのMachine learning研究への影響は、それに関する結果を報告する多くの公開論文に明らかであり、実世界のComputer visionシステムを動かすモデルのトレーニングの基盤として機能し続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·semantic-segmentation·scene-understanding
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴