LVIS(低容量缺血性卒中スケール)

英語からの翻訳

LVIS(Large Vocabulary Instance Segmentation)は、ロングテール視覚認識のためのデータセットであり、1,203のオブジェクトカテゴリにわたる200万以上の高品質なインスタンスセグメンテーションマスクを含み、希少なオブジェクトと一般的なオブジェクトに対するAIモデルのベンチマークと改善を目的として設計されています。

LVIS(Large Vocabulary Instance Segmentationの略)は、コンピュータビジョンおよび機械学習において、インスタンスセグメンテーションと物体検出のモデルを評価・訓練するために使用されるデータセットである。2019年にFacebook AI Research(現在はMeta AIの一部)の研究者らによって導入され、現実世界のほとんどの物体カテゴリが稀である一方、標準的なデータセットが少数の一般的なクラスに焦点を当てていたという、ロングテール視覚認識の課題に対処することを目的とした。LVISは、'banana'のような日常品から'triceratops skull'のようなニッチな物体まで、1,203の物体カテゴリからなる大規模な語彙を提供し、COCOデータセット由来の約164,000枚の画像に、200万以上の高品質なインスタンスセグメンテーションマスクが注釈されている。このデータセットの設計は網羅的な注釈を重視しており、注釈者は画像内に存在するすべてのカテゴリのすべてのインスタンスをラベル付けするよう指示された。これは、稀な物体をしばしば無視していた初期のデータセットとは対照的である。これにより、LVISは深層学習モデルにとって厳格なベンチマークとなり、特に稀なカテゴリでの性能測定に焦点を当て、ロングテール効果を緩和するためのフェデレーテッド損失や動的勾配クリッピングといった技術の研究を促進した。

LVISの作成は、現実世界の視覚データがべき乗則分布に従い、少数のカテゴリ(例:'person'、'car')が頻繁に出現する一方、数千の他のカテゴリは散発的にしか出現しないという観察に動機づけられた。COCOやImageNetのような従来のデータセットは、カテゴリ数が限られているか、すべてのインスタンスにピクセルレベルのマスクを提供しておらず、細かい認識における有用性が制限されていた。LVISは、COCO画像のサブセットをはるかに大きなカテゴリセットで再注釈し、クラウドソーシングによる注釈パイプラインを用いて構築された。このパイプラインは2段階のプロセスを伴う。まず、注釈者が画像内のすべての物体を特定する「発見」段階、次に完全性と正確性を保証する「検証」段階である。最終データセットには1,203のカテゴリが含まれ、頻繁(100画像以上)、一般的(10〜100画像)、稀(10画像未満)の3つの頻度グループに分割され、約77%のカテゴリが稀なグループに該当する。この不均衡は意図的であり、現実世界の条件を反映し、モデルが主要カテゴリを超えて一般化することを強制する。

データセット構造と注釈

LVISはCOCOデータセット上に構築され、その訓練画像と検証画像のうち164,000枚を使用するが、カテゴリ語彙は大幅に拡張されている。各画像にはインスタンスレベルのセグメンテーションマスクが注釈されており、すべての物体インスタンスがピクセルレベルで輪郭描画され、単なるバウンディングボックスに限定されない。注釈プロセスは網羅的になるよう設計されており、注釈者は、小さく、遮蔽され、またはぼやけている場合でも、存在するすべてのカテゴリのすべてのインスタンスをラベル付けする必要があった。これは、80カテゴリのみの注釈を要求し、稀な物体をしばしば省略したCOCOとの重要な違いである。データセットは、画像ID、カテゴリID、セグメンテーションポリゴン、バウンディングボックスなどのフィールドを含む、COCOと同様の形式のJSONファイルを提供する。カテゴリリストは、WordNetのシノニムセットと手動選択の組み合わせからキュレーションされ、日常品、動物、食品、道具の広範なカバレッジを保証している。

ベンチマークと評価指標

LVISの主要な評価指標は、標準的なCOCOスタイルの平均適合率(AP)であり、複数のIntersection over Union(IoU)閾値(0.5〜0.95)で計算される。しかし、LVISは重要なひねりを導入している。APは3つの頻度グループ(稀、一般的、頻繁)ごとに個別に報告され、全体のAPはこれら3つのグループAPの平均であり、全カテゴリにわたる単純平均ではない。この「バランス型」APは、稀なカテゴリでの性能が一般的なカテゴリに覆い隠されないことを保証し、ロングテール一般化のより感度の高い尺度となる。例えば、'person'では良好だが'abacus'では低い性能のモデルは、COCOよりもLVISで低いスコアとなる。ベンチマークには、インスタンスセグメンテーション用の「マスクAP」と検出用の「ボックスAP」も含まれ、主要なリーダーボードはマスクAPに焦点を当てている。リリース以来、LVISはICCV 2019でのLVISチャレンジやその後のワークショップを含むいくつかのチャレンジで使用され、上位エントリはクラスバランス型サンプリング、損失の再重み付け、トランスフォーマーベースの検出器のようなより大きなバックボーンの使用などの技術を採用している。

ロングテール学習への影響

LVISは、不均衡なデータでモデルを訓練することに関わる人工知能のサブフィールドであるロングテール学習の標準的なテストベッドとなっている。このデータセットの設計は、数多くのアルゴリズム的革新を促進した。注目すべき例の1つは、LVISの著者らによって提案された「フェデレーテッド損失」であり、カテゴリを頻度に基づいて「フェデレーテッド」セットにグループ化し、各グループに対してソフトマックスを計算することで、損失関数において稀なカテゴリが頻繁なカテゴリに圧倒されるのを防ぐ。もう1つは「動的勾配クリッピング」であり、訓練中に稀なカテゴリの勾配の大きさを調整する。その後の研究では、分離訓練(最初に特徴を学習し、次に分類器を微調整する)、稀なクラスのデータ拡張、より優れた特徴抽出を備えたニューラルネットワークアーキテクチャの使用が探求されている。LVISはまた、Open ImagesやObjects365などの他のデータセットにも影響を与え、これらは同様の網羅的な注釈戦略を採用した。2025年時点で、LVISは広く引用されるベンチマークであり、学術文献で1,000以上の引用があり、大規模言語モデルベースの視覚言語モデルと組み合わせて、稀な物体に対するゼロショットまたは少数ショット認識能力をテストするためによく使用されている。

関連データセットと拡張

LVISは、いくつかの拡張と関連する取り組みを生み出した。LVISチャレンジデータセットには、20,000枚の画像の検証セットとテストセットが含まれ、同じ1,203カテゴリの注釈が提供される。2020年には、著者らがLVIS v1.0をリリースし、注釈エラーを修正し、訓練セットを(元の57,000枚から)100,000枚に拡張して、一貫性を改善した。オープンワールドインスタンスセグメンテーション用のLVIS-OW(オープンワールド)と呼ばれる変種が導入され、モデルが未知の物体を識別する必要がある。さらに、LVISはDetectron2フレームワークに統合されており、研究者がモデルを簡単に訓練および評価できる。データセットのカテゴリリストは、パノプティックセグメンテーションやビデオインスタンスセグメンテーションなどの他のタスクでも使用され、共通の語彙として機能している。その成功にもかかわらず、LVISには限界がある。COCO画像から派生しており、ウェブ写真に偏っていること、カテゴリセットは大きいものの依然として有限であることである。Ego4Dプロジェクトからのもののような将来のデータセットは、LVISの原則に基づいて、さらに多様なベンチマークを作成している。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·long-tail-recognition·instance-segmentation
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴