英語からの翻訳

EPIC-KITCHENSは、日常の台所活動を捉えた大規模な自己中心視点のビデオデータセットであり、行動認識と予測の研究を進めるために使用される。

EPIC-KITCHENSは、人工知能の研究、特に行動認識と行動予測の分野を対象とした大規模な一人称視点ビデオデータセットである。このデータセットは、ヘッドマウントカメラを用いて撮影された、日常の台所活動の一人称(自己中心視点)ビデオ記録で構成されている。これは、一人称視点から人間と物体や環境との相互作用を理解するアルゴリズムを開発・評価するための豊富なリソースを提供する。

このデータセットは、2018年にブリストル大学、カターニャ大学、トロント大学などの協力により導入された。32名の参加者が自宅の台所で行う多様な調理や準備作業を捉えた、55時間以上のビデオが含まれている。ビデオには、動詞と名詞の組み合わせ(例:「玉ねぎを切る」「水を注ぐ」)を含む行動ラベルと、物体のバウンディングボックスが密に注釈付けされており、活動の詳細な分析が可能である。

データ収集と注釈

EPIC-KITCHENSデータセットは、参加者が自然な調理セッション中に装着したヘッドマウントカメラ(GoProなど)を使用して記録された。録画は参加者自身の自宅で行われ、現実的で台本のないシナリオを提供している。注釈プロセスでは、各ビデオフレームを手動で行動セグメントにラベル付けし、行動の開始時間と終了時間を特定し、事前定義された語彙から動詞と名詞のラベルを割り当てた。さらに、各フレームに物体のバウンディングボックスが注釈付けされ、物体検出や追跡タスクが可能になった。

データセットにはトレーニングセットとテストセットが含まれ、合計39,594の行動セグメントと454,714の物体バウンディングボックスがある。行動ラベルは125の動詞クラスと352の名詞クラスをカバーしており、可能な行動の大きな組み合わせ空間を生み出している。

ベンチマークタスクと評価

EPIC-KITCHENSは、自己中心視覚タスク、特に行動認識と行動予測の標準的なベンチマークとなっている。行動認識は、特定のビデオセグメントで実行されている行動を分類することを含み、行動予測は、行動が発生する前に次の行動を予測することを必要とする。データセットは、物体検出、追跡、ビデオ検索などのタスクもサポートしている。

評価指標には、行動認識のトップ1およびトップ5精度、予測タスクの平均平均精度(mAP)が一般的に含まれる。このベンチマークは、CVPRやECCVなどの主要なコンピュータビジョン会議で開催されたEPIC-KITCHENS行動認識チャレンジを含む、いくつかのチャレンジで使用されてきた。

影響と応用

このデータセットは、自己中心視覚の研究を大幅に進展させ、機械学習および深層学習コミュニティで広く採用されている。これにより、一人称視点から人間の活動を理解できるモデルの開発が可能になり、ロボティクス、拡張現実、支援技術などの応用にとって重要である。例えば、ニューラルネットワークアーキテクチャ、特にトランスフォーマーベースのモデルが、時間的文脈とマルチモーダル情報を活用して行動予測のためにEPIC-KITCHENSに適用されている。

さらに、EPIC-KITCHENSは、長期的なビデオ理解と、音声や動きなどの複数のモダリティの統合の研究に貢献している。データセットの現実的な設定と密な注釈は、実世界のシナリオに一般化することを目指すモデルのトレーニングと評価に貴重なリソースとなっている。

拡張と関連データセット

EPIC-KITCHENSの成功に続き、同じチームは、45名の参加者からの100時間のビデオを含む拡張版EPIC-KITCHENS-100をリリースし、追加の注釈とより大きな語彙を含んでいる。他の関連する自己中心視点データセットには、より広範な日常活動をカバーするEgo4Dや、家庭環境での自己中心視点行動認識に焦点を当てたCharades-Egoがある。これらのデータセットは、集合的に自己中心視点ビデオ理解の限界を押し広げている。

結論

EPIC-KITCHENSは、自己中心視覚の分野で基礎となるデータセットであり続け、行動理解のための独自の挑戦的なベンチマークを提供している。その貢献は、人工知能における数多くの革新を促進し、人間とコンピュータの相互作用や知的システムの研究に影響を与え続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:egocentric-vision·dataset·action-recognition·computer-vision
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴