Something-Somethingは、細粒度のアクション認識のための大規模ビデオデータセットである。2017年に、アントワープ大学とフランドル・スーパーコンピューティング・センター(VSC)の研究チームが、Something, Inc.社との協力のもとで導入した。このデータセットは、初期のアクション認識データセットにおける重要な限界、すなわち、アクション自体の時間的ダイナミクスではなく、物体やシーンなどの静的な視覚的手がかりに依存する傾向に対処するために作成された。Something-Somethingは、動作と、行為者と関与する物体との間の因果関係によって定義される基本的な日常動作に焦点を当てており、時間の経過とともにアクションがどのように展開するかを理解しなければならないモデルにとって、挑戦的なベンチマークとなっている。
このデータセットは、10万本以上のビデオで構成され、各ビデオは174の異なるアクションカテゴリのうちの1つを実行する人物を示している。これらのカテゴリは意図的に単純で抽象的なものであり、例えば「何かを左から右へ押す」「何かを拾い上げる」「何かを逆さまにする」などがある。アクションは、カップ、本、道具など、多種多様な日常物体を用いて実行され、これらの物体はビデオ間で固定されていない。この設計により、モデルは物体の同一性ではなく、動作と相互作用のパターンに焦点を当てることを余儀なくされる。ビデオは世界中の貢献者からクラウドソーシングされ、その結果、背景、照明条件、カメラ視点の多様な範囲が生じている。各ビデオは短いクリップであり、通常2〜5秒の長さで、単一のアクションカテゴリでラベル付けされている。
動機と設計
Something-Somethingの作成は、UCF-101やHMDB-51などの多くの一般的なアクション認識データセットに、単一フレームからアクションを推測できるビデオが含まれているという観察によって動機付けられた。例えば、「ギターを弾く」とラベル付けされたビデオは、ギターの存在だけで認識できる可能性がある。これにより、モデルは真に動作を理解することなく、静的な外観バイアスを利用して高い精度を達成できた。Something-Somethingは、これらの近道を排除するように設計された。このデータセットでは、同じ物体が多くの異なるアクションに登場し、同じアクションが多くの異なる物体に対して実行される。したがって、モデルはアクションを正しく識別するためにフレームの時間的シーケンスを分析しなければならず、時間的推論のより忠実なテストとなる。
ベンチマークと評価
このデータセットは、特に深層学習とニューラルネットワークに基づくビデオ理解モデルの性能を評価するために一般的に使用される。標準的な評価プロトコルには、提供されたトレーニング分割でのトレーニングと、検証セットでのトップ1およびトップ5精度の報告が含まれる。リリース以来、Something-Somethingは、KineticsやMoments in Timeなどの他のデータセットと並んで、この分野の標準的なベンチマークとなっている。特に難しいことで知られており、トランスフォーマーや残差ネットワークを使用する最先端のモデルでさえ、外観重視のデータセットと比較して、このデータセットでは大幅に低い精度を達成している。これにより、3D畳み込みネットワークやビデオトランスフォーマーなど、時間的ダイナミクスをよりよく捉えるアーキテクチャの研究が促進された。
影響と限界
Something-Somethingは、人工知能と機械学習の分野に大きな影響を与え、コミュニティをより堅牢な時間的モデリングへと押し進めた。また、ビデオのデータ拡張やカリキュラム学習に関する研究にも使用されている。しかし、このデータセットには限界がないわけではない。アクションカテゴリは高度に抽象的であり、クラウドソーシングされたビデオの性質により、ラベルノイズと変動性が導入される。一部の研究者は、アクションがしばしば台本通りに実行され、それが自然主義的な人間の行動とは異なる可能性があると指摘している。さらに、このデータセットは、最近の大規模ビデオデータセットと比較して比較的小さく、大規模言語モデルや他のデータを大量に必要とするアプローチを直接事前学習に使用する場合、その効果を制限する可能性がある。
関連研究と拡張
Something-Somethingに触発されたいくつかの後続データセットがあり、構成アクション認識に焦点を当てたSomething-Elseや、より多くのビデオと改善されたアノテーションを備えた大規模版であるSomething-Something V2が含まれる。これらのデータセットは、AWS TrainiumやGoogle Cloud TPUなどのAIハードウェアの進歩と組み合わせて、ますます複雑なモデルをトレーニングするために引き続き使用されている。Something-Somethingによって提起された課題は、アクションの因果的および時間的構造について推論できるアーキテクチャを開発するための継続的な取り組みとともに、依然として活発な研究分野であり、この能力はロボティクス、自動運転、人間とコンピュータの相互作用におけるアプリケーションに不可欠である。