Charadesは、日常生活行動認識のための大規模データセットであり、267人のユーザーから収集された9,848本のビデオで構成されている。このデータセットは2016年にカーネギーメロン大学とトロント大学の研究者によって導入され、家庭環境で行われる日常的な動作の認識に焦点を当てている。各ビデオには複数の行動ラベルが付与されており、コンピュータビジョン分野における機械学習モデルの訓練と評価のための豊富なリソースを提供している。
このデータセットは、初期の行動認識ベンチマークがしばしば演出されたり台本に沿った動作を特徴としていたという限界に対処するために作成された。Charadesは、料理、掃除、読書などの自発的で台本のない活動を捉えており、実世界の応用にとってより現実的なベンチマークとなっている。ビデオにはテキストによる説明と行動ラベルが付随しており、視覚認識と言語接地の両方の研究を可能にしている。
データセット構成
Charadesには9,848本のビデオが含まれ、平均時間は約30秒で、合計で約82時間の映像となる。データセットには157の行動クラスが含まれ、「冷蔵庫を開ける」「テレビを見る」「電話を使う」など、幅広い日常活動を網羅している。各ビデオには複数の行動インスタンスが注釈付けされ、注釈には時間的境界が含まれており、フレームレベルの行動認識が可能である。
ビデオはAmazon Mechanical Turkを通じて収集され、参加者は自宅で活動を行う様子を自分で録画するよう求められた。このクラウドソーシングによるアプローチは、多様な環境、照明条件、カメラアングルをもたらし、認識タスクの難易度を高めている。データセットには27,847件のビデオ説明も含まれており、ビデオキャプショニングや検索などのタスクに使用される。
評価とベンチマーク
Charadesは、特に深層学習に基づく行動認識モデルのベンチマークとして一般的に使用されている。標準的な評価指標は、全行動クラスにわたる平均適合率(mAP)であり、ビデオレベルで計算される。研究者はしばしば、7,984本の訓練ビデオと1,864本のテストビデオを含むCharades v1分割での結果を報告する。
いくつかの注目すべきモデルがCharadesで評価されており、二重ストリーム畳み込みネットワーク、時間セグメントネットワーク、そして最近ではトランスフォーマーベースのアーキテクチャが含まれる。このデータセットは、各ビデオに複数の同時行動が含まれる可能性があるため、マルチラベル分類の研究にも使用されている。2025年時点で、最先端のモデルは60%を超えるmAPスコアを達成しているが、データセットはその現実的でノイズの多い性質により、依然として挑戦的である。
人工知能における応用
Charadesは、人工知能研究の進展、特に機械学習と深層学習の分野において重要な役割を果たしてきた。これは、監視、人間とコンピュータの相互作用、ロボティクスなどの応用の主要な構成要素であるビデオ理解のためのモデルを訓練するために広く使用されている。データセットはまた、残差ネットワークやトランスフォーマーモデルを含むニューラルネットワークアーキテクチャの研究を支援している。
行動認識に加えて、Charadesは、モデルがビデオ内で行動がいつ発生するかを特定しなければならない時間的行動ローカリゼーションなどのタスクにも使用されている。また、視覚情報とテキスト情報を組み合わせたマルチモーダル学習にも採用されている。データセットの注釈は、活動の自然言語記述を生成することを目的としたビデオキャプショニングのためのシーケンス・ツー・シーケンスモデルの研究を可能にしている。
関連データセットと影響
Charadesは、UCF101、ActivityNet、Kineticsを含むより広範な行動認識データセット群の一部である。これらのデータセットがしばしば短くトリミングされたクリップを特徴とするのに対し、Charadesは実世界の条件をよりよく反映する長くトリミングされていないビデオを提供する。これにより、時間的依存関係やノイズの多い入力を処理できる堅牢なモデルを開発するための貴重なリソースとなっている。
このデータセットは数百の研究論文で引用され、自己中心的なビデオに焦点を当てたCharades-Egoデータセットなど、その後のベンチマークの設計に影響を与えてきた。Charadesはまた、ActivityNet大規模行動認識チャレンジを含む主要な会議でのチャレンジに使用され、学界と産業界の間の協力を促進している。
限界と将来の方向性
その強みにもかかわらず、Charadesには限界がある。ビデオは非専門家によって録画されているため、品質のばらつきや時折の注釈エラーが生じる。行動クラスは日常活動に限定されており、スポーツや医療処置などの他の領域には一般化できない可能性がある。さらに、データセットは新しいベンチマークと比較して比較的小さく、非常に大規模なモデルの訓練を制限する可能性がある。
将来の研究は、データセットを拡張したり、合成データと組み合わせたりすることで、これらの限界に対処するかもしれない。生成AIと大規模言語モデルの台頭は、モデルが視覚情報とテキスト情報の両方を理解しなければならないマルチモーダル推論タスクでCharadesを使用する新たな道も開いている。2025年時点で、Charadesはビデオ理解の進歩を評価するための標準的なベンチマークであり続けている。
関連項目
- 機械学習
- 深層学習
- コンピュータビジョン
- ビデオ理解