英語からの翻訳

Kinetics-700は、700種類の人間の動作クラスを持つ大規模なビデオ動作認識データセットであり、2019年にKineticsシリーズの拡張として導入され、深層学習モデルの訓練と評価に使用される。

Kinetics-700は、ビデオ行動認識のための大規模データセットであり、700の人間の行動クラスと約65万本のビデオクリップを含んでいます。2019年にDeepMind(現在はGoogle DeepMindの一部)の研究者によって、以前のKinetics-400およびKinetics-600データセットの後継として導入されました。このデータセットは、行動分類や時間的局所化などのビデオ理解タスクにおける深層学習モデルのトレーニングと評価のためのベンチマークとして広く使用されています。

Kinetics-700のビデオは、公開されているYouTubeクリップから取得され、各クリップは固定の10秒間の長さにトリミングされています。行動クラスは、スポーツ、料理、身だしなみ、社会的交流など、日常の人間活動の幅広い範囲をカバーしています。各クラスには600〜1,000本のビデオクリップが含まれており、カテゴリ間のバランスの取れた分布が確保されています。データセットはトレーニング、検証、テストセットに分割され、テストセットのラベルは公式評価のために非公開となっています。

構築とアノテーション

Kinetics-700の構築は、半自動化されたパイプラインに従いました。候補ビデオは、各行動クラスの検索クエリを使用して最初に取得され、その後、自動チェックと人間によるアノテーションの組み合わせでフィルタリングされました。アノテーターは、各クリップが対象の行動を正しく描写していることを検証し、曖昧または低品質のクリップは破棄されました。最終データセットは、時間的一貫性を確保するためにキュレーションされ、各クリップには単一で明確に識別可能な行動が含まれています。

前身と比較して、Kinetics-700は、「アコーディオンを演奏する」と「ハーモニカを演奏する」などの細かい区別を含む、より多様な行動クラスを導入しました。この粒度の増加はモデルにとってより大きな課題をもたらし、微妙な動きや文脈の手がかりを捉えることが求められます。

ビデオ認識研究への影響

Kinetics-700は、ビデオ行動認識の分野における標準的なベンチマークとなっています。これは、下流タスク(時空間行動局所化やビデオキャプショニングなど)にファインチューニングする前に、大規模なビデオデータでモデルを事前トレーニングするために一般的に使用されています。このデータセットは、3D残差ネットワークビデオトランスフォーマーなどのアーキテクチャの進歩を促進し、検証セットで最先端の結果を達成しています。

研究者はまた、Kinetics-700を使用して、異なるドメイン間でのビデオモデルの一般化を研究しています。例えば、Kinetics-700でトレーニングされたモデルは、適切にファインチューニングすると、Something-SomethingやUCF101などの他のビデオデータセットにもうまく転移することが示されています。このデータセットの規模と多様性は、ビデオ理解への機械学習アプローチを進めるための重要なリソースとなっています。

評価と指標

Kinetics-700の標準評価では、検証セットでのトップ1およびトップ5精度が使用されます。テストセットのラベルは公開されていないため、ほとんどの公開結果は検証精度を報告しています。公式評価プロトコルでは、モデルが各10秒クリップに対して単一の行動ラベルを予測することが求められ、時間的局所化は行われません。この設定は、短くトリミングされたビデオセグメントから行動を認識する能力を強調しています。

実際には、多くのモデルがKinetics-700で70〜80%の範囲のトップ1精度を達成しており、最良のアーキテクチャはマルチスケールの時間的モデリングと注意メカニズムを組み込んでいます。このデータセットはまた、ビデオ表現学習の評価もサポートしており、モデルはKinetics-700で事前トレーニングされ、線形プロービングやファインチューニングを通じて他のタスクで評価されます。

制限と考慮事項

その有用性にもかかわらず、Kinetics-700には既知の制限があります。このデータセットは、YouTubeでよく表現されている行動に偏っており、現実世界の設定における人間活動の完全な多様性を反映していない可能性があります。さらに、10秒のクリップ長は、食事の調理や家具の組み立てなど、より長い時間スケールで展開する行動には不十分な場合があります。研究者は、このデータセットのクラス分布が、行動自体ではなく背景コンテキストに過度に敏感なモデルにつながる可能性があると指摘しています。

公開されたYouTubeビデオの使用からは、個人が明示的な同意なしに登場する可能性があるため、プライバシーと倫理的な懸念も生じます。このデータセットは研究目的で意図されており、ユーザーはそれでトレーニングされたモデルを展開する際にこれらの問題を考慮することが推奨されます。

関連データセットと拡張

Kinetics-700は、Kinetics-400、Kinetics-600、およびクラスリストを更新し新しいクリップを追加した最近のKinetics-700-2020を含む、より広範なKineticsデータセットファミリーの一部です。Something-SomethingやActivityNetなどの他の関連ベンチマークは、細かいオブジェクト相互作用や時間的活動検出など、ビデオ理解の異なる側面に焦点を当てています。Kinetics-700のために開発されたデータ拡張技術は、他のビデオデータセットやモデルトレーニングパイプラインにも影響を与えています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:video-action-recognition·dataset·computer-vision·benchmark
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴