英語からの翻訳

Kinetics-600は、600のアクションクラスを含む大規模なビデオアクション認識データセットであり、Kinetics-400の拡張として2018年に導入されました。ビデオ理解モデルのトレーニングと評価のために、多様なYouTubeクリップを提供します。

Kinetics-600は、ビデオ行動認識のための大規模データセットであり、約48万本のビデオクリップが600種類の人間の行動クラスにわたって含まれています。2018年にDeepMind(現在はGoogle DeepMindの一部)とオックスフォード大学の研究者によって導入され、以前のKinetics-400データセットを基盤としています。このデータセットは、ビデオ理解タスクにおける深層学習モデルのトレーニングと評価のためのベンチマークとして広く使用されています。

クリップはYouTubeから取得され、『歯磨き』のような日常的な行動から、スポーツや物体とのインタラクションまで、幅広い人間の活動を描写しています。各クリップは約10秒にトリミングされ、単一の行動クラスでラベル付けされています。このデータセットは、現実世界の人間の動きの多様性と複雑さを捉えるように設計されており、行動認識アルゴリズムにとって挑戦的なテストベッドとなっています。

データセットの構築

Kinetics-600データセットは、半自動化されたパイプラインを通じて作成されました。各行動クラスの検索クエリを使用して候補となるビデオURLが収集され、その後、人間のアノテーターがクリップを検証して、意図した行動を正しく描写していることを確認しました。アノテーションプロセスには、ラベルの正確性のチェックや、曖昧または低品質のクリップの除去を含む、複数段階の品質管理が含まれていました。最終データセットには600クラスが含まれ、各クラスには少なくとも600本のクリップがあり、カテゴリ間でバランスの取れた分布が確保されています。クリップの総数は約48万本で、トレイン/バリデーション/テストの分割はおおよそ70/10/20パーセントです。

Kinetics-400およびKinetics-700との関係

Kinetics-600は、元のKinetics-400(2017年に導入された400クラス)と後のKinetics-700(2019年にリリースされた700クラス)の間の中間バージョンです。Kinetics-400と比較して、Kinetics-600は200の新しい行動クラスを追加し、より細かい活動やインタラクションを含んでいます。また、このデータセットは、モデル間の公平な比較を容易にするために、固定されたバリデーションクリップのセットを備えた、より厳格な検証プロトコルを導入しました。Kinetics-700はさらにクラス数を拡大し、未見の期間への一般化を評価するための時間的スプリットを導入しました。

ビデオ理解への影響

Kinetics-600は、ビデオ行動認識の標準的なベンチマークとなり、3D畳み込みネットワークやビデオトランスフォーマーなどのアーキテクチャの進歩を促進しました。Kinetics-600で事前トレーニングされたモデルは、ビデオキャプショニングや時空間行動検出などの下流タスクのための特徴抽出器としてしばしば機能します。このデータセットの多様性は、外観と動きの両方の手がかりを捉える方法の開発を促し、精度と堅牢性の向上につながりました。2025年時点で、最先端のモデルはバリデーションセットで90%以上のトップ1精度を達成しており、初期のベースラインからの大幅な改善となっています。

制限と批判

その成功にもかかわらず、Kinetics-600は、YouTube由来のデータに固有のバイアス、例えば地理的および文化的な偏りがある可能性があると批判されてきました。行動クラスは主に西洋中心であり、それに基づいてトレーニングされたモデルの他の地域への一般化を制限する可能性があります。さらに、このデータセットは短い単一行動のクリップに焦点を当てており、長期的な活動やマルチラベルシナリオの複雑さを完全には捉えていません。研究者は、これらのギャップの一部に対処するために、Something-SomethingやMoments in Timeなどの補完的なデータセットを提案しています。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:video-dataset·action-recognition·computer-vision·benchmark
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴