Traduzido do inglês

Kinetics-600 é um conjunto de dados em larga escala para reconhecimento de ações em vídeo, contendo 600 classes de ações, introduzido em 2018 como uma extensão do [[kinetics-400|Kinetics-400]]. Ele fornece clipes diversificados do YouTube para treinar e avaliar modelos de compreensão de vídeo.

Kinetics-600 é um conjunto de dados em larga escala para reconhecimento de ações em vídeo, compreendendo aproximadamente 480.000 clipes de vídeo abrangendo 600 classes de ações humanas. Foi introduzido em 2018 por pesquisadores da DeepMind (agora parte do Google DeepMind) e da Universidade de Oxford, com base no conjunto de dados anterior Kinetics-400. O conjunto de dados é amplamente utilizado como referência para treinar e avaliar modelos de aprendizado profundo em tarefas de compreensão de vídeo.

Os clipes são provenientes do YouTube e retratam uma ampla gama de atividades humanas, desde ações cotidianas como 'escovar os dentes' até esportes e interações com objetos. Cada clipe é cortado para cerca de 10 segundos e rotulado com uma única classe de ação. O conjunto de dados é projetado para capturar a diversidade e a complexidade do movimento humano no mundo real, tornando-o um campo de teste desafiador para algoritmos de reconhecimento de ações.

Construção do Conjunto de Dados

O conjunto de dados Kinetics-600 foi criado por meio de um pipeline semiautomatizado. URLs de vídeos candidatos foram coletadas usando consultas de busca para cada classe de ação, e então anotadores humanos verificaram os clipes para garantir que eles retratassem corretamente a ação pretendida. O processo de anotação envolveu múltiplas etapas de controle de qualidade, incluindo a verificação da correção dos rótulos e a remoção de clipes ambíguos ou de baixa qualidade. O conjunto de dados final contém 600 classes, com cada classe tendo pelo menos 600 clipes, garantindo uma distribuição equilibrada entre as categorias. O número total de clipes é de aproximadamente 480.000, com uma divisão de treino/validação/teste de cerca de 70/10/20 por cento.

Relação com Kinetics-400 e Kinetics-700

Kinetics-600 é uma versão intermediária entre o Kinetics-400 original (400 classes, introduzido em 2017) e o Kinetics-700 posterior (700 classes, lançado em 2019). Em comparação com o Kinetics-400, o Kinetics-600 adiciona 200 novas classes de ação, incluindo atividades e interações mais refinadas. O conjunto de dados também introduziu um protocolo de validação mais rigoroso, com um conjunto fixo de clipes de validação para facilitar comparações justas entre modelos. O Kinetics-700 expandiu ainda mais o número de classes e introduziu uma divisão temporal para avaliar a generalização para períodos de tempo não vistos.

Impacto na Compreensão de Vídeo

Kinetics-600 tornou-se uma referência padrão para reconhecimento de ações em vídeo, impulsionando avanços em arquiteturas como redes convolucionais 3D e transformadores de vídeo. Modelos pré-treinados no Kinetics-600 frequentemente servem como extratores de características para tarefas downstream, como legendagem de vídeo e detecção de ações espaço-temporais. A diversidade do conjunto de dados incentivou o desenvolvimento de métodos que capturam tanto pistas de aparência quanto de movimento, levando a melhorias em precisão e robustez. Em 2025, modelos de última geração alcançam mais de 90% de precisão top-1 no conjunto de validação, uma melhoria significativa em relação às linhas de base iniciais.

Limitações e Críticas

Apesar de seu sucesso, o Kinetics-600 tem sido criticado por possíveis vieses inerentes aos dados provenientes do YouTube, como distorção geográfica e cultural. As classes de ação são predominantemente centradas no Ocidente, o que pode limitar a generalização de modelos treinados nele para outras regiões. Além disso, o conjunto de dados foca em clipes curtos de ação única, o que não captura totalmente a complexidade de atividades de longo prazo ou cenários de múltiplos rótulos. Pesquisadores propuseram conjuntos de dados complementares, como Something-Something e Moments in Time, para abordar algumas dessas lacunas.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:video-dataset·action-recognition·computer-vision·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico