Traduzido do inglês

Kinetics-400 é um conjunto de dados em larga escala para reconhecimento de ações em vídeo, contendo 400 classes de ações humanas, introduzido pela DeepMind em 2017 para avançar a compreensão de vídeo em aprendizado de máquina e visão computacional.

Kinetics-400 é um conjunto de dados em larga escala para reconhecimento de ações em vídeos, contendo aproximadamente 306.245 clipes de vídeo abrangendo 400 classes de ações humanas. Foi introduzido por pesquisadores da DeepMind em 2017 e, desde então, tornou-se um padrão de referência para avaliar modelos de compreensão de vídeo em aprendizado de máquina e inteligência artificial. O conjunto de dados foca em ações humanas, variando de atividades cotidianas como "tocar guitarra" e "abraçar" a esportes e interações com objetos, oferecendo um conjunto diversificado de padrões visuais e de movimento.

O principal objetivo do Kinetics-400 é permitir o treinamento e a avaliação de modelos que possam reconhecer automaticamente ações em sequências de vídeo não editadas. Diferentemente de conjuntos de dados de imagens como o ImageNet, o Kinetics-400 captura a dinâmica temporal, tornando-se essencial para o desenvolvimento de algoritmos que compreendem movimento e contexto ao longo do tempo. Sua escala e diversidade fizeram dele um recurso fundamental para pesquisas em classificação de vídeos, aprendizado de características espaço-temporais e localização de ações.

Construção do Conjunto de Dados

O Kinetics-400 foi construído coletando vídeos do YouTube, com cada clipe durando aproximadamente 10 segundos. O conjunto de dados foi elaborado por meio de uma combinação de busca automatizada e anotação humana. Inicialmente, vídeos candidatos eram recuperados usando consultas para cada uma das 400 classes, e então anotadores humanos verificavam e rotulavam os clipes para garantir a precisão. Cada classe contém entre 400 e 1.150 clipes, totalizando cerca de 306.245 clipes no conjunto completo.

As ações cobrem uma ampla gama de categorias, incluindo "tocar bateria", "andar longboard", "cortar legumes" e "aperto de mão". O conjunto de dados é dividido em conjuntos de treino, validação e teste, com as etiquetas do conjunto de teste mantidas em sigilo para fins de avaliação. Para apoiar a reprodutibilidade, o conjunto de dados é lançado sob licença Creative Commons, permitindo que pesquisadores usem tanto para fins acadêmicos quanto comerciais.

Impacto na Compreensão de Vídeo

O Kinetics-400 influenciou significativamente o campo do reconhecimento de ações em vídeos. Antes de seu lançamento, conjuntos de dados como UCF-101 e HMDB-51 tinham menor tamanho e diversidade, limitando a capacidade dos modelos de generalizar. O Kinetics-400 proporcionou um conjunto maior e mais variado de ações, permitindo o desenvolvimento de arquiteturas, cada vez mais profundas e complexas. Este conjunto tem sido usado para pré-treino de modelos que posteriormente são ajustados para outros conjuntos menores, uma prática que se tornou padrão na análise de vídeos.

O conjunto de dados também impulsionou inovações em design de modelos. Por exemplo, a introdução de redes convolucionais 3D, como a I3D (ConvNet 3D Inflada), foi diretamente motivada pela necessidade de lidar com a escala do Kinetics-400. A I3D, que infla arquiteturas ResNet 2D para 3D, alcançou resultados de estado da arte no Kinetics-400 e estabeleceu um novo padrão para o campo. Modelos subsequentes, incluindo SlowFast e X3D, melhoraram ainda mais o desempenho neste conjunto de dados, demonstrando seu papel como impulsionador do progresso arquitetônico.

Extensões e Variantes

Após o sucesso do Kinetics-400, a mesma equipe da DeepMind lançou versões estendidas: Kinetics-600 e Kinetics-700, com 600 e 700 classes de ações, respectivamente. Esses conjuntos de dados maiores oferecem ainda mais diversidade e têm sido usados para treinar modelos com maior precisão. Além disso, o Kinetics-400 foi adaptado para outras tarefas, como localização temporal de ações e legenda de vídeos, adicionando anotações ou modificando protocolos de avaliação.

O Kinetics-400 também foi incorporado a benchmarks mais amplos. Por exemplo, o conjunto de dados Something-Something, que foca em interações humano-objeto de granularidade fina, como complemento ao Kinetics-400, e ambos são frequentemente usados juntos para avaliar a generalização dos modelos. A influência do conjunto de dados se estende além da academia, com laboratórios da indústria como OpenAI e Anthropic o usando para avaliar seus modelos de vídeo, embora normalmente não divulguem seus detalhes exatos de treinamento.

Limitações e Considerações

Apesar de sua utilidade, o Kinetics-400 tem limitações conhecidas. Os vídeos são originados do conteúdo do YouTube, o que introduz viés em termos de conteúdo, cultura e dados demográficos. As ações são frequentemente realizadas por indivíduos em contextos ocidentais, o que pode limitar a capacidade do modelo de generalizar para outros contexto. Além disso, a duração de clipe de 10 segundos não captura dependências temporais de longo prazo, e o processo de anotação, embora rigoroso, ainda pode conter erros, converter sua aplicação em desafios práticos.

Outra preocupação é o potencial para questões de privacidade e éica, pois o conjunto de dados inclui vídeos de pessoas sem consentimento explícito para uso em pesquisa. Pesquisadores têm abordado isso desenvolvendo diretrizes para conhecimento responsável, mas, em 2025, conjuntos de dados mais novos como Something-Something-v2 e Ego4D visam preencher essas lacunas, embora o Kinetics-400 permaneça um recurso amplamente utilizado e citado na área.

Ver Também

Referências

  • Kay, W., et al,. (2017). The Kinetics Human Action Video Dataset. arXiv preprint.
  • Carreira, J., & Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR.
  • Feichtenhofer, C., et al. (2019). SlowFast Networks for Video Recognition. ICCV.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:video-recognition·dataset·computer-vision·machine-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico