Kinetics-700 é um conjunto de dados em grande escala para reconhecimento de ações em vídeo, contendo 700 classes de ações humanas e aproximadamente 650.000 clipes de vídeo. Foi introducido em 2019 por pesquisadores da DeepMind (agora parte de Google DeepMind) como sucessor dos conjuntos de dados anteriores Kinetics-400 e Kinetics-600. O conjunto de dados é amplamente utilizado como referência para treinar e avaliar modelos de aprendizaje profundo em tarefas de compreensão de vídeo, como classificação de ações e localização temporal.
Os vídeos em Kinetics-700 são obtidos de clipes do YouTube disponíveis publicamente, cada um editado para uma duração fixa de 10 segundos. As classes de ações cobrem uma amplia gama de atividades humanas cotidianas, incluindo esportes, culinária, cuidados pessoais e interações sociais. Cada classe contém entre 600 e 1.000 clipes de vídeo, garantindo uma distribuição equilibrada entre categorias. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com os rótulos do conjunto de teste retidos para avaliação oficial.
Construção e Anotação
A construção de Kinetics-700 seguiu um pipeline semiautomático. Vídeos candidatos foram inicialmente recuperados usando consultas de pesquisa para cada classe de ação e, em seguida, filtrados através de uma combinação de verificações automatizadas e anotação humana. Os anotadores verificaram que cada clipe representava corretamente a ação alvo, e clipes ambíguos ou de baixa qualidade foram descartados. O conjunto de dados final foi curado para garantir consistência temporal, com cada clipe contendo uma única ação claramente identificável.
Comparado aos seus predecessores, Kinetics-700 introdujo um conjunto mais diverso de classes de ações, incluindo distinções de grano fino como "tocar acordeón" versus "tocar armónica". Esta granularidad aumentada apresenta um desafío maior para os modelos, exigindo que capturen pistas sutiles de movimento e contexto.
Impacto na Pesquisa de Reconhecimento de Vídeo
Kinetics-700 se tornou um benchmark padrão no campo do reconhecimento de ações em vídeo. É comumente usado para pré-treinar modelos em dados de vídeo em grande escala antes de ajustar finamente em tarefas downstream, como localização de ações espaço-temporales ou legendas de vídeo. O conjunto de dados impulsionó o progresso em arquitecturas como redes residuais 3D e transformadores de vídeo, que alcanzaron resultados de última generación en su conjunto de validación.
Los investigadores también han usado Kinetics-700 para estudiar la generalización de los modelos de vídeo en diferentes dominios. Por ejemplo, se ha demostrado que los modelos entrenados en Kinetics-700 se transfieren bien a otros conjuntos de datos de vídeo, como Something-Something y UCF101, cuando se ajustan adecuadamente. La escala y diversidad del conjunto de datos lo han convertido en un recurso clave para avanzar en enfoques de aprendizaje automático para la comprensión de vídeo.
Evaluación y Métricas
La evaluación estándar en Kinetics-700 utiliza la precisión top-1 y top-5 en el conjunto de validación. Debido a que los rótulos del conjunto de prueba no se publican, la mayoría de los resultados publicados informan la precisión de validación. El protocolo de evaluación oficial requiere que los modelos predigan una única etiqueta de acción para cada clipe de 10 segundos, sin localización temporal. Este enfoque enfatiza la capacidad de reconocer acciones a partir de segmentos de vídeo cortos y recortados.
En la práctica, muchos modelos alcanzan una precisión top-1 en el rango de 70-80% en Kinetics-700, con las arquitecturas de mejor rendimiento que incorporan modelado temporal multiescala y mecanismos de atención. El conjunto de datos también admite la evaluación del aprendizaje de representaciones de vídeo, donde los modelos se pre-entrenan en Kinetics-700 y luego se evalúan en otras tareas mediante sondeo lineal o ajuste fino.
Limitaciones y Consideraciones
A pesar de su utilidad, Kinetics-700 tiene limitaciones conocidas. El conjunto de datos está sesgado hacia acciones que están bien representadas en YouTube, lo que puede no reflejar la diversidad completa de las actividades humanas en entornos del mundo real. Además, la duración del clipe de 10 segundos puede ser insuficiente para acciones que se desarrollan en escalas de tiempo más largas, como cocinar una comida o ensamblar muebles. Los investigadores han señalado que la distribución de clases del conjunto de datos puede llevar a modelos que son excesivamente sensibles al contexto de fondo en lugar de a la acción en sí.
También surgen preocupaciones de privacidad y ética por el uso de vídeos de YouTube disponibles públicamente, ya que los individuos pueden aparecer sin consentimiento explícito. El conjunto de datos está destinado a fines de investigación, y se anima a los usuarios a considerar estos problemas al implementar modelos entrenados en él.
Conjuntos de Datos Relacionados y Extensiones
Kinetics-700 es parte de una familia más amplia de conjuntos de datos Kinetics, incluidos Kinetics-400, Kinetics-600 y el más reciente Kinetics-700-2020, que actualizó la lista de clases y añadió nuevos clipes. Otros benchmarks relacionados, como Something-Something y ActivityNet, se centran en diferentes aspectos de la comprensión de vídeo, como interacciones de objetos de grano fino o detección de actividades temporales. Las técnicas de aumento de datos desarrolladas para Kinetics-700 también han influido en otros conjuntos de datos de vídeo y pipelines de entrenamiento de modelos.