Kinetics-700 es un conjunto de datos a gran escala para el reconocimiento de acciones en video, que contiene 700 clases de acciones humanas y aproximadamente 650,000 clips de video. Fue presentado en 2019 por investigadores de DeepMind (ahora parte de Google DeepMind) como sucesor de los conjuntos de datos anteriores Kinetics-400 y Kinetics-600. El conjunto de datos se utiliza ampliamente como punto de referencia para entrenar y evaluar modelos de aprendizaje profundo en tareas de comprensión de video, como la clasificación de acciones y la localización temporal.
Los videos en Kinetics-700 provienen de clips de YouTube disponibles públicamente, cada uno recortado a una duración fija de 10 segundos. Las clases de acciones cubren una amplia gama de actividades humanas cotidianas, incluyendo deportes, cocina, cuidado personal e interacciones sociales. Cada clase contiene entre 600 y 1,000 clips de video, lo que garantiza una distribución equilibrada entre categorías. El conjunto de datos se divide en conjuntos de entrenamiento, validación y prueba, con las etiquetas del conjunto de prueba retenidas para la evaluación oficial.
Construcción y Anotación
La construcción de Kinetics-700 siguió un flujo de trabajo semiautomatizado. Los videos candidatos se recuperaron inicialmente mediante consultas de búsqueda para cada clase de acción, y luego se filtraron mediante una combinación de comprobaciones automatizadas y anotación humana. Los anotadores verificaron que cada clip representara correctamente la acción objetivo, y los clips ambiguos o de baja calidad fueron descartados. El conjunto de datos final se curó para garantizar la consistencia temporal, con cada clip conteniendo una única acción claramente identificable.
En comparación con sus predecesores, Kinetics-700 introdujo un conjunto más diverso de clases de acciones, incluyendo distinciones de grano fino como "tocar el acordeón" frente a "tocar la armónica". Esta mayor granularidad plantea un desafío mayor para los modelos, que requieren capturar señales sutiles de movimiento y contexto.
Impacto en la Investigación de Reconocimiento de Video
Kinetics-700 se ha convertido en un punto de referencia estándar en el campo del reconocimiento de acciones en video. Se utiliza comúnmente para preentrenar modelos en datos de video a gran escala antes de ajustarlos en tareas posteriores, como la localización de acciones espaciotemporales o la generación de descripciones de video. El conjunto de datos ha impulsado el progreso en arquitecturas como redes residuales 3D y transformadores de video, que han logrado resultados de vanguardia en su conjunto de validación.
Los investigadores también han utilizado Kinetics-700 para estudiar la generalización de los modelos de video en diferentes dominios. Por ejemplo, se ha demostrado que los modelos entrenados en Kinetics-700 se transfieren bien a otros conjuntos de datos de video, como Something-Something y UCF101, cuando se ajustan adecuadamente. La escala y diversidad del conjunto de datos lo han convertido en un recurso clave para avanzar en los enfoques de aprendizaje automático para la comprensión de video.
Evaluación y Métricas
La evaluación estándar en Kinetics-700 utiliza la precisión top-1 y top-5 en el conjunto de validación. Debido a que las etiquetas del conjunto de prueba no se publican públicamente, la mayoría de los resultados publicados informan la precisión de validación. El protocolo de evaluación oficial requiere que los modelos predigan una sola etiqueta de acción para cada clip de 10 segundos, sin localización temporal. Esta configuración enfatiza la capacidad de reconocer acciones a partir de segmentos de video cortos y recortados.
En la práctica, muchos modelos logran una precisión top-1 en el rango del 70-80% en Kinetics-700, con las arquitecturas de mejor rendimiento que incorporan modelado temporal multiescala y mecanismos de atención. El conjunto de datos también respalda la evaluación del aprendizaje de representaciones de video, donde los modelos se preentrenan en Kinetics-700 y luego se evalúan en otras tareas mediante sondeo lineal o ajuste fino.
Limitaciones y Consideraciones
A pesar de su utilidad, Kinetics-700 tiene limitaciones conocidas. El conjunto de datos está sesgado hacia acciones que están bien representadas en YouTube, lo que puede no reflejar la diversidad completa de actividades humanas en entornos del mundo real. Además, la duración del clip de 10 segundos puede ser insuficiente para acciones que se desarrollan en escalas de tiempo más largas, como cocinar una comida o ensamblar muebles. Los investigadores han señalado que la distribución de clases del conjunto de datos puede llevar a modelos que son excesivamente sensibles al contexto de fondo en lugar de a la acción en sí.
También surgen preocupaciones de privacidad y ética por el uso de videos de YouTube disponibles públicamente, ya que las personas pueden aparecer sin consentimiento explícito. El conjunto de datos está destinado a fines de investigación, y se anima a los usuarios a considerar estos problemas al implementar modelos entrenados en él.
Conjuntos de Datos Relacionados y Extensiones
Kinetics-700 es parte de una familia más amplia de conjuntos de datos Kinetics, incluyendo Kinetics-400, Kinetics-600 y el más reciente Kinetics-700-2020, que actualizó la lista de clases y añadió nuevos clips. Otros puntos de referencia relacionados, como Something-Something y ActivityNet, se centran en diferentes aspectos de la comprensión de video, como las interacciones de objetos de grano fino o la detección de actividades temporales. Las técnicas de aumento de datos desarrolladas para Kinetics-700 también han influido en otros conjuntos de datos de video y en los flujos de trabajo de entrenamiento de modelos.