Charades es un conjunto de datos a gran escala para el reconocimiento de actividades cotidianas, compuesto por 9,848 videos recopilados de 267 usuarios. El conjunto de datos fue introducido en 2016 por investigadores de la Universidad Carnegie Mellon y la Universidad de Toronto, y se centra en el reconocimiento de acciones cotidianas realizadas en entornos domésticos. Cada video está anotado con múltiples etiquetas de acción, lo que proporciona un recurso rico para entrenar y evaluar modelos de aprendizaje automático en el campo de la visión por computadora.
El conjunto de datos fue creado para abordar las limitaciones de los puntos de referencia anteriores de reconocimiento de actividades, que a menudo presentaban acciones escenificadas o guionizadas. Charades captura actividades espontáneas y no guionizadas, como cocinar, limpiar y leer, lo que lo convierte en un punto de referencia más realista para aplicaciones del mundo real. Los videos están acompañados de descripciones textuales y etiquetas de acción, lo que permite la investigación tanto en reconocimiento visual como en fundamentación del lenguaje.
Composición del conjunto de datos
Charades contiene 9,848 videos con una duración promedio de aproximadamente 30 segundos, totalizando alrededor de 82 horas de material. El conjunto de datos incluye 157 clases de acciones, que cubren una amplia gama de actividades diarias como "abrir un refrigerador", "ver televisión" y "usar un teléfono". Cada video está anotado con múltiples instancias de acción, y las anotaciones incluyen límites temporales, lo que permite el reconocimiento de acciones a nivel de fotograma.
Los videos fueron recopilados a través de Amazon Mechanical Turk, donde se pidió a los participantes que se grabaran realizando actividades en sus propios hogares. Este enfoque de crowdsourcing resultó en entornos, condiciones de iluminación y ángulos de cámara diversos, lo que aumenta la dificultad de la tarea de reconocimiento. El conjunto de datos también incluye 27,847 descripciones de videos, que se utilizan para tareas como la generación de subtítulos y la recuperación de videos.
Evaluación y puntos de referencia
Charades se utiliza comúnmente para evaluar modelos de reconocimiento de acciones, particularmente aquellos basados en aprendizaje profundo. La métrica de evaluación estándar es la precisión promedio media (mAP) en todas las clases de acciones, calculada a nivel de video. Los investigadores a menudo reportan resultados en la partición Charades v1, que incluye 7,984 videos de entrenamiento y 1,864 videos de prueba.
Varios modelos notables han sido evaluados en Charades, incluyendo redes convolucionales de dos flujos, redes de segmentos temporales y, más recientemente, arquitecturas basadas en transformadores. El conjunto de datos también se ha utilizado para estudiar la clasificación de múltiples etiquetas, ya que cada video puede contener múltiples acciones simultáneas. A partir de 2025, los modelos de última generación logran puntuaciones de mAP superiores al 60%, pero el conjunto de datos sigue siendo desafiante debido a su naturaleza realista y ruidosa.
Aplicaciones en inteligencia artificial
Charades ha desempeñado un papel significativo en el avance de la investigación en inteligencia artificial, particularmente en las áreas de aprendizaje automático y aprendizaje profundo. Se utiliza ampliamente para entrenar modelos de comprensión de videos, que es un componente clave de aplicaciones como la vigilancia, la interacción humano-computadora y la robótica. El conjunto de datos también respalda la investigación en arquitecturas de redes neuronales, incluidos los modelos de red residual y transformador.
Más allá del reconocimiento de acciones, Charades se ha utilizado para tareas como la localización temporal de acciones, donde los modelos deben identificar cuándo ocurren las acciones en un video. También se ha empleado en el aprendizaje multimodal, combinando información visual y textual. Las anotaciones del conjunto de datos permiten la investigación en modelos de secuencia a secuencia para la generación de subtítulos de videos, donde el objetivo es generar descripciones en lenguaje natural de las actividades.
Conjuntos de datos relacionados e impacto
Charades es parte de una familia más amplia de conjuntos de datos de reconocimiento de actividades, incluyendo UCF101, ActivityNet y Kinetics. A diferencia de estos conjuntos de datos, que a menudo presentan clips cortos y recortados, Charades proporciona videos más largos y sin recortar que reflejan mejor las condiciones del mundo real. Esto lo ha convertido en un recurso valioso para desarrollar modelos robustos que puedan manejar dependencias temporales y entradas ruidosas.
El conjunto de datos ha sido citado en cientos de artículos de investigación y ha influido en el diseño de puntos de referencia posteriores, como el conjunto de datos Charades-Ego, que se centra en videos egocéntricos. Charades también se ha utilizado en desafíos en conferencias importantes, incluido el Desafío de Reconocimiento de Actividades a Gran Escala de ActivityNet, fomentando la colaboración entre la academia y la industria.
Limitaciones y direcciones futuras
A pesar de sus fortalezas, Charades tiene limitaciones. Los videos son grabados por no profesionales, lo que lleva a variabilidad en la calidad y errores ocasionales de anotación. Las clases de acciones se limitan a actividades diarias, que pueden no generalizarse a otros dominios como deportes o procedimientos médicos. Además, el conjunto de datos es relativamente pequeño en comparación con puntos de referencia más nuevos, lo que puede limitar el entrenamiento de modelos muy grandes.
La investigación futura puede abordar estas limitaciones expandiendo el conjunto de datos o combinándolo con datos sintéticos. El auge de la IA generativa y los modelos de lenguaje grandes también ha abierto nuevas vías para utilizar Charades en tareas de razonamiento multimodal, donde los modelos deben comprender tanto información visual como textual. A partir de 2025, Charades sigue siendo un punto de referencia estándar para evaluar el progreso en la comprensión de videos.
Véase también
- aprendizaje automático
- aprendizaje profundo
- visión por computadora
- comprensión de videos