Charades는 일상 활동 인식을 위한 대규모 데이터셋으로, 267명의 사용자로부터 수집된 9,848개의 비디오로 구성되어 있다. 이 데이터셋은 2016년 카네기 멜론 대학교와 토론토 대학교의 연구자들에 의해 소개되었으며, 가정 환경에서 수행되는 일상적인 행동을 인식하는 데 초점을 맞춘다. 각 비디오는 여러 개의 행동 레이블로 주석이 달려 있어, 컴퓨터 비전 분야에서 머신 러닝 모델을 훈련하고 평가하기 위한 풍부한 자원을 제공한다.
이 데이터셋은 종종 연출되거나 대본이 있는 행동을 특징으로 했던 초기 활동 인식 벤치마크의 한계를 해결하기 위해 만들어졌다. Charades는 요리, 청소, 독서와 같은 자발적이고 대본이 없는 활동을 포착하여 실제 세계 응용 프로그램에 더 현실적인 벤치마크를 제공한다. 비디오에는 텍스트 설명과 행동 레이블이 함께 제공되어 시각적 인식과 언어 접지 모두에서 연구를 가능하게 한다.
데이터셋 구성
Charades는 평균 지속 시간이 약 30초인 9,848개의 비디오를 포함하며, 총 약 82시간의 영상으로 이루어져 있다. 데이터셋에는 "냉장고 열기," "TV 시청," "전화 사용"과 같은 광범위한 일상 활동을涵盖하는 157개의 행동 클래스가 포함된다. 각 비디오에는 여러 개의 행동 인스턴스가 주석으로 달려 있으며, 주석에는 시간적 경계가 포함되어 프레임 수준의 행동 인식을 가능하게 한다.
비디오는 Amazon Mechanical Turk를 통해 수집되었으며, 참가자들은 자신의 집에서 활동을 수행하는 모습을 녹화하도록 요청받았다. 이 크라우드소싱 접근 방식은 다양한 환경, 조명 조건, 카메라 각도를 초래하여 인식 작업의 난이도를 높인다. 데이터셋에는 비디오 캡셔닝 및 검색과 같은 작업에 사용되는 27,847개의 비디오 설명도 포함된다.
평가 및 벤치마크
Charades는 특히 딥 러닝 기반의 행동 인식 모델을 벤치마킹하는 데 일반적으로 사용된다. 표준 평가 지표는 모든 행동 클래스에 걸친 평균 정밀도(mAP)이며, 비디오 수준에서 계산된다. 연구자들은 종종 7,984개의 훈련 비디오와 1,864개의 테스트 비디오를 포함하는 Charades v1 분할에 대한 결과를 보고한다.
여러 주목할 만한 모델이 Charades에서 평가되었으며, 여기에는 two-stream convolutional networks, temporal segment networks, 그리고 최근에는 transformer 기반 아키텍처가 포함된다. 이 데이터셋은 각 비디오에 여러 동시 행동이 포함될 수 있으므로 다중 레이블 분류를 연구하는 데에도 사용되었다. 2025년 기준으로 최첨단 모델은 60% 이상의 mAP 점수를 달성하지만, 데이터셋은 현실적이고 노이즈가 많은 특성으로 인해 여전히 도전적이다.
인공지능 응용 분야
Charades는 Artificial intelligence 연구, 특히 Machine learning 및 Deep learning 분야를 발전시키는 데 중요한 역할을 해왔다. 이는 감시, 인간-컴퓨터 상호작용, 로봇 공학과 같은 응용 프로그램의 핵심 구성 요소인 비디오 이해 모델을 훈련하는 데 널리 사용된다. 데이터셋은 또한 Neural network 아키텍처, 특히 Residual Network (ResNet) 및 Transformer (architecture) 모델 연구를 지원한다.
행동 인식 외에도 Charades는 모델이 비디오에서 행동이 발생하는 시점을 식별해야 하는 시간적 행동 로컬라이제이션과 같은 작업에 사용되었다. 또한 시각적 및 텍스트 정보를 결합하는 다중 모달 학습에도 활용되었다. 데이터셋의 주석은 비디오 캡셔닝을 위한 Sequence-to-Sequence (Seq2Seq) 모델 연구를 가능하게 하며, 여기서 목표는 활동에 대한 자연어 설명을 생성하는 것이다.
관련 데이터셋 및 영향
Charades는 UCF101, ActivityNet, Kinetics를 포함한 더 넓은 활동 인식 데이터셋 계열의 일부이다. 종종 짧고 잘린 클립을 특징으로 하는 이러한 데이터셋과 달리, Charades는 실제 세계 조건을 더 잘 반영하는 더 길고 잘리지 않은 비디오를 제공한다. 이는 시간적 의존성과 노이즈 입력을 처리할 수 있는 강력한 모델을 개발하는 데 귀중한 자원이 되었다.
이 데이터셋은 수백 개의 연구 논문에서 인용되었으며, egocentric 비디오에 초점을 맞춘 Charades-Ego 데이터셋과 같은 후속 벤치마크의 설계에 영향을 미쳤다. Charades는 또한 ActivityNet Large Scale Activity Recognition Challenge를 포함한 주요 학회의 챌린지에서 사용되어 학계와 산업계 간의 협력을 촉진했다.
한계 및 향후 방향
강점에도 불구하고 Charades에는 한계가 있다. 비디오는 비전문가에 의해 녹화되어 품질의 변동성과 occasional 주석 오류가 발생한다. 행동 클래스는 일상 활동으로 제한되어 스포츠나 의료 절차와 같은 다른 영역으로 일반화되지 않을 수 있다. 또한 데이터셋은 최신 벤치마크에 비해 상대적으로 작아 매우 큰 모델의 훈련을 제한할 수 있다.
향후 연구는 데이터셋을 확장하거나 합성 데이터와 결합하여 이러한 한계를 해결할 수 있다. Generative AI 및 Large language model의 부상은 모델이 시각적 및 텍스트 정보를 모두 이해해야 하는 다중 모달 추론 작업에 Charades를 사용할 수 있는 새로운 경로를 열었다. 2025년 기준으로 Charades는 비디오 이해의 진전을 평가하기 위한 표준 벤치마크로 남아 있다.
같이 보기
- Machine learning
- Deep learning
- Computer vision
- video-understanding