ActivityNet은 시간적 행동 위치 파악(temporal action localization)과 행동 인식(action recognition) 연구를 발전시키기 위해 설계된 대규모 비디오 데이터셋이다. 이 데이터셋은 밀집된 주석이 달린 비디오 세그먼트를 제공하여 모델이 비디오 내에서 어떤 행동이 발생하는지뿐만 아니라 언제 발생하는지도 식별할 수 있게 한다. 도입 이후, 이 데이터셋은 비디오 이해 알고리즘, 특히 행동이 더 긴 시퀀스에 포함된 잘리지 않은(untrimmed) 비디오를 다루는 작업을 평가하기 위한 표준 벤치마크가 되었다.
이 데이터셋은 2015년에 미시간 대학교(University of Michigan) 및 다른 기관의 연구자들에 의해 처음 공개되었으며, Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem, Juan Carlos Niebles가 주도했다. 초기 버전인 ActivityNet-200은 200개의 행동 클래스와 28,000개 이상의 비디오를 포함하며, 총 648,000개 이상의 시간적 주석을 제공한다. 비디오는 YouTube와 같은 공개 플랫폼에서 수집되었으며, 스포츠, 가사일, 사회적 상호작용과 같은 다양한 활동을 다룬다. 각 비디오에는 여러 행동 인스턴스가 주석으로 달려 있으며, 각 인스턴스는 시작 및 종료 시간을 가지므로 시간적 위치 파악을 위한 풍부한 ground truth를 제공한다.
구조 및 주석
ActivityNet은 훈련, 검증, 테스트의 세 가지 분할로 구성되며, 대략 50/25/25 비율로 분포한다. 주석은 JSON 형식으로 제공되며, 비디오 URL, 행동 레이블, 시간적 경계를 포함한다. 각 행동 인스턴스에는 주석 품질에 대한 신뢰도 점수도 포함된다. 행동 클래스는 "스포츠", "가사", "개인 관리"와 같은 범주로 계층적으로 구성되어, 모델을 다양한 세분화 수준에서 평가하는 데 도움이 된다.
ActivityNet의 주요 특징은 잘리지 않은 비디오에 초점을 맞춘다는 점으로, 이는 잘린 클립을 포함했던 UCF101이나 HMDB51과 같은 초기 데이터셋과 대조된다. 이러한 설계는 모델이 전체 시간적 맥락을 처리하도록 강제하여 작업을 더 현실적으로 만든다. 데이터셋에는 또한 200개 행동 중 어느 것에도 해당하지 않는 세그먼트를 위한 "배경" 클래스가 포함되어 있으며, 이는 위치 파악 모델을 훈련하는 데 중요하다.
벤치마크 작업
ActivityNet과 관련된 주요 작업은 시간적 행동 위치 파악과 행동 인식이다. 시간적 행동 위치 파악에서 모델은 잘리지 않은 비디오에서 각 행동 인스턴스의 시작 및 종료 시간과 행동 레이블을 예측해야 한다. 이는 일반적으로 0.5 및 0.75와 같은 다양한 시간적 Intersection over Union(IoU) 임계값에서 평균 정밀도(mean Average Precision, mAP)를 사용하여 평가된다. 반면 행동 인식은 비디오에서 지배적인 행동을 분류하는 것으로, 일반적으로 top-1 및 top-5 정확도로 평가된다.
ActivityNet은 또한 CVPR 및 ICCV와 같은 주요 컴퓨터 비전 학회와 함께 개최되는 연례 챌린지인 ActivityNet Large-Scale Activity Recognition Challenge를 주최한다. 이 챌린지는 학계 및 산업계 연구 그룹의 수많은 제출을 유치하여 해당 분야의 발전을 이끌었다. 수년에 걸쳐 데이터셋은 ActivityNet Captions 하위 집합과 같은 추가 주석으로 확장되었으며, 이는 비디오 세그먼트에 대한 자연어 설명을 제공하여 비디오 캡셔닝 및 밀집 비디오 캡셔닝 연구를 가능하게 한다.
컴퓨터 비전에 미친 영향
ActivityNet은 비디오 이해 모델의 발전에 상당한 영향을 미쳤다. 이 데이터셋은 전통적인 수작업 특징 기반 방법부터 현대의 딥러닝 접근 방식에 이르기까지 다양한 아키텍처를 훈련하고 평가하는 데 사용되었다. Boundary Matching Network(BMN) 및 ActionFormer와 같은 시간적 행동 위치 파악을 위한 많은 최첨단 모델이 ActivityNet에서 결과를 보고했다. 데이터셋은 또한 비디오 수준 레이블만으로 모델을 훈련하는 약지도(weakly-supervised) 위치 파악과 데이터의 대규모 특성을 고려한 효율적인 비디오 처리 연구를 촉진했다.
시간적 구조에 대한 데이터셋의 강조는 인공지능의 더 넓은 분야, 특히 감시를 위한 활동 인식, 인간-컴퓨터 상호작용, 자율 주행과 같은 영역에 기여했다. 또한 kinetics(제공된 목록에는 없지만 알려진 관련 데이터셋) 및 Something-Something (역시 목록에 없음)과 같은 다른 데이터셋과 함께 사용되어 더 포괄적인 벤치마크를 만드는 데 활용되었다.
한계 및 향후 방향
성공에도 불구하고 ActivityNet에는 한계가 있다. 비디오는 YouTube에서 수집되므로 콘텐츠와 품질 측면에서 편향이 발생할 수 있다. 행동 클래스는 사전 정의되어 있어 모든 가능한 인간 활동을 포함하지 못할 수 있다. 또한 시간적 주석은 수동으로 생성되므로 시간이 많이 걸리고 불일치가 있을 수 있다. 이러한 문제를 해결하기 위해 연구자들은 더 많은 비디오와 정제된 주석을 포함하는 ActivityNet-1.3과 같은 확장판을 제안했으며, 데이터 증강 기술을 사용하여 모델 견고성을 개선하는 방법을 탐구했다.
향후 작업은 ActivityNet을 오디오 또는 텍스트와 같은 다른 양식과 통합하여 다중 양식 벤치마크를 만드는 것을 포함할 수 있다. 대규모 언어 모델 및 트랜스포머 기반 아키텍처의 부상은 비디오 이해의 새로운 경로를 열었으며, ActivityNet은 이러한 새로운 방법에 대한 관련성 있는 테스트베드로 남아 있다. 분야가 비디오 질의 응답 및 장기 비디오 이해와 같은 더 복잡한 작업으로 이동함에 따라 ActivityNet과 같은 데이터셋은 이러한 과제를 해결하기 위해 진화할 가능성이 높다.
결론
ActivityNet은 컴퓨터 비전의 기초 자원으로서 시간적 행동 위치 파악을 위한 엄격한 벤치마크를 제공한다. 밀집된 주석과 현실적인 잘리지 않은 비디오는 비디오 이해 알고리즘을 평가하는 표준이 되었다. 정밀한 시간적 모델링을 가능하게 함으로써 자동화된 비디오 분석의 가능성의 경계를 넓혔으며, 이는 수많은 실세계 응용 분야에 영향을 미친다.