영어에서 번역됨

EPIC-KITCHENS는 일상적인 주방 활동을 촬영한 대규모 자기중심적 비디오 데이터셋으로, 행동 인식 및 예측 연구를 발전시키는 데 사용됩니다.

EPIC-KITCHENS는 인공지능 연구, 특히 행동 인식과 행동 예측 분야를 위해 설계된 대규모 자아중심 비디오 데이터셋이다. 이 데이터셋은 머리 장착 카메라로 촬영된 일상적인 주방 활동의 1인칭(자아중심) 비디오 녹화물로 구성된다. 이는 1인칭 관점에서 인간과 객체 및 환경 간의 상호작용을 이해하는 알고리즘을 개발하고 평가하기 위한 풍부한 자원을 제공한다.

이 데이터셋은 2018년 브리스톨 대학교, 카타니아 대학교, 토론토 대학교 등의 협력으로 소개되었다. 32명의 참가자가 자신의 주방에서 촬영한 55시간 이상의 비디오를 포함하며, 다양한 요리 및 준비 작업을 포착한다. 비디오는 동작 레이블(예: '양파 자르기', '물 붓기')과 객체 경계 상자를 포함한 동사 및 명사 조합으로 밀집하게 주석 처리되어, 활동의 세밀한 분석을 가능하게 한다.

데이터 수집 및 주석

EPIC-KITCHENS 데이터셋은 참가자가 자연스러운 요리 세션 중에 착용한 머리 장착 카메라(예: GoPro)로 녹화되었다. 녹화는 참가자 자신의 집에서 이루어져 현실적이고 대본 없는 시나리오를 제공한다. 주석 과정은 각 비디오 프레임을 수동으로 동작 세그먼트로 레이블링하고, 동작의 시작 및 종료 시간을 식별하며, 사전 정의된 어휘에서 동사 및 명사 레이블을 할당하는 것을 포함한다. 또한 각 프레임에 객체 경계 상자가 주석 처리되어 객체 감지 및 추적 작업을 가능하게 한다.

데이터셋은 훈련 세트와 테스트 세트로 구성되며, 총 39,594개의 동작 세그먼트와 454,714개의 객체 경계 상자를 포함한다. 동작 레이블은 125개의 동사 클래스와 352개의 명사 클래스를 포함하여 가능한 동작의 큰 조합 공간을 제공한다.

벤치마크 작업 및 평가

EPIC-KITCHENS는 자아중심 비전 작업, 특히 행동 인식과 행동 예측의 표준 벤치마크가 되었다. 행동 인식은 주어진 비디오 세그먼트에서 수행되는 동작을 분류하는 것을 포함하며, 행동 예측은 동작이 발생하기 전에 다음 동작을 예측하는 것을 요구한다. 데이터셋은 객체 감지, 추적, 비디오 검색과 같은 작업도 지원한다.

평가 지표는 일반적으로 행동 인식의 top-1 및 top-5 정확도와 예측 작업의 평균 평균 정밀도(mAP)를 포함한다. 벤치마크는 CVPR 및 ECCV와 같은 주요 컴퓨터 비전 학회에서 개최된 EPIC-KITCHENS 행동 인식 챌린지를 포함한 여러 챌린지에서 사용되었다.

영향 및 응용

이 데이터셋은 자아중심 비전 연구를 크게 발전시켰으며 머신 러닝딥 러닝 커뮤니티에서 널리 채택되었다. 이는 1인칭 관점에서 인간 활동을 이해할 수 있는 모델의 개발을 가능하게 했으며, 이는 로봇 공학, 증강 현실, 보조 기술 응용에 중요하다. 예를 들어, 신경망 아키텍처와 같은 트랜스포머 기반 모델은 시간적 맥락과 다중 모달 정보를 활용하여 행동 예측을 위해 EPIC-KITCHENS에 적용되었다.

또한 EPIC-KITCHENS는 장기 비디오 이해와 오디오 및 모션과 같은 여러 모달리티의 통합 연구에 기여했다. 데이터셋의 현실적인 설정과 밀집한 주석은 실제 시나리오로 일반화하려는 모델을 훈련하고 평가하기 위한 귀중한 자원이 된다.

확장 및 관련 데이터셋

EPIC-KITCHENS의 성공에 이어, 같은 팀은 45명의 참가자로부터 100시간의 비디오와 추가 주석 및 더 큰 어휘를 포함하는 확장 버전인 EPIC-KITCHENS-100을 출시했다. 다른 관련 자아중심 데이터셋으로는 더 넓은 범위의 일상 활동을 다루는 Ego4D와 가정 환경에서 자아중심 행동 인식에 초점을 맞춘 Charades-Ego가 있다. 이러한 데이터셋은 집합적으로 자아중심 비디오 이해의 경계를 확장한다.

결론

EPIC-KITCHENS는 자아중심 비전 분야의 초석 데이터셋으로 남아 있으며, 행동 이해를 위한 독특하고 도전적인 벤치마크를 제공한다. 그 기여는 인공지능의 수많은 혁신을 촉진했으며 인간-컴퓨터 상호작용 및 지능형 시스템 연구에 계속 영향을 미치고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:egocentric-vision·dataset·action-recognition·computer-vision
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사