Places365은 장면 인식을 위한 대규모 데이터셋으로, 365개의 서로 다른 장면 범주에 속하는 180만 개 이상의 이미지를 포함하고 있습니다. 이 데이터셋은 2016년 매사추세츠 공과대학교(MIT)의 연구진인 보레인 저우(Bolei Zhou), 아디티야 코슬라(Aditya Khosla), 오드 올리바(Aude Oliva), 안토니오 토랄바(Antonio Torralba)에 의해 소개되었습니다. 이 데이터셋은 컴퓨터 비전 분야, 특히 이미지가 촬영된 맥락이나 환경을 식별하는 장면 이해 분야를 발전시키기 위해 설계되었습니다. Places365는 장면 분류 작업에서 딥러닝 모델의 성능을 평가하는 표준 벤치마크가 되었으며, ImageNet과 같은 객체 중심 데이터셋을 보완합니다.
이 데이터셋은 Places365-Standard와 Places365-Challenge의 두 가지 버전으로 구성됩니다. Places365-Standard는 약 180만 개의 훈련 이미지를 포함하며, 각 범주는 3,000개에서 5,000개 사이의 이미지를 가집니다. Places365-Challenge는 800만 개 이상의 훈련 이미지를 포함하는 더 큰 버전으로, 2016년 컴퓨터 비전 및 패턴 인식 학회(CVPR)에서 열린 Places Challenge 대회에 사용되었습니다. 이미지는 웹에서 수집되었으며 "산", "해변"과 같은 자연 장면부터 "주방", "사무실"과 같은 실내 환경까지 365개의 장면 범주 중 하나로 주석이 달려 있습니다. 이러한 범주는 이전의 Places205 데이터셋의 확장판인 Places2 데이터셋에서 파생되었습니다.
개발 및 동기
Places365는 포괄적인 장면 인식 데이터셋에 대한 필요성을 해결하기 위해 만들어졌습니다. 객체 인식은 ImageNet과 같은 데이터셋으로 상당한 진전을 이루었지만, 장면 이해는 상대적으로 발전이 더뎠습니다. MIT 연구진은 장면 분류를 위한 신경망 모델 훈련을 지원할 수 있는 대규모의 다양하고 잘 주석이 달린 데이터셋을 제공하는 것을 목표로 했습니다. 이 데이터셋은 웹에서 이미지를 수집한 후 자동 및 수동 주석 방식을 결합하여 구축되었습니다. 최종적으로 선택된 365개의 범주는 일상적인 환경의 광범위한 범위를 포괄하도록 결정되었으며, 이를 통해 Places365로 훈련된 모델이 자율 주행, 로봇 공학, 이미지 검색과 같은 실제 응용 분야에 일반화될 수 있도록 했습니다.
Places365의 개발은 Places205 데이터셋과 Places2 데이터셋을 포함하는 더 광범위한 Places 데이터베이스 구축 노력의 일환이었습니다. Places205는 2014년에 소개되었으며 205개의 장면 범주를 포함하여 예비 벤치마크로 사용되었습니다. Places365는 이를 365개 범주로 확장하여 장면 유형을 더 포괄적으로 다루었습니다. 이 데이터셋은 연구 커뮤니티에서 널리 채택되었으며, 그 공개는 장면 인식 알고리즘의 수많은 발전을 촉진했습니다.
구조 및 내용
Places365는 전처리 후 일반적으로 224×224 픽셀의 다양한 해상도의 이미지로 구성됩니다. 각 이미지는 단일 장면 범주로 레이블이 지정되어 단일 레이블 분류 작업을 구성합니다. 데이터셋은 훈련 세트, 검증 세트, 테스트 세트를 포함합니다. 검증 및 테스트 세트는 범주당 50개의 이미지를 가지며, 훈련 세트는 범주당 수천 개의 이미지를 가집니다. 이미지는 JPEG 형식으로 저장되며 범주별 디렉토리로 구성됩니다.
Places365의 주목할 만한 특징은 개별 객체보다는 장면 수준의 맥락에 초점을 맞춘다는 점입니다. 이는 객체 인식 데이터셋과 구별되는 점으로, 모델이 전반적인 환경을 인식하는 방법을 학습해야 합니다. 데이터셋은 또한 의미론적 계층 구조를 포함하여 365개 범주를 "실내", "자연 실외", "인공 실외"와 같은 16개의 상위 범주로 그룹화합니다. 이 계층 구조는 모델 성능의 더 체계적인 평가와 분석을 가능하게 합니다.
응용 및 영향
Places365는 장면 분류를 위한 머신러닝 연구, 특히 합성곱 신경망(CNN) 훈련에 광범위하게 사용되었습니다. ResNet 및 DenseNet과 같은 많은 최첨단 모델이 Places365에서 평가되었으며, 이 데이터셋은 다양한 아키텍처를 비교하는 벤치마크 역할을 했습니다. 분류 외에도 Places365는 장면 파싱, 의미론적 분할, 전이 학습과 같은 작업에 사용되었습니다. 예를 들어, Places365에서 사전 훈련된 모델은 객체 감지 및 이미지 캡셔닝을 포함한 다른 비전 작업에 미세 조정되었습니다.
이 데이터셋은 또한 산업계의 인공지능 시스템 개발에 영향을 미쳤습니다. Google DeepMind 및 OpenAI와 같은 기업들은 자사 모델에 장면 이해 기능을 통합했으며, Places365는 대규모 비전 모델의 성능을 평가하는 데 사용되었습니다. 또한 이 데이터셋은 인간의 장면 인식에 대한 연구에도 활용되어 인간이 환경을 범주화하는 방식에 대한 통찰력을 제공했습니다.
한계 및 향후 방향
성공에도 불구하고 Places365에는 몇 가지 한계가 있습니다. 이미지가 웹에서 수집되었기 때문에 데이터셋은 서양 및 영어권 맥락에 편향되어 있어 전 세계 모든 환경을 동등하게 대표하지 못할 수 있습니다. 또한 단일 레이블 형식은 종종 여러 개의 겹치는 맥락을 포함하는 실제 장면의 복잡성을 완전히 포착하지 못합니다. 연구자들은 다중 레이블 장면 데이터셋과 더 다양한 지리적 범위를 가진 데이터셋과 같은 확장 및 대안을 제안했습니다. 생성형 AI 및 대규모 언어 모델이 계속 발전함에 따라, 장면 이해를 활용하여 다중 모달 모델을 향상시키는 데 대한 관심이 증가하고 있으며, Places365는 이러한 시스템을 훈련하고 평가하는 데 여전히 중요한 자원으로 남아 있습니다.