ObjectNet은 2019년에 소개된 벤치마크 데이터셋으로, 실제 세계의 분포 변화(distribution shifts) 하에서 객체 인식 모델의 견고성을 평가하기 위해 설계되었다. ImageNet과 같은 표준 데이터셋은 종종 정형화된 시점과 깨끗한 배경을 가진 이미지를 포함하는 반면, ObjectNet은 의도적으로 일상적인 환경에서 촬영된 객체, 특이한 각도, 복잡한 배경, 회전된 방향의 이미지를 포함한다. 이 데이터셋은 313개의 객체 범주에 걸쳐 50,000개의 이미지로 구성되며, 각 이미지는 기존 데이터셋으로 훈련된 모델에 도전하도록 특별히 수집되었다. 주요 목적은 모델이 훈련 분포의 통계적 규칙성을 넘어 얼마나 잘 일반화하는지 측정하는 것이며, 이는 통제되지 않은 환경에서 Artificial intelligence 시스템을 배포하는 데 중요한 속성이다.
ObjectNet의 생성은 많은 최첨단 Deep learning 모델이 표준 벤치마크에서 높은 정확도를 달성하면서도 겉보기에 사소한 차이를 보이는 이미지에서 극적으로 실패한다는 관찰에서 동기가 부여되었다. 이 데이터셋은 MIT 컴퓨터 과학 및 인공지능 연구소(CSAIL)의 Andrei Barbu가 이끄는 팀과 다른 기관의 협력자들에 의해 설계되었다. 이미지는 크라우드소싱으로 수집된 후 객체 클래스, 시점, 배경, 회전에 대한 엄격한 기준을 충족하는지 확인하기 위해 필터링되었다. 각 이미지에는 객체의 회전, 장면 배경, 카메라 시점을 설명하는 메타데이터가 주석으로 달려 있어 연구자들이 실패 모드를 자세히 분석할 수 있다.
설계 및 수집
ObjectNet의 구축은 대규모 크라우드소싱 노력을 수반했다. 작업자들은 각 객체의 각도, 배경, 회전을 다양화하라는 특정 지침에 따라 집이나 기타 자연 환경에서 객체를 촬영하도록 요청받았다. 이 과정은 실제 장면의 자연적 변동성을 포착하기 때문에 일반적인 훈련 세트에 비해 진정으로 분포 외(out-of-distribution)인 이미지를 생성했다. 이 데이터셋은 313개의 범주를 포함하며, 많은 범주가 ImageNet 클래스와 겹치지만 이미지 자체는 완전히 새롭고 기존 데이터셋에서 가져온 것이 아니다. 각 이미지의 메타데이터에는 회전(이미지 평면에서 객체의 방향), 배경(주방, 욕실, 사무실과 같은 장면 유형), 시점(객체에 대한 카메라 각도)의 세 가지 주요 속성이 포함된다. 이러한 구조화된 주석은 다양한 유형의 분포 변화에 걸친 모델 성능의 세밀한 평가를 가능하게 한다.
모델 평가에 미치는 영향
ObjectNet이 공개되었을 때, 최첨단 모델의 중요한 취약점을 드러냈다. 예를 들어, ImageNet에서 인간 수준에 가까운 성능을 달성한 모델은 ObjectNet에서 정확도가 40퍼센트 포인트 이상 떨어질 수 있었다. 이러한 극명한 대비는 많은 모델이 강건한 시각적 특징을 학습하기보다는 배경 단서나 전형적인 객체 포즈와 같은 허위 상관관계에 의존하고 있음을 강조했다. 이 데이터셋은 ImageNet-C 및 ImageNet-A와 같은 다른 분포 외 데이터셋과 함께 견고성 연구의 표준 벤치마크로 빠르게 자리 잡았다. 연구자들은 ObjectNet을 사용하여 데이터 증강, 도메인 적응, 아키텍처 변경과 같은 기법을 평가했으며, 이를 통해 모델 일반화의 개선이 이루어졌다. 또한 이 데이터셋은 객체 인식에서 형태, 질감, 맥락의 역할을 이해하는 데 대한 관심을 촉발했으며, 연구에 따르면 모델은 종종 형태보다 질감을 우선시하며, ObjectNet의 다양한 조건이 이러한 편향을 드러내는 데 도움이 된다.
다른 벤치마크와의 관계
ObjectNet은 컴퓨터 비전 벤치마크 중에서 독특한 위치를 차지한다. 기존 이미지에 인공적인 노이즈나 블러를 적용하는 합성 손상 벤치마크와 달리, ObjectNet은 전적으로 자연 사진으로 구성되어 실제 세계 성능에 대한 더 현실적인 테스트를 제공한다. 이는 탐지 및 분할에 초점을 맞춘 COCO 및 Pascal VOC와 같은 벤치마크를 보완하며, 통제되면서도 자연스러운 분류 설정을 제공한다. 회전과 시점에 대한 데이터셋의 강조는 3D 객체 이해 및 Neural network 해석 가능성 연구와도 연결된다. 데이터셋이 ImageNet에 비해 상대적으로 작기 때문에 훈련 세트보다는 테스트 세트로 자주 사용되지만, 일부 연구에서는 견고성을 개선하기 위해 일부를 미세 조정하는 방법을 탐구했다.
한계 및 비판
기여에도 불구하고 ObjectNet에는 한계가 있다. 데이터셋의 313개 범주는 더 넓은 객체 분류 체계의 하위 집합이며, 일부 일반적인 클래스는 누락되어 있다. 크라우드소싱된 이미지의 특성상 배경과 시점의 분포가 모든 실제 세계 시나리오를 완전히 대표하지 못할 수 있으며, 주석 과정에 내재된 노이즈가 있다. 또한 ObjectNet이 가정 환경에서 수집되었기 때문에 산업, 실외, 극한 환경을 과소 대표할 수 있다. 일부 연구자들은 더 크고 다양한 데이터셋으로 훈련하면 데이터셋의 난이도를 부분적으로 완화할 수 있으며, 모델이 개선됨에 따라 ObjectNet과 표준 벤치마크 간의 격차가 좁혀지고 있다고 지적했다. 그럼에도 불구하고 ObjectNet은 모델을 스트레스 테스트하고 벤치마크 성능과 실제 세계 신뢰성 간의 격차를 이해하는 데 여전히 귀중한 도구로 남아 있다.
유산 및 지속적 사용
ObjectNet은 강건한 비전 시스템을 구축하기 위한 지속적인 노력에서 기준점이 되었다. 도메인 일반화, 적대적 견고성, 자기 지도 학습에 관한 논문에서 자주 인용된다. 데이터셋의 메타데이터는 회전이나 배경과 같은 특정 요인이 모델 성능에 미치는 영향에 대한 연구를 가능하게 했으며, 이는 더 탄력적인 아키텍처 설계에 정보를 제공하는 통찰력을 제공한다. 2020년대 중반 현재, ObjectNet은 학술 연구와 컴퓨터 비전 제품을 개발하는 산업 팀, 특히 새로운 시점과 복잡한 장면을 만나는 것이 일반적인 자율 주행, 로보틱스, 증강 현실 분야에서 계속 사용되고 있다. 이 데이터셋의 생성은 훈련 분포를 넘어 모델을 평가하는 것의 중요성을 강조했으며, Machine learning 커뮤니티에서 견고성과 분포 외 일반화를 최우선 과제로 삼는 더 넓은 변화에 기여했다.