RefCOCOg는 컴퓨터 비전과 자연어 처리 분야의 벤치마크 데이터셋으로, 지시 표현 이해 및 생성 작업을 위해 설계되었다. 이 데이터셋은 기존 지시 표현 데이터셋의 한계, 특히 더 길고 설명적이며 맥락 의존적인 언어의 필요성을 해결하기 위해 도입되었다. 이 데이터셋은 시각 정보와 언어적 설명을 정렬해야 하는 모델에게 도전적인 테스트 환경을 제공하며, 이는 인간-로봇 상호작용, 이미지 편집, 시각 질의 응답과 같은 응용 분야의 핵심 능력이다.
이 데이터셋은 Microsoft COCO(Common Objects in Context) 데이터셋에서 수집된 26,711개의 이미지에 있는 54,822개의 객체에 대한 104,560개의 지시 표현을 포함한다. RefCOCOg의 주요 특징은 표현이 RefCOCO와 같은 이전 데이터셋보다 더 길고 자연스러우며, 종종 장면 내 여러 객체 간의 관계를 이해해야 한다는 점이다. 예를 들어, "빨간 차 옆에 서 있는 파란 셔츠를 입은 남자"와 같은 표현은 주요 객체와 그 관계적 맥락을 모두 근거로 삼아야 한다.
구축 및 주석
RefCOCOg는 연구자 팀에 의해 만들어졌으며, 주석 과정에는 이미지 내에서 대상 객체를 고유하게 식별하는 설명을 작성하도록 요청받은 인간 주석자가 참여했다. 주석은 크라우드소싱 플랫폼을 통해 수집되었으며, 각 표현은 모호함이 없도록 검증되었다. 데이터셋은 훈련, 검증, 테스트 세트로 분할되며, 테스트 세트는 주석자가 훈련 중에 이미지를 보았는지 여부에 따라 두 개의 하위 집합('refexp' 및 'refexp+')으로 더 나뉜다. 이러한 분할 설계는 보지 못한 주석자와 언어 스타일에 대한 일반화를 평가하는 데 도움이 된다.
작업 구성
RefCOCOg와 관련된 주요 작업은 지시 표현 이해로, 모델이 이미지와 텍스트 설명을 받아 설명된 객체를 국소화하며, 일반적으로 경계 상자 또는 분할 마스크를 예측한다. 관련 작업으로는 지시 표현 생성이 있으며, 모델이 이미지의 주어진 객체에 대한 자연어 설명을 생성해야 한다. 두 작업 모두 표준 지표로 평가된다: 이해에는 교차-합집합(IoU), 생성에는 CIDEr 또는 BLEU와 같은 지표가 사용된다.
모델 개발에 미치는 영향
RefCOCOg는 특히 Transformer (architecture) 아키텍처와 Multi-Head Attention 메커니즘에 기반한 딥러닝 모델을 훈련하고 평가하는 데 널리 사용되었다. 초기 접근 방식은 언어 인코딩을 위한 순환 신경망과 결합된 Residual Network (ResNet) 백본을 시각 특징 추출에 사용했다. 더 최근의 시스템은 Large language model과 Vision-language model을 활용하며, 종종 Cross-Attention 레이어를 통합하여 시각 및 텍스트 양식을 융합한다. 더 긴 표현에 대한 데이터셋의 강조는 단순한 객체 탐지를 넘어 공간 관계, 속성, 맥락에 대해 추론할 수 있는 모델 개발을 촉진했다.
다른 데이터셋과의 관계
RefCOCOg는 비슷한 시기에 도입된 RefCOCO 및 RefCOCO+를 포함한 지시 표현 데이터셋 계열의 일부이다. RefCOCO는 더 짧고 간결한 표현에 초점을 맞추는 반면, RefCOCO+는 위치 단어를 피하고 외양 기반 설명으로 표현을 제한한다. RefCOCOg는 종종 전체적인 장면 이해를 요구하는 더 길고 대화적인 설명으로 구별된다. 이 데이터셋들은 함께 이 분야의 표준 벤치마크가 되었으며, 각각에 대한 최첨단 성능을 추적하는 리더보드가 있다.
과제 및 한계
유용성에도 불구하고 RefCOCOg에는 알려진 한계가 있다. 이 데이터셋은 MS COCO에서 파생되었으며, 이는 일반적인 객체 범주와 일상적인 장면에 편향되어 다양성이 제한될 수 있다. 표현이 더 길지만, 제스처나 공유 지식 사용과 같은 실제 상호작용에서 인간 참조의 전체 복잡성을 포착하지 못할 수 있다. 또한 경계 상자 기반 평가는 거칠 수 있으며, 일부 표현은 인간에게도 모호할 수 있다. 연구자들은 이러한 격차를 해결하기 위해 확장 및 대체 데이터셋을 제안했지만, RefCOCOg는 근거 기반 언어 이해를 연구하기 위한 기초 자원으로 남아 있다.
같이 보기
참고 문헌
이 데이터셋은 Junhua Mao, Jonathan Huang, Alexander Toshev, Oana Camburu, Alan Yuille, Kevin Murphy가 2016년 유럽 컴퓨터 비전 학회(ECCV)에서 발표한 논문 "Grounded Language Understanding: Referring Expression Comprehension and Generation"에서 소개되었다.