RefCOCO+는 컴퓨터 비전과 자연어 처리 분야에서 시스템이 텍스트 설명을 기반으로 이미지 내 특정 객체를 찾아야 하는 작업인 지시 표현 이해를 위한 벤치마크 데이터셋이다. 2016년 워싱턴 대학교 연구자들이 소개했으며, Microsoft COCO(Common Objects in Context) 데이터셋을 기반으로 구축되어 시각적 및 언어적 이해를 통합하는 모델의 표준 평가 기준으로 사용된다. 이 데이터셋은 위치 기반 제약에 중점을 둔 점에서 주목할 만하며, 이전 버전인 RefCOCO보다 더 어렵다. RefCOCO+는 19,000개 이상의 이미지와 140,000개 이상의 지시 표현을 포함하며, 각 표현에는 경계 상자 주석이 쌍으로 제공된다.
RefCOCO+의 주요 차별점은 인간 주석자가 특정 조건에서 생성한 지시 표현에 있다. 원래 RefCOCO 데이터셋에서는 표현에 모든 속성이 포함될 수 있었지만, RefCOCO+는 '왼쪽', '오른쪽', '위', '아래'와 같은 절대 위치 단어 사용을 금지한다. 대신 주석자는 상대적 공간 관계(예: '여자의 오른쪽에 있는 남자')와 색상, 크기, 행동과 같은 외형 기반 설명을 사용하도록 권장된다. 이러한 제약은 모델이 전역적 위치 단서에 의존하기보다 객체 속성과 객체 간 관계를 추론하도록 강제한다. 이 데이터셋은 Yu와 동료들이 만들었으며, 다양한 유형의 표현에 걸친 일반화를 테스트하는 새로운 평가 프로토콜도 도입했다.
데이터셋 구조 및 주석
이 데이터셋은 MS COCO train2014 및 val2014 분할을 기반으로 구축되어 다양한 일상 장면을 포함한다. 각 이미지에는 여러 객체가 포함되며, 지시 표현은 일반적으로 시각적으로 두드러진 객체 하위 집합에 제공된다. 주석에는 각 참조 객체에 대해 수동으로 그린 경계 상자와 표현 텍스트가 포함된다. 평균적으로 각 이미지에는 약 7.5개의 지시 표현이 있고, 각 표현에는 약 3.5개의 단어가 포함된다. 데이터셋은 훈련(90%), 검증(5%), 테스트(5%) 세트로 분할되며, 분할 간 이미지 중복이 없도록 신중하게 구성된다. 고유한 특징은 testA와 testB라는 두 개의 테스트 분할을 포함한다는 점으로, testA는 사람을 주요 초점으로 한 표현을 포함하고 testB는 비사람 객체에 초점을 맞춰 모델 성능의 세부 분석을 가능하게 한다.
작업 정의 및 평가 지표
핵심 작업은 입력 표현으로 설명된 객체를 정확히 포함하는 경계 상자를 출력하는 것이다. 정확도는 Intersection over Union(IoU) 지표로 측정되며, 예측 상자와 실제 상자 간의 IoU가 0.5를 초과하면 예측이 올바른 것으로 간주된다. 이 임계값 기반 평가는 지시 표현 데이터셋에서 표준이다. 연구자들은 종종 'IoU=0.5에서의 정확도'로 결과를 보고하며, 일부는 정밀도-재현율 곡선도 평가한다. 위치 제약으로 인해 모델은 언어적 구문 분석과 시각적 특징 추출을 효과적으로 결합해야 한다. 딥러닝 접근 방식, 특히 신경망을 사용하는 방식이 지배적이며, 관심 영역의 시각적 특징과 언어 임베딩을 융합하는 아키텍처가 사용된다.
방법론적 발전
출시 이후 RefCOCO+는 다중 모드 추론에서 상당한 진전을 이끌었다. 초기 방법은 Sequence-to-Sequence (Seq2Seq) 모델을 사용하여 공간 주의 맵을 생성했으며, 이후 작업은 Multi-Head Attention 메커니즘을 통합하여 단어와 이미지 영역을 정렬했다. 이 데이터셋은 작업을 접지 문제로 취급하는 트랜스포머 기반 비전-언어 모델 개발에 중요한 역할을 했다. 주목할 만한 기여로는 특징 추출을 위한 Residual Network (ResNet) 백본 사용과 훈련 안정화를 위한 Batch Normalization이 있다. 많은 최첨단 시스템은 대규모 이미지-텍스트 말뭉치에서 사전 훈련한 다음 RefCOCO+에서 미세 조정하며, 머신러닝을 활용한다. 2024년 기준으로 트랜스포머 인코더-디코더와 같은 트랜스포머 기반 아키텍처는 testA에서 85% 이상의 정확도를 달성하여 초기 기준선의 약 60%에 비해 상당한 개선을 보여준다.
다른 데이터셋과의 관계
RefCOCO+는 RefCOCO 및 RefCOCOg를 포함한 지시 표현 데이터셋 계열의 일부이며, 각각 고유한 제약이 있다. RefCOCOg는 위치 제한 없이 더 길고 자연스러운 표현을 제공하는 반면, RefCOCO+는 그 중간에 위치하여 복잡성과 실현 가능성의 균형을 맞춘다. 이 데이터셋은 공간 참조 이해가 중요한 인공지능 기반 자동 운전 및 보조 로봇 공학과 같은 시스템 수준 AI 응용 프로그램을 훈련하고 평가하는 데 널리 사용되었다. 그 설계는 에이전트가 3D 환경에서 지침을 따라야 하는 구현 AI를 포함한 후속 벤치마크에 영향을 미쳤다. 커뮤니티는 또한 모델이 보지 못한 객체 범주로 일반화할 수 있는지 테스트하는 퓨삿 및 제로샷 학습 연구에 RefCOCO+를 채택했다.
한계 및 향후 방향
유용성에도 불구하고 RefCOCO+에는 한계가 있다. 표현이 상대적으로 짧고 자연스러운 인간 담론의 복잡성이 부족하며, 데이터셋은 일반적인 객체 범주에 치우쳐 있다. 일부 비평가들은 위치 제약이 인위적으로 부과되어 작업이 실제 응용 프로그램과 덜 일치한다고 주장한다. 이러한 문제를 해결하기 위해 연구자들은 더 풍부한 주석이 있는 새 데이터셋을 제안했지만, RefCOCO+는 크기와 확립된 평가 프로토콜 덕분에 표준 벤치마크로 남아 있다. 향후 작업은 Large language model 구성 요소를 통합하여 더 다양한 표현을 생성하고 Data Augmentation 기술을 사용하여 견고성을 개선하는 것을 탐구한다. 2025년 기준으로 이 데이터셋은 이미지 편집 및 대화형 대화를 위한 Generative AI와 같은 새로운 영역과 함께 접지된 언어 이해의 진행 상황을 측정하는 기준점으로 계속 사용된다.