영어에서 번역됨

RefCOCO는 MS COCO 이미지에 자연어 구문과 경계 상자 주석을 기반으로 구축된 지시 표현 이해를 위한 데이터셋으로, 비전-언어 모델을 훈련하고 평가하는 데 사용됩니다.

RefCOCO는 컴퓨터 비전과 자연어 처리 분야에서 지시 표현 이해(referring expression comprehension) 작업을 위해 널리 사용되는 데이터셋이다. 이 데이터셋은 Microsoft Common Objects in Context(MS COCO) 데이터셋의 이미지로 구성되며, 각 이미지는 이미지 내 특정 객체를 식별하는 자연어 지시 표현과 해당하는 경계 상자 주석이 쌍으로 제공된다. 이 데이터셋은 언어를 시각적 객체에 연결하는 연구를 지원하기 위해 도입되었으며, 이는 언어를 통해 시각적 장면을 이해하고 상호작용해야 하는 시스템의 기본적인 능력이다.

이 데이터셋은 캘리포니아 대학교 버클리 캠퍼스의 연구자들이 만들었으며, 2014년에 처음 발표되었다. 약 19,000개의 이미지에 걸쳐 거의 20,000개의 객체에 대한 50,000개 이상의 지시 표현을 포함한다. 표현은 주석자가 이미지 내에서 객체를 고유하게 식별하는 방식으로 설명하는 게임 형태의 인터페이스를 통해 수집되었으며, 이는 구문이 맥락적으로 관련되고 판별력이 있도록 보장한다. RefCOCO는 주어진 구문으로 설명된 객체를 국소화하는 것을 목표로 하는 지시 표현 이해 모델을 평가하기 위한 표준 벤치마크가 되었다.

구조 및 주석

RefCOCO는 인스턴스 수준 분할 마스크를 제공하는 다양한 이미지 세트를 제공하는 MS COCO 데이터셋을 기반으로 구축되었다. RefCOCO의 지시 표현은 일반적으로 한 단어에서 몇 단어에 이르는 짧은 자연어 구문으로, 객체의 속성, 위치 또는 다른 객체와의 관계로 설명한다. 예를 들어, "왼쪽에 있는 빨간 차" 또는 "우산을 든 여자"와 같은 구문이 있을 수 있다. 각 표현은 지시된 객체를 밀접하게 둘러싸는 경계 상자와 쌍으로 제공된다. 주석은 훈련, 검증, 테스트 세트로 나뉘며, 테스트 세트는 서로 다른 유형의 표현에 대한 일반화를 평가하기 위해 두 개의 하위 세트(TestA 및 TestB)로 더 나뉜다.

주석 과정은 두 단계 접근 방식을 포함한다. 첫째, 주석자는 이미지를 보고 관심 있는 모든 객체를 식별하도록 요청받았으며, 이 객체들은 MS COCO 분류 체계의 범주로 레이블링되었다. 둘째, 별도의 주석자 그룹이 다른 사람이 객체를 고유하게 식별할 수 있는 방식으로 각 객체를 설명하도록 요청받았다. 이 과정은 표현이 자연스럽고 다양하며, 인간이 맥락에서 객체를 지칭하는 방식을 포착하도록 보장했다.

작업 정의

RefCOCO와 관련된 주요 작업은 지시 표현 이해(referring expression comprehension)이며, 시각적 접지(visual grounding)라고도 한다. 이미지와 자연어 표현이 주어지면 모델은 지시된 객체를 국소화하는 경계 상자를 출력해야 한다. 이 작업은 모델이 시각적 내용과 언어의 의미론(속성, 공간 관계, 객체 범주 포함)을 모두 이해해야 한다. RefCOCO는 또한 지시 표현 생성(referring expression generation)이라는 관련 작업을 지원하며, 여기서 모델은 이미지의 주어진 객체에 대한 자연어 설명을 생성해야 한다.

이해 작업의 평가 지표는 일반적으로 IoU > 0.5와 같은 다양한 Intersection over Union(IoU) 임계값에서의 정확도를 포함하며, 여기서 예측된 경계 상자는 실제 상자와 절반 이상 겹쳐야 한다. 이 지표는 국소화 정밀도와 방해 객체 중에서 대상 객체를 올바르게 식별하는 능력을 모두 측정한다.

영향 및 사용

RefCOCO는 비전-언어 이해 연구를 발전시키는 데 중요한 역할을 해왔다. 초기의 Deep learningNeural network 아키텍처 기반 접근 방식부터 최근의 Transformer (architecture) 기반 모델에 이르기까지 수많은 모델을 훈련하고 평가하는 데 사용되었다. 이 데이터셋은 또한 지시 표현의 스타일과 복잡성이 다른 RefCOCO+ 및 RefCOCOg와 같은 변형을 탄생시켰다. RefCOCO+는 위치 없이 외관을 설명하는 표현에 초점을 맞추는 반면, RefCOCOg는 더 길고 더 서술적인 구문을 포함한다.

이 데이터셋은 OpenAIGoogle DeepMind와 같은 조직에서 개발한 시각적 입력을 통합하는 Large language model 기반 시스템의 성능을 평가하기 위해 다른 벤치마크와 함께 자주 사용된다. 이는 이미지 캡셔닝, 시각적 질의 응답, 인간-로봇 상호작용과 같은 응용 프로그램에 중요한 언어를 시각적 데이터에 접지해야 하는 Generative AI 모델의 테스트베드 역할을 한다.

과제 및 한계

널리 사용됨에도 불구하고 RefCOCO에는 특정 한계가 있다. 이미지는 주로 일상적인 장면과 일반적인 객체를 포함하는 MS COCO에서 가져온 것으로, 도메인의 다양성을 제한한다. 지시 표현은 상대적으로 짧으며 화용적 또는 모호한 참조와 같은 자연어의 전체 복잡성을 포착하지 못할 수 있다. 또한 데이터셋은 특정 객체 범주와 공간 구성에 대한 편향이 있어, 이 데이터셋으로 훈련된 모델의 과적합으로 이어질 수 있다.

연구자들은 확장 버전을 만들거나 더 어려운 데이터셋에서 미세 조정하기 전에 RefCOCO를 사전 훈련 단계로 사용하여 이러한 문제 중 일부를 해결했다. 이 데이터셋은 시각적 접지의 핵심 능력을 평가하기 위한 표준으로 남아 있으며, 지속적인 사용은 Artificial intelligence 분야에서의 중요성을 반영한다.

관련 연구 및 확장

RefCOCO는 지시 표현 이해 및 생성 연구의 한 줄기를 고무시켰다. 많은 모델이 시각적 특징과 언어 임베딩을 결합하여 제안되었으며, 종종 주의 메커니즘을 사용하여 단어를 이미지 영역과 정렬한다. 이 데이터셋은 또한 맥락의 역할, 예를 들어 방해 객체가 이해 난이도에 미치는 영향을 연구하는 데 사용되었다. RefCOCOg와 같은 확장은 더 복잡한 표현을 제공하며, 비디오 또는 3D 장면의 지시 표현을 위한 다른 데이터셋도 만들어졌지만, RefCOCO는 여전히 기초적인 자원으로 남아 있다.

RefCOCO의 개발은 대규모 주석 데이터셋이 모델 훈련 및 평가에 중요한 Machine learningcomputer vision의 광범위한 추세와 일치한다. 이는 커뮤니티의 핵심 자원이었으며, 재현 가능한 비교를 가능하게 하고 다중 모달 이해의 발전을 주도했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·dataset·vision-language·referring-expression
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사