ReferIt는 이미지 내 특정 영역에 자연어 설명을 연결하는 작업인 지시 표현 접지(referring expression grounding)를 위한 데이터셋이다. 이 데이터셋은 시각적 접지, 인간-로봇 상호작용, 다중 모드 추론과 같은 분야의 연구를 촉진하기 위해 도입되었다. ReferIt은 이미지와 자연어 지시 표현을 짝지어 제공하며, 각 표현에 해당하는 대상 영역을 지정하는 경계 상자 주석을 포함한다.
이 데이터셋은 약 20,000개의 이미지와 130,000개 이상의 지시 표현으로 구성된다. 이미지는 ImageNet에서 수집되었으며, 표현은 협력적 인간-컴퓨터 게임을 통해 수집되어 사용된 언어가 자연스럽고 작업 지향적이며 실제 상호작용 시나리오를 반영하도록 보장했다. ReferIt의 각 표현은 해당 구문이 가리키는 실제 영역을 표시하는 분할 또는 경계 상자 주석과 짝지어진다.
작업 정의
지시 표현 접지 작업에서 모델은 이미지와 "테이블 위의 빨간 컵"과 같은 지시 표현을 입력으로 받는다. 목표는 설명과 일치하는 이미지 내 영역을 출력하는 것이다. 이 작업은 표현이 인간이 인식할 수 있는 모든 객체나 영역을 설명할 수 있고 미리 정의된 객체 범주 집합이 없기 때문에 표준 객체 탐지와 다르다. ReferIt에서 모델 성능을 평가하는 것은 일반적으로 예측 영역과 실제 주석 간의 교집합 대 합집합 비율(IoU)을 측정하며, 일반적인 임계값인 IoU가 0.5보다 큰 경우 올바른 위치 파악으로 간주한다.
데이터셋 구축
ReferIt의 구축은 두 가지 주요 구성 요소를 포함한다. 첫째, 다양한 일상 장면과 객체를 보장하기 위해 ImageNet 데이터베이스에서 이미지 집합을 수집했다. 둘째, 한 플레이어가 객체를 설명하고 다른 플레이어가 이를 식별해야 하는 Pictionary 스타일 게임을 통해 지시 표현을 생성했다. 이 과정을 통해 자연스럽고 다양하며 때로는 모호한 구문을 수집할 수 있었다. 그런 다음 이미지에 분할 마스크로 주석을 달았고, 이를 평가 목적으로 경계 상자로 변환했지만 데이터셋의 일부 변형은 분할 작업을 위해 마스크 주석을 유지한다.
모델 아키텍처와 방법
ReferIt에서 지시 표현 접지에 대한 대부분의 현대적 접근 방식은 특히 Artificial intelligence와 Machine learning에 기반한 딥 러닝 모델을 포함한다. 표준 파이프라인은 시각적 및 텍스트 양식을 모두 인코딩하는 Neural network을 사용한다. 일반적으로 Residual Network (ResNet)와 같은 사전 훈련된 합성곱 네트워크가 이미지 특징 추출에 사용되고, Transformer (architecture) 또는 순환 네트워크가 텍스트를 인코딩한다. 이러한 표현은 융합된 후 위치 파악 모듈이 경계 상자 또는 마스크를 예측한다.
많은 모델은 객체 탐지기가 먼저 영역 제안을 생성하고 그 다음 쿼리 표현과 일치시키는 2단계 접근 방식을 사용한다. 대안적으로, 최근 개선 사항은 융합된 특징에서 좌표를 직접 예측하는 완전 미분 가능한 프레임워크를 사용하며, 종종 Multi-Head Attention 메커니즘을 활용한다. 2024년 기준으로 ReferIt에 대한 최첨단 결과는 대규모 사전 훈련된 비전-언어 트랜스포머를 사용하여 보고되었으며, 이는 방대한 양의 데이터와 이후 데이터셋에 대한 미세 조정을 활용한다.
응용 분야
ReferIt은 언어를 시각적 세계에 접지해야 하는 모델을 평가하기 위한 벤치마크를 제공하며, 이는 인간-로봇 상호작용, 대화형 이미지 편집, 증강 현실과 같은 작업에 필수적이다. 또한 Computer vision과 자연어 처리를 결합한 시스템, 통합 다중 모드 비서를 위한 훈련 소스로도 사용되었다. 이 데이터셋은 시각적 공지시 해결 및 지시 표현 생성과 같은 후속 작업을 촉발했으며, 여기서 모델은 주어진 영역을 설명하는 언어를 생성한다.
영향과 한계
ReferIt은 연구 커뮤니티에서 널리 채택되어 유사한 데이터셋과 함께 표준 벤치마크 중 하나가 되었다. 주요 한계로는 현대 대규모 시각 데이터셋에 비해 비교적 작은 이미지 수와 극도로 특수하거나 산업적인 이미지 영역에는 일반화되지 않을 수 있는 자연 장면에 대한 편향이 있다. 그러나 그 현실성과 자연어 구조는 접지 알고리즘 개발을 계속 주도하고 있다. 또한 표현이 임의로 복잡할 수 있으므로 어휘 외 및 일반화를 평가하는 기반이 된다.
관련 자료
지시 표현 접지 분야는 다중 모드 학습의 하위 분야로 성장했으며, ReferIt의 원리는 더 포괄적인 데이터셋과 벤치마크에 통합되었다. 현재는 비디오 접지 데이터셋과 이미지의 객체 및 시간적 이벤트에 언어를 연결하는 결합 작업이 포함된다. 인간 피드백 기반 강화 학습도 이러한 설정에서 접지 정확도를 향상시키기 위해 탐구되었으며, 이는 Reinforcement Learning from AI Feedback (RLAIF)에 설명되어 있다. 시각과 언어를 융합하는 핵심 개념은 Large language model의 Encoder-Decoder Architecture 및 Cross-Attention 메커니즘과 같은 새로운 아키텍처의 중심이기도 하다.