NLVR2(자연어 시각 추론, 버전 2)는 인공지능 및 기계 학습 분야에서 모델의 시각 추론 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 이 과제는 시스템이 두 이미지와 자연어 캡션을 검토한 후, 캡션이 이미지 쌍에 대해 참인지 거짓인지 판단하도록 요구한다. 컴퓨터 생성 장면을 사용한 합성 데이터였던 전신 NLVR과 달리, NLVR2는 인터넷에서 수집한 실제 세계 사진을 사용하므로 추론 과제가 훨씬 더 복잡하고 실제 응용에 더 가깝다.
이 데이터셋은 2017년에 출시된 원래 NLVR 벤치마크의 후속작으로, 2019년에 스탠포드 대학교와 노스캐롤라이나 대학교 채플힐 연구진이 도입했다. 주요 동기는 모델이 진정한 추론 대신 저수준 시각적 지름길을 활용할 수 있게 한 합성 데이터의 한계를 해결하는 것이었다. NLVR2는 107,000개 이상의 인간이 작성한 캡션으로 구성되며, 각 캡션은 두 개의 서로 다른 이미지와 짝을 이룬다. 캡션은 공간 관계, 세기, 비교, 논리 연산을 다루는 다양한 내용으로, 종종 두 이미지를 동시에 이해해야 한다.
과제 정의 및 평가
NLVR2에서 각 예제는 모델에 이미지 쌍(왼쪽 및 오른쪽)과 캡션을 제시한다. 모델은 캡션이 쌍을 정확히 설명하면 '참', 그렇지 않으면 '거짓'이라는 이진 결정을 출력해야 한다. 예를 들어, 캡션이 '왼쪽 이미지에 오른쪽 이미지보다 더 많은 사람이 있다'라고 명시할 수 있으며, 모델은 두 이미지를 비교하여 이를 검증해야 한다. 평가 지표는 보류된 테스트 세트에 대한 분류 정확도이다. 캡션이 인간이 작성하고 이미지가 자연 사진이므로, 이 과제는 강력한 시각 인식, 언어 이해, 교차 양식 추론을 요구한다.
벤치마크는 훈련, 개발, 테스트 세트로 분할되며, 테스트 세트는 공식 리더보드 순위에 사용된다. 주목할 만한 특징은 테스트 세트에 부정이나 복잡한 공간 전치사를 포함한 캡션과 같은 특히 어려운 '하드' 예제가 포함된다는 점이다. 이는 모델이 패턴을 암기하거나 표면적 단서를 사용하여 높은 점수를 얻을 수 없도록 보장한다.
다른 벤치마크와의 관계
NLVR2는 VQA(시각 질의 응답) 및 CLEVR을 포함한 더 넓은 시각 추론 벤치마크 계열의 일부이다. 그러나 단일 이미지에 대한 개방형 질문에 답하는 VQA와 달리 두 이미지를 비교해야 한다는 점에서 다르다. 합성 3D 장면을 사용하는 CLEVR과 비교하여, NLVR2의 실제 사진 사용은 더 큰 변동성과 모호성을 도입하여 일반화에 대한 더 현실적인 테스트를 제공한다. 이 데이터셋은 특히 다중 양식 과제의 표준이 된 트랜스포머 아키텍처 기반 딥 러닝 모델과 함께 자주 사용된다.
NLVR2는 또한 NLVR3 및 캡션이 이미지에 의해 함의되는지 여부를 결정하는 더 넓은 '시각 함의' 과제와 같은 후속 벤치마크에 영향을 미쳤다. 이는 시각과 언어를 결합하는 신경망 모델을 평가하기 위한 널리 인용되는 리소스로 남아 있으며, 시각 입력을 통합하는 대규모 언어 모델 확장에 대한 연구에서 자주 사용된다.
모델 성능 및 과제
NLVR에서 높은 정확도를 달성한 초기 모델은 종종 합성 이미지 통계에 의존했지만, 이러한 접근 방식은 NLVR2에서 실패했다. 자연 이미지로의 전환은 모델 능력의 상당한 격차를 드러냈다. 2024년 기준 최첨단 모델은 테스트 세트에서 약 80-85%의 정확도를 달성하여 개선의 여지가 상당하다. 동일한 과제에 대한 인간 성능은 95% 이상으로 추정되며, 이는 현재 시스템이 함의된 관계 이해나 모호한 캡션 처리와 같은 미묘한 추론에 여전히 어려움을 겪고 있음을 나타낸다.
주요 과제는 조명, 원근감, 객체 외형의 변동을 처리하고 캡션 내 논리적 모순을 해결하는 것을 포함한다. 모델은 객체를 정확히 세어야 하거나 캡션이 두 이미지 간 객체의 상대적 위치에 의존하는 '위에' 또는 '사이'와 같은 공간 용어를 포함할 때 종종 실패한다. 연구자들은 시각적 특징을 텍스트 표현과 더 잘 정렬하기 위해 교차 주의 메커니즘 및 다중 헤드 주의 레이어를 포함한 다양한 아키텍처 혁신을 탐구했다.
응용 및 영향
NLVR2가 테스트하는 기술은 이미지 설명을 생성하는 생성형 AI 시스템, 시각 장애 사용자를 위한 보조 기술, 시각 장면에 대해 추론해야 하는 자율 시스템과 같은 응용에 직접적으로 관련된다. 이 벤치마크는 구글 딥마인드, 오픈AI, 앤트로픽과 같은 주요 연구소와 MIT CSAIL 및 버클리 AI 연구와 같은 학술 기관의 모델을 평가하는 데 사용되었다.
NLVR2는 또한 대조 학습 및 커리큘럼 학습과 같은 새로운 훈련 기술의 개발을 촉진했으며, 여기서 모델은 더 어려운 예제에 노출되기 전에 더 쉬운 예제로 훈련된다. 데이터셋의 공개 가용성은 다중 양식 모델을 비교하기 위한 표준 테스트베드가 되었으며, VQA 및 Visual Genome과 같은 다른 벤치마크와 함께 더 넓은 평가 제품군에 자주 포함된다.
향후 방향
2025년 현재, 연구는 시각 추론의 경계를 계속 확장하고 있다. 언어 모델이 시각 인코더로 강화되는 대규모 언어 모델 프레임워크와 NLVR2의 통합은 유망한 결과를 보여주었다. 그러나 이러한 모델은 특히 캡션에 희귀 단어나 비정상적인 객체 조합이 포함될 때 여전히 취약성을 나타낸다. 향후 작업은 더 다양한 이미지 소스를 포함하도록 데이터셋을 확장하고, 시간적 또는 비디오 기반 추론을 통합하며, 이진 정확도를 넘어 추론 단계의 품질을 포착하는 지표를 개발하는 것을 포함할 수 있다.
이 벤치마크는 인공지능의 진전을 측정하는 중요한 도구로 남아 있으며, 시각 장면에 대한 인간과 기계 이해 사이의 격차를 강조한다. 그 설계 원칙은 많은 후속 데이터셋에 영향을 미쳐 다중 양식 기계 학습 분야의 기초 리소스로서의 역할을 공고히 했다.