Visual Commonsense Reasoning(VCR)은 이미지를 이해하고 상식 지식을 사용하여 이미지에 대한 질문에 답하는 시스템의 능력을 평가하는 인공지능 분야의 연구 벤치마크이자 과제입니다. 2019년에 소개된 VCR은 모델이 장면의 객체와 행동을 식별할 뿐만 아니라 동기, 정신 상태, 그리고 가능성 있는 미래 사건을 추론하도록 요구합니다. 이는 기본적인 시각 인식을 넘어선 고차원적 인지를 테스트하도록 설계되었으며, 컴퓨터 비전과 자연어 처리 사이의 간극을 메우는 역할을 합니다.
VCR 데이터셋은 110,000개의 영화 장면에서 파생된 290,000개 이상의 객관식 질문으로 구성되어 있으며, 각 질문에는 질문, 네 개의 답변 옵션, 네 개의 근거 옵션이 짝지어져 있습니다. 모델은 올바른 답변을 선택한 다음 올바른 근거를 선택하여 자신의 선택을 정당화해야 합니다. 이러한 2단계 구조는 시스템이 설명을 생성하도록 강제하여, 기존의 시각적 질의응답(VQA)보다 벤치마크를 더 어렵게 만듭니다. 이 과제는 질의-응답(QA)과 응답-근거(AR)의 두 가지 하위 과제로 나뉘며, 전체 성능은 두 하위 과제의 정확도를 곱한 VCR 점수로 측정됩니다.
데이터셋 및 주석
VCR 데이터셋은 노스캐롤라이나 대학교 채플힐 캠퍼스와 앨런 인공지능 연구소의 연구자들이 만들었습니다. 주석은 Amazon Mechanical Turk를 사용한 크라우드소싱으로 이루어졌으며, 작업자들은 "왜 그 사람이 달리고 있는가?" 또는 "다음에 무슨 일이 일어날까?"와 같은 상식 추론을 요구하는 질문을 작성하도록 요청받았습니다. 각 질문은 영화의 특정 이미지에 기반하여 사회적 상호작용, 감정 표현, 물리적 인과성과 같은 풍부한 맥락적 단서를 제공합니다. 데이터셋에는 110,000개의 고유한 영화 클립이 포함되어 있으며, 각 클립에는 평균 2.6개의 질문이 있어 객체 인식에만 치우치지 않는 다양한 시나리오를 제공합니다.
과제 구성
공식적으로 VCR은 객관식 과제로 정의됩니다. 이미지 I, 질문 Q, 네 개의 답변 후보 A = {a1, a2, a3, a4}가 주어지면 모델은 올바른 답변 a를 예측해야 합니다. 그런 다음 동일한 이미지, 질문, 올바른 답변이 주어지면 모델은 네 개의 근거 후보 집합에서 올바른 근거 R을 선택해야 합니다. 최종 VCR 점수는 올바른 답변과 올바른 근거를 모두 선택하는 정확도, 즉 결합 확률 P(a | I, Q) P(r | I, Q, a*)로 계산됩니다. 이러한 구성은 모델이 단순히 답변을 추측하는 것이 아니라 일관된 설명을 생성하도록 장려합니다.
모델 접근법
초기 VCR 시스템은 이미지 특징 추출을 위한 합성곱 신경망(CNN)과 텍스트 처리를 위한 순환 신경망(RNN) 또는 트랜스포머 기반 인코더를 결합한 시각적 질의응답 아키텍처에 의존했습니다. 일반적인 기준 모델은 멀티 헤드 어텐션 메커니즘을 사용하여 시각적 및 텍스트 표현을 융합하는 VCRT(Visual Commonsense Reasoning with Transformer) 모델이었습니다. 이후 BERT 또는 GPT 변형을 미세 조정하는 것과 같은 대규모 언어 모델 기반 접근법이 다중 모달 입력을 처리하도록 적응되었습니다. 이러한 모델은 종종 2단계 파이프라인을 사용합니다. 먼저 이미지와 질문을 공동으로 인코딩한 다음 분류 헤드를 사용하여 답변과 근거를 선택합니다. 더 최근의 연구는 크로스 어텐션 레이어를 사용한 종단 간 훈련을 탐구하여 모델이 질문에 대해 추론하는 동안 관련 이미지 영역에 주의를 기울일 수 있게 합니다.
과제 및 한계
진전에도 불구하고 VCR은 여전히 어려운 벤치마크로 남아 있습니다. 모델은 종종 캐릭터의 의도나 감정 상태를 추론하는 것과 같은 깊은 사회적 추론을 요구하는 질문에 어려움을 겪습니다. 데이터셋에는 또한 편향이 포함되어 있는데, 일부 질문은 시각적 증거보다는 텍스트의 통계적 규칙성으로 답할 수 있기 때문입니다. 예를 들어, 모델은 장면을 실제로 이해하지 않고 특정 동사를 일반적인 객체와 연관시키는 법을 배울 수 있습니다. 또한 근거 선택 과제는 답변의 단순한 의역이 아닌 그럴듯한 설명을 생성해야 하기 때문에 특히 어렵습니다. 2025년 현재 VCR에서 가장 우수한 성능을 보이는 모델은 QA 하위 과제에서 약 80%의 정확도를, AR 하위 과제에서 75%의 정확도를 달성하지만, 결합 VCR 점수는 60% 미만으로 상당한 개선 여지가 있음을 나타냅니다.
영향 및 관련 연구
VCR은 Visual Commonsense Reasoning in the Wild(VCR-W)와 같은 후속 벤치마크에 영향을 미쳤으며 AI 시스템의 상식 추론 능력을 평가하는 테스트베드로 사용되었습니다. 또한 근거 선택 구성 요소가 모델이 해석 가능한 정당성을 제공하도록 강제하기 때문에 설명 가능한 AI 연구를 촉진했습니다. 데이터셋은 공개적으로 이용 가능하며 연구 커뮤니티에서 널리 채택되어 2025년 기준 1,000회 이상 인용되었습니다. VCR은 종종 시각적 함의(visual entailment) 및 시각적 질의응답과 같은 다른 시각적 추론 과제와 비교되지만, 설명에 대한 강조가 차별점입니다. 이 벤치마크는 앨런 AI 연구소가 유지 관리하며 학술 대회와 워크숍에서 정기적으로 사용됩니다.
향후 방향
VCR에 대한 향후 연구는 대규모 이미지-텍스트 쌍으로 사전 훈련된 비전-언어 모델과 같은 더 정교한 신경망 아키텍처를 통합하는 것을 포함할 수 있습니다. 또한 VCR을 사용하여 고정된 집합에서 선택하는 대신 자유 형식의 근거를 생성해야 하는 생성형 AI 시스템의 추론 능력을 평가하는 데에도 관심이 있습니다. 또한 연구자들은 적대적 예제나 반사실적 질문을 도입하여 데이터셋 편향을 줄이는 방법을 모색하고 있습니다. 인공지능이 계속 발전함에 따라 VCR은 인간 수준의 시각적 상식 추론을 향한 진전을 측정하는 중요한 벤치마크 역할을 합니다.