영어에서 번역됨

OK-VQA는 이미지 내용을 넘어서는 외부 지식이 필요한 질문에 답하는 AI 시스템의 능력을 평가하기 위해 설계된 시각적 질문 응답 벤치마크로, 14,031개의 이미지에 걸쳐 14,031개의 질문을 포함합니다.

OK-VQA(Outside Knowledge Visual Question Answering)는 시각 질의 응답(VQA) 시스템을 평가하기 위한 벤치마크 데이터셋이다. 이미지 단독으로 답할 수 있는 질문에 초점을 맞춘 초기 VQA 데이터셋과 달리, OK-VQA는 모델이 객체, 장면, 일상 개념에 대한 외부 지식을 통합하여 올바른 답을 생성하도록 특별히 요구한다. 이 데이터셋은 2019년 조지아 공과대학(Georgia Institute of Technology)의 연구자들(Kenneth Marino, Mohammad Rastegari, Ali Farhadi, Roozbeh Mottaghi)에 의해 소개되었으며, 이후 지식 증강 시각-언어 모델을 연구하는 표준 테스트베드가 되었다.

이 벤치마크는 14,031개의 질문과 14,031개의 이미지로 구성되며, 각 이미지에는 정확히 하나의 질문이 연결된다. 질문은 모호하지 않게 설계되었으며, 시각적으로 존재하지 않는 외부 지식을 요구한다. 예를 들어, 이미지에 부분적으로 가려진 생물이 있을 때 "이 동물은 어떤 종류인가?"라고 묻거나, 익숙하지 않은 물체에 대해 "이 도구의 용도는 무엇인가?"라고 질문할 수 있다. 데이터셋은 음식, 동물, 차량, 스포츠, 가정용품 등 다양한 지식 영역을 포괄하여 다양성을 보장하고, 모델이 실제 세계 맥락에 대해 추론하도록 도전한다.

구축 및 주석

OK-VQA는 Amazon Mechanical Turk 작업자로부터 질문을 크라우드소싱하여 구축되었다. 주석 과정은 작업자에게 이미지를 보여주고, 이미지 단독으로는 답할 수 없지만 상식이나 사실적 지식을 요구하는 질문을 생성하도록 요청하는 방식으로 진행되었다. 품질을 보장하기 위해 각 질문은 여러 주석자에 의해 검증되었으며, 주석자 간 일치도가 높은 질문만 유지되었다. 최종 데이터셋은 훈련 세트(9,009개 질문), 검증 세트(2,016개 질문), 테스트 세트(3,006개 질문)로 분할되었다. 테스트 세트는 온라인 서버를 통한 공식 평가에 사용되며, 정확도가 주요 지표이다.

평가 및 지표

OK-VQA의 표준 평가 지표는 정확 일치 정확도(exact-match accuracy)로, 모델의 예측 답이 정답 중 하나와 정확히 일치하면 올바른 것으로 간주된다. 각 질문에는 서로 다른 주석자가 제공한 10개의 정답이 있으며, 예측이 이 중 하나와 일치하면 정답으로 채점된다. 이 접근 방식은 인간이 답을 표현하는 방식의 변동성을 고려한다. 모델은 일반적으로 테스트 세트에서 평가되지만, 연구자들은 개발 및 하이퍼파라미터 튜닝을 위해 검증 세트를 자주 사용한다.

도전 과제 및 한계

OK-VQA는 AI 시스템에 여러 도전 과제를 제기한다. 첫째, 시각 정보와 광범위한 세계 지식을 통합해야 하며, 이는 주로 이미지-텍스트 쌍으로 훈련된 모델에게 어렵다. 둘째, 많은 질문이 모호하거나 문화적 관행이나 물리적 속성 이해와 같은 암시적 맥락에 대한 추론을 요구한다. 셋째, 이 데이터셋은 설계 의도에도 불구하고 이미지 단독으로 답할 수 있는 질문이 일부 포함되어 있고, 다른 VQA 벤치마크에 비해 크기가 상대적으로 작다는 비판을 받아왔다. 또한, 정확 일치 지표는 의미적으로 올바르지만 표현이 다른 답을 불이익을 주어 가혹할 수 있다.

영향 및 사용

OK-VQA는 Machine learning컴퓨터 비전 분야에서 널리 사용되는 벤치마크가 되었다. 연구자들은 시각 인코더와 Large language model을 결합한 모델을 평가하기 위해 이 데이터셋을 채택했으며, 종종 Cross-Attention과 같은 기술을 사용하여 이미지와 텍스트 표현을 융합한다. Transformer (architecture) 아키텍처 기반 모델을 포함한 많은 최첨단 시각-언어 모델은 지식 기반 추론 능력의 핵심 지표로 OK-VQA 성능을 보고한다. 이 데이터셋은 또한 외부 지식 베이스 통합이나 Data Augmentation 기술을 사용한 일반화 개선과 같은 지식 검색 및 통합을 위한 특수 방법 개발을 촉진했다.

관련 벤치마크

OK-VQA는 더 넓은 VQA 벤치마크 계열의 일부이다. 2015년에 소개된 원래 VQA 데이터셋은 이미지 콘텐츠에서 답할 수 있는 질문에 초점을 맞춘다. 다른 관련 벤치마크로는 관계와 속성을 강조하는 Visual Genome, 구성적 추론을 테스트하는 GQA가 있다. A-OKVQA와 같은 최근 벤치마크는 추가 답변 옵션과 근거 주석을 제공하여 OK-VQA를 확장한다. OK-VQA는 외부 지식에 대한 명시적 초점에서 여전히 독특하며, AI에서 지각과 추론의 교차점을 연구하는 독특한 자원으로 남아 있다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:visual-question-answering·benchmark·computer-vision·dataset
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사