TextVQA는 Artificial intelligence 분야의 연구 과제이자 벤치마크로, 컴퓨터 비전과 자연어 처리를 결합한다. 이는 이미지 내에 나타나는 텍스트를 읽고 이해하는 데 정답이 의존하는 이미지에 대한 질문에 답하는 데 초점을 맞춘다. 여기에는 도로 표지판, 제품 라벨, 식당 메뉴, 손으로 쓴 메모 및 기타 실제 사물의 텍스트가 포함된다. 종종 객체와 장면을 인식하는 데 의존하는 표준 시각적 질의응답(VQA)과 달리, TextVQA는 모델이 광학 문자 인식(OCR)을 수행하고 추출된 텍스트 정보를 시각적 맥락 및 질문의 의미론과 통합하는 능력을 구체적으로 테스트한다.
이 과제는 일반적으로 의미 있는 텍스트가 거의 또는 전혀 없는 이미지를 포함했던 초기 VQA 데이터셋의 공백을 해결하기 위해 도입되었다. TextVQA는 시스템이 텍스트를 감지하고 인식할 뿐만 아니라 질문과의 관련성을 추론해야 하며, 종종 공간 추론(예: "문 위에 무엇이라고 쓰여 있는가?")이나 상식 추론(예: 표지판에 기반하여 "이것은 어떤 종류의 상점인가?")을 포함한다. 이 벤치마크는 특히 시각적 특징, OCR 토큰 및 언어 표현을 공동으로 처리할 수 있는 아키텍처를 개발하는 데 있어 멀티모달 학습의 중요한 연구를 주도했다.
데이터셋 및 벤치마크
TextVQA 데이터셋은 2019년 조지아 공과대학과 Facebook AI Research(현재 Meta AI의 일부)의 연구자들에 의해 공개되었다. 이는 Open Images 데이터셋에서 가져온 4,972개의 이미지에 대한 28,408개의 질문으로 구성된다. 각 이미지에는 최소한 한 단어 이상의 텍스트가 포함되며, 질문은 정확히 답하기 위해 해당 텍스트를 읽어야 하도록 설계되었다. 데이터셋은 훈련(34,602개 질문), 검증(5,000개 질문) 및 테스트 세트로 분할되며, 테스트 세트는 온라인 서버를 통한 공식 평가에 사용된다.
질문은 개방형이며 일반적으로 한 단어에서 세 단어 사이의 짧은 답변을 요구한다. 데이터셋에는 각 이미지에 대한 정답 OCR 주석이 포함되어 단어 경계 상자와 인식된 텍스트를 제공한다. 이를 통해 모델은 명시적 OCR 감독으로 훈련되거나 사전 추출된 OCR 특징을 사용할 수 있다. 평가 지표는 표준 VQA 정확도로, 예측된 답변이 10개의 인간 제공 정답 중 하나와 일치하면 올바른 것으로 간주된다.
모델 아키텍처
TextVQA에 대한 초기 접근 방식은 사전 훈련된 OCR 시스템(예: Rosetta 또는 Tesseract)을 Neural network 추론과 결합한 모듈식 파이프라인을 사용했다. 일반적인 아키텍처는 Look, Read, Reason, Answer(LoRRA) 모델로, 이미지 특징에 Residual Network (ResNet)을, 질문 인코딩에 양방향 LSTM을, 그리고 시각적, 텍스트 및 OCR 특징을 결합하는 멀티모달 융합 계층을 사용했다. LoRRA는 또한 모델이 OCR 토큰에서 직접 단어를 출력할 수 있게 하는 복사 메커니즘을 통합했으며, 이는 축어적 텍스트를 요구하는 질문에 답하는 데 효과적임이 입증되었다.
이후 모델은 M4C(Multimodal Multi-Copy Mesh)와 같은 Transformer (architecture) 기반 아키텍처를 활용했으며, 이는 반복적 답변 디코딩 프로세스와 여러 OCR 토큰을 처리하기 위한 다중 복사 메커니즘을 도입했다. 나중에는 Large language model 기반 시스템(예: LLaVA, Flamingo)과 같은 통합 시각-언어 모델이 TextVQA에 적응되어 이미지-텍스트 쌍에 대한 대규모 사전 훈련을 활용하여 더 높은 정확도를 달성했다.
과제 및 평가
TextVQA는 몇 가지 독특한 과제를 제시한다. 첫째, 자연 장면에서의 OCR은 다양한 글꼴, 조명, 가림 및 원근 왜곡으로 인해 어렵다. 둘째, 모델은 이미지에 여러 텍스트 인스턴스가 포함되는 경우가 많으므로 질문과 관련된 텍스트를 결정해야 한다. 셋째, 추론은 표지판의 색상이나 라벨의 위치 식별과 같은 시각적 단서와 텍스트를 결합해야 할 수 있다. 넷째, 일부 질문은 텍스트 기반 산술 또는 시간적 추론(예: 표지판에서 "가게는 몇 시에 문을 닫는가?")을 요구한다.
평가는 테스트 세트에서 수행되며 모델은 정확도에 따라 순위가 매겨진다. 2024년 기준으로 최첨단 모델은 초기 기준선의 약 40%에서 약 80%의 정확도를 달성한다. 이 벤치마크는 또한 다른 맥락에서 장면 텍스트 이해에 초점을 맞춘 OCR-VQA 및 ST-VQA와 같은 관련 과제로 확장되었다.
영향 및 응용
TextVQA는 특히 문서 이해 및 보조 기술의 맥락에서 멀티모달 AI 시스템의 개발에 영향을 미쳤다. 응용 분야에는 시각 장애 사용자가 표지판이나 라벨을 읽도록 돕기, 자동화된 양식 처리, 텍스트가 있는 이미지를 색인하는 검색 엔진 향상이 포함된다. 이 과제는 또한 공간 텍스트 접지에 대한 Cross-Attention 메커니즘 및 Positional Encoding 연구를 촉진했다.
이 벤치마크는 학술 연구와 산업계에서 널리 사용되며, Google DeepMind, OpenAI 및 기타 연구소가 시각-언어 모델 평가를 위한 테스트베드로 사용한다. 또한 Artificial intelligence 추론 제품군과 같은 더 광범위한 벤치마크에 통합되어 모델이 텍스트 단서가 있는 멀티모달 추론을 처리하는 방식에 대한 이해에 기여했다.
관련 과제 및 데이터셋
TextVQA는 장면 텍스트 이해 과제 계열의 일부이다. 관련 데이터셋에는 텍스트 기반 추론에 초점을 맞추고 다른 이미지 분포를 가진 ST-VQA(Scene Text Visual Question Answering)와 책 표지 이미지를 사용하고 제목과 저자에 대한 질문을 묻는 OCR-VQA가 포함된다. 이러한 벤치마크는 집합적으로 Machine learning이 고수준 추론과 OCR을 결합하는 경계를 확장한다.
향후 방향
TextVQA에 대한 향후 작업은 다국어 텍스트의 더 강력한 처리, 더 긴 답변을 생성할 수 있는 Generative AI 모델과의 개선된 통합, 그리고 보지 못한 도메인에 대한 더 나은 일반화를 포함할 수 있다. 연구자들은 또한 추론 단계를 설명함으로써 모델을 더 해석 가능하게 만드는 방법과 텍스트가 있는 레이블되지 않은 이미지에 대한 자기 지도 학습을 통해 대규모 주석 데이터셋에 대한 의존성을 줄이는 방법을 탐구하고 있다.