비전-언어 모델(VLM)은 이미지와 텍스트를 함께 이해하도록 훈련된 멀티모달 시스템으로, 이미지 캡셔닝, 시각적 질의응답, 이미지-텍스트 검색, 그리고 언어를 특정 시각적 콘텐츠에 연결하는 근거 기반 추론과 같은 작업을 가능하게 한다. VLM은 기반 모델의 더 넓은 범주에 속하며, 일반적으로 Transformer (architecture) 아키텍처를 기반으로 구축된다.
역사
현대 VLM은 OpenAI의 CLIP(2021)에서 시작되었으며, 이는 웹에서 수집된 수억 개의 이미지-텍스트 쌍에 대한 대조 학습을 사용하여 수동으로 레이블을 지정한 범주 없이 이미지와 캡션을 공유 임베딩 공간에서 정렬했다. CLIP의 임베딩은 분류를 훨씬 넘어 유용한 것으로 입증되었으며, 초기 Text-to-image generation 시스템의 안내 메커니즘을 지원하고 이후 모델의 표준 시각적 인코더가 되었다. 2021년부터 2023년까지 Flamingo, BLIP, LLaVA와 같은 모델은 고정되거나 가볍게 미세 조정된 비전 인코더를 사전 훈련된 Large language model에 연결하는 방법을 탐구하여, 언어 모델의 추론과 지식을 비교적 적은 추가 훈련으로 시각적 입력에 확장할 수 있게 했다.
아키텍처
대부분의 VLM은 종종 CNN 또는 비전 트랜스포머인 비전 인코더와 언어 모델 백본을 결합하며, 이미지 특징을 언어 모델이 이미 이해하는 토큰 임베딩 공간에 매핑하는 투영 계층으로 연결된다. 결합된 모델은 쌍으로 된 이미지-텍스트 데이터로 훈련되거나 미세 조정되어, 언어 모델이 Attention mechanism을 통해 텍스트 토큰에 주의를 기울이는 것과 같은 방식으로 시각적 토큰에 주의를 기울이는 법을 학습한다. Gemini 및 GPT-4o를 포함한 일부 최신 시스템은 별도로 사전 훈련된 구성 요소에서 조립되는 대신 통합 멀티모달 모델로 기본적으로 훈련되어, VLM과 일반 멀티모달 기반 모델 사이의 경계를 흐리게 한다.
기능 및 사용 사례
VLM은 이미지를 설명하고, 차트와 다이어그램에 대한 질문에 답하고, 포함된 텍스트를 읽고 추론하며(이는 OCR과 겹침), 여러 이미지를 비교하고, 도구 사용 또는 에이전트 루프와 결합될 때 보이는 것에 기반하여 행동을 취할 수 있다. 예를 들어 컴퓨터 사용 에이전트는 스크린샷을 해석하여 소프트웨어를 작동한다. 이들은 접근성 기능, 로봇 지각, 의료 영상 분류 도구, 그리고 단순히 분류하는 대신 이미지에 대해 추론해야 하는 콘텐츠 조정 시스템을 뒷받침한다.
평가 및 한계
VLM은 시각적 질의응답, 차트 및 문서 이해, 세밀한 인식을 다루는 벤치마크로 평가되며, 정밀한 계산, 공간 관계, 또는 작거나 회전된 텍스트 읽기를 요구하는 작업에서는 성능이 여전히 저하된다. 다른 멀티모달 시스템과 마찬가지로 VLM은 이미지에 없는 객체나 세부 사항을 환각할 수 있으며, 이는 "객체 환각"으로 연구되는 실패 모드이다. 또한 적대적이거나 오해를 유발하는 시각적 입력, 특히 모델이 지시로 처리하는 이미지에 포함된 텍스트(시각적 형태의 Prompt injection)에 의해 행동이 조작될 수 있다.
주요 사례
널리 사용되는 VLM 및 VLM 기능 시스템에는 기반 인코더로서의 CLIP, 오픈 연구 커뮤니티의 LLaVA 및 그 후속 모델, 그리고 Claude, Gemini, GPT-4/GPT-4o와 같은 주요 연구소의 멀티모달 출시가 포함되며, 이들 모두는 비전 이해를 독립형 제품으로 제공하는 대신 범용 어시스턴트에 통합한다.