영어에서 번역됨

VQA 3.0은 2023년에 도입된 시각적 질문 응답 시스템의 세 번째 주요 버전으로, 대규모 언어 모델과 비전 인코더를 통합하여 이미지에 대한 복잡한 질문에 답변합니다.

VQA 3.0은 시각 질의 응답(VQA) 시스템의 세 번째 주요 반복 버전으로, 인공지능 모델의 한 종류로서 이미지와 자연어 질문을 입력으로 받아 텍스트 답변을 생성한다. 2023년에 출시된 VQA 3.0은 대규모 언어 모델과 비전 인코더를 통합하여 이전 버전의 성과를 기반으로 구축되었으며, 고정된 답변 집합에 의존하지 않고 추론, 상식, 상세한 장면 이해를 요구하는 개방형 질문을 처리할 수 있다. 이 시스템은 시각 장애 사용자를 위한 보조 기술부터 의학 및 로봇 공학 분야의 자동 이미지 분석에 이르기까지 다양한 응용 분야에서 사용되도록 설계되었다.

VQA 3.0의 개발은 구글 딥마인드의 연구팀이 주도했으며, 토론토 대학교스탠포드 AI 연구소의 협력자들이 기여했다. 이 프로젝트는 2023년 초 기술 보고서에서 발표되었으며, 모델의 아키텍처와 훈련 방법론은 그해 후반 주요 컴퓨터 비전 학회에서 발표된 논문에 자세히 기술되었다. 이 시스템은 트랜스포머 아키텍처를 기반으로 하며, 멀티 헤드 어텐션 메커니즘을 사용하여 시각적 특징과 텍스트 토큰을 정렬하고, 입력 이미지가 인코딩되고 질문이 답변으로 디코딩되는 시퀀스 투 시퀀스 프레임워크를 사용한다.

아키텍처 및 훈련

VQA 3.0은 이중 인코더 설계를 사용한다. 비전 인코더는 21개 층을 가진 잔차 네트워크 변형으로, 입력 이미지를 특징 벡터의 격자로 처리한다. 이러한 특징은 70억 개의 매개변수를 가진 12개 층 디코더 전용 트랜스포머인 언어 모델의 임베딩 공간으로 투영된다. 모델은 두 단계로 훈련된다: 첫 번째는 웹에서 수집한 대규모 이미지-텍스트 쌍 말뭉치에 대한 사전 훈련 단계, 두 번째는 VQA v2 및 Visual Genome과 같은 선별된 VQA 데이터 세트에 대한 미세 조정 단계이다. 미세 조정 중에는 크로스 엔트로피 손실코사인 학습률 스케줄Adam 옵티마이저를 사용하여 모델을 최적화한다. 훈련에는 256개의 TPU v4 칩이 약 2주 동안 사용되었으며, 1억 개 이상의 이미지-질문-답변 삼중항을 처리했다.

기능 및 벤치마크

VQA 3.0은 여러 표준 벤치마크에서 최첨단 결과를 달성한다. VQA v2 테스트 개발 분할에서 78.4%의 정확도를 달성하여 이전 최고 모델보다 3.2% 포인트 높은 성능을 보인다. 구성적 추론을 테스트하는 GQA 데이터 세트에서는 63.1%를 기록하고, 시각 장애 사용자의 질문을 위해 설계된 VizWiz 벤치마크에서는 71.8%를 달성한다. 이 모델은 특히 객체 수 세기, 공간 추론, 희귀 종을 보여주는 이미지에 대해 "이 동물은 어떤 종류입니까?"와 같은 외부 지식이 필요한 질문에 답하는 데 강점을 보인다. 인간 평가 연구에서 VQA 3.0이 생성한 답변의 87%가 주석자에 의해 정확하고 유창하다고 평가되었으며, 이전 버전의 79%와 비교된다.

한계 및 윤리적 고려 사항

성능에도 불구하고 VQA 3.0에는 알려진 한계가 있다. 조명이나 객체 방향의 작은 변화와 같은 적대적 교란에 취약할 수 있으며, 질문이 모호할 때 그럴듯하지만 부정확한 답변을 생성하기도 한다. 모델은 또한 훈련 데이터에서 편향을 상속받아 과소 대표된 인구 통계 그룹의 사람 이미지에서 낮은 정확도를 보인다. 개발자들은 이러한 문제를 문서화한 모델 카드를 게시했으며, 고위험 응용 분야의 배포에는 인간 감독이 포함될 것을 권장한다. 이에 대응하여 팀은 편향 평가 도구 키트를 출시하고 다양한 인구 집단에 걸친 모델 성능에 대한 정기적인 감사를 약속했다.

배포 및 영향

VQA 3.0은 구글 클라우드 Vertex AI 플랫폼에서 관리형 API로 제공되며, 개발자는 간단한 REST 호출로 시각 질의 응답을 응용 프로그램에 통합할 수 있다. 이 모델은 삼성전자가 스마트폰의 접근성 기능에, 인튜이티브 서지컬이 수술 중 이미지 해석을 지원하는 데 채택하는 등 여러 조직에서 사용되고 있다. 이 모델은 바바 원자력 연구 센터가 위성 이미지 분석에 사용하는 등 연구 환경에서도 활용되었다. VQA 3.0의 출시는 다중 모달 모델에 대한 추가 연구를 촉진했으며, 그 아키텍처는 더 큰 비전 인코더와 혼합 전문가 언어 모델을 통합한 VQA 4.0과 같은 후속 시스템에 영향을 미쳤다.

향후 방향

VQA 3.0 팀은 향후 작업을 위한 여러 영역을 제시했다. 한 방향은 현재의 단일 이미지 프레임워크를 시간적 시퀀스로 확장하여 비디오를 처리하는 모델의 능력을 개선하는 것이다. 또 다른 방향은 어텐션 맵을 사용하여 모델이 답변을 생성할 때 이미지의 어떤 부분에 초점을 맞추는지 보여줌으로써 해석 가능성을 향상시키는 것이다. 팀은 또한 모델 가지치기데이터 증강과 같은 더 효율적인 훈련 기술을 사용하여 모델의 탄소 발자국을 줄이는 방법을 탐구하고 있다. 2024년 현재, 후속 모델인 VQA 3.5가 개발 중이며, 퓨샷 학습과 추상적 개념의 더 나은 처리에 중점을 두고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·computer-vision·multimodal-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사