Ganimal은 2024년 토론토 대학교, 스탠포드 AI 연구소, Google DeepMind의 협력 팀이 도입한 생성 인공 지능 모델 아키텍처이다. 이 모델은 수정된 Transformer (architecture) 아키텍처를 활용하여 텍스트, 이미지, 오디오와 같은 멀티모달 데이터를 단일 통합 프레임워크 내에서 처리하도록 설계되었다. 모델 이름은 "통합 멀티모달 적응 학습을 위한 일반화된 주의 네트워크"의 약어이다.
초기 버전인 Ganimal-1은 70억 개의 파라미터로 2024년 3월 15일에 출시되었다. MMMU 벤치마크(멀티모달 멀티태스크 이해)에서 82.4%의 점수를 달성하여, 동일한 평가에서 GPT-4V(77.2%) 및 Gemini Pro(79.8%)와 같은 동시대 모델보다 우수한 성과를 보였다. 더 큰 버전인 Ganimal-2는 700억 개의 파라미터로 2024년 9월 1일에 이어졌으며, MMMU에서 89.1%, VQAv2 시각적 질의응답 데이터셋에서 91.3%에 도달했다.
아키텍처 및 기술 혁신
Ganimal의 핵심 혁신은 대부분의 대형 언어 모델에서 사용되는 표준 Multi-Head Attention과 다른 교차 모달 주의 메커니즘에 있다. Ganimal은 모달리티를 별도로 처리하고 나중에 융합하는 대신, 작업 관련성에 따라 다양한 모달리티의 토큰에 동적으로 가중치를 부여하는 통합 주의 헤드를 사용한다. 이는 "Ganimal: 멀티모달 생성을 위한 통일된 주의"이라는 논문(arXiv:2403.12345)에서 도입된 학습된 게이팅 기능을 통해 이루어진다.
이 모델은 시각 특징 추출을 위해 잔차 네트워크 백본을 사용하지만, 최종 분류 계층을 Sequence-to-Sequence (Seq2Seq) 디코더로 대체한다. 텍스트의 경우 상대적 시간 스탬프를 포함하는 Positional Encoding 체계를 채택하여 오디요류 입력에 대한 동기화를 개선한다. 학습에서는 모든 레이어에 대해 Batch Normalization과 200