Gemma는 Google DeepMind가 개발한 일련의 소스 공개 대규모 언어 모델이다. 이는 Gemini 모델 시리즈와 유사한 기술을 기반으로 하며, Google의 '모든 사람에게 유용한 AI'라는 사명을 지원하도록 설계되었다. 첫 번째 버전은 2024년 2월에 출시되었고, 2024년 6월에 Gemma 2, 2025년 3월에 Gemma 3, 2026년 4월에 오픈 가중치 Gemma 4가 출시되었다. 또한 시각-언어 모델 PaliGemma와 의료 상담 주제를 위한 MedGemma와 같은 Gemma 변형 모델도 개발되었다.
역사
2024년 2월, Google은 Gemini의 경량 버전 역할을 하는 소스 공개 LLM 모음인 Gemma를 공개했다. 초기 출시는 각각 20억 개와 70억 개의 매개변수를 가진 신경망 두 가지 크기로 제공되었다. 여러 언론은 이를 Meta가 AI 모델의 소스 코드를 공개한 것과 같은 경쟁사에 대한 대응이자, AI 소스 코드를 비공개로 유지해 온 Google의 오랜 관행에서의 전환으로 보았다.
Gemma 2는 2024년 6월 27일에 출시되었고, Gemma 3는 2025년 3월 12일에 출시되었다. 2026년 4월 2일, Google은 Gemma 4를 무료 오픈소스 Apache 2.0 라이선스로 출시했다.
개요
Gemini 모델 시리즈와 유사한 기술을 기반으로 하는 Gemma는 Google이 '모든 사람에게 유용한 AI'라는 사명을 지원하는 데 도움이 된다고 설명한다. Google은 의료 분석을 위한 MedGemma와 같은 특정 사용 사례에 최적화된 공식 Gemma 변형 모델을 제공한다.
출시 이후 Gemma 모델은 1억 5천만 회 이상 다운로드되었으며, Hugging Face에는 7만 개의 변형 모델이 제공되고 있다.
Gemma 3는 10억, 40억, 120억, 270억 매개변수 크기로 제공되며 140개 이상의 언어를 지원한다. 멀티모달 모델로서 텍스트와 이미지 입력을 모두 지원한다. Google은 또한 스마트폰, 노트북, 태블릿과 같은 소비자 기기에서 실행하도록 최적화된 소형 모델인 Gemma 3n도 제공한다.
최신 모델 세대는 2026년 4월 2일에 출시된 Gemma 4이다. Effective 2B (E2B), Effective 4B (E4B), 26B Mixture of Experts (MoE), 31B Dense의 네 가지 크기로 제공된다. Gemma 4는 모든 모델에서 이미지와 비디오를 포함한 멀티모달 입력을 지원하며, E2B 및 E4B 모델에서는 기본 오디오 입력을 지원한다. Gemma 4의 31B Dense 변형은 Arena의 텍스트 리더보드에서 3위에 올랐고, 26B 변형은 6위에 올랐다. Gemma 4 12B는 2026년 6월 3일에 출시되었으며, 인코더 없이 이미지와 오디오를 처리하는 통합 멀티모달 아키텍처를 특징으로 한다.
아키텍처
Gemma 3는 그룹화된 쿼리 어텐션(GQA)과 SigLIP 비전 인코더를 갖춘 디코더 전용 트랜스포머 아키텍처를 기반으로 한다. 모든 모델의 컨텍스트 길이는 128K이며, 예외적으로 Gemma 3 1B는 컨텍스트 길이가 32K이다.
양자화 인식 훈련(QAT)을 사용하여 미세 조정된 양자화 버전도 제공되며, 상당한 메모리 사용량 개선을 제공하지만 정확도와 정밀도에 일부 부정적인 영향을 미친다.
변형 모델
Google은 의료 분석이나 프로그래밍과 같은 특정 목적을 위해 설계된 Gemma 모델의 공식 변형 모델을 개발한다. 여기에는 다음이 포함된다:
- CodeGemma (2B 및 7B): CodeGemma는 코드 완성 및 일반 코딩 사용을 위해 설계된 모델 그룹이다. Python, Java, C++ 등을 포함한 여러 프로그래밍 언어를 지원한다.
- DolphinGemma (약 400M): Georgia Tech와 Wild Dolphin Project의 연구자들과 협력하여 개발된 DolphinGemma는 오디오 분석을 통해 돌고래 의사소통을 더 잘 이해하는 것을 목표로 한다. 그러나 모델이나 데이터는 공개적으로 출시되지 않았다.
- MedGemma (4B 및 27B): Gemma 3를 기반으로 하는 MedGemma는 이미지 분석과 같은 의료 응용 분야를 위해 설계되었다. 그러나 Google은 MedGemma가 '아직 임상 수준은 아니다'라고도 언급한다. 인도 구르가온의 Tap Health 개발자들은 MedGemma를 사용하여 AI 지원 당뇨병 관리 애플리케이션을 개선했다.
- PaliGemma (3B, 10B 및 28B, 각각 2B, 9B 및 27B의 Gemma 2 기반): 기계 시각 및 이미지 분석용.
- ShieldGemma 2 (4B): Gemma 3 제품군을 기반으로 하는 ShieldGemma는 폭력적이고 위험하며 성적으로 노골적인 이미지를 식별하고 필터링하도록 설계되었다.
- TranslateGemma (4B, 12B 및 27B): 기계 번역용.
참고: 오픈 가중치 모델은 추론 시 컨텍스트 길이를 재조정할 수 있다. Gemma 1, Gemma 2, PaliGemma 및 PaliGemma 2의 경우 비용은 컨텍스트 창 크기에 비례하는 kv-캐시 크기의 선형 증가이다. Gemma 3의 경우 로컬 및 글로벌 어텐션의 분리로 인해 개선된 성장 곡선이 있다. RecurrentGemma의 경우 2,048 토큰 이후에는 메모리 사용량이 변경되지 않는다.
같이 보기
- 대규모 언어 모델 목록
- 오픈소스 인공지능 소프트웨어 목록
참조
외부 링크
- 공식 웹사이트