영어에서 번역됨

Gemma 2는 2024년에 출시된 Google DeepMind가 개발한 오픈 가중치 대규모 언어 모델 제품군이다. 2B, 9B, 27B 파라미터 변형을 포함하며, 효율적인 추론과 공개 벤치마크에서 경쟁력 있는 성능을 제공하도록 설계되었다.

Gemma 2는 Google DeepMind가 개발한 오픈 가중치 대규모 언어 모델 제품군이다. 2024년에 출시되었으며, 이전 Gemma 1 시리즈를 기반으로 여러 크기에서 향상된 성능과 효율성을 제공한다. 이 모델들은 연구 및 상업적 사용 모두를 위해 설계되었으며, 가중치는 허용적 라이선스 하에 공개적으로 제공된다. Gemma 2 변형들은 2B, 9B, 27B 파라미터 버전을 포함하여 공개 리더보드에 등장했으며, 9B 및 27B 모델은 종종 더 큰 독점 시스템과 비교된다.

Gemma 2 제품군은 멀티 헤드 어텐션과 더 큰 모델에서의 로컬 슬라이딩 윈도우 어텐션 사용을 포함한 아키텍처 혁신과 효율적인 훈련 및 추론에 대한 초점으로 주목할 만하다. 이 모델들은 다양한 텍스트 코퍼스로 훈련되었으며, 다국어 능력과 지시 따르기를 강조한다. 2024년 말 기준으로 Gemma 2 모델은 Google Cloud, Amazon Web Services 및 기타 클라우드 플랫폼을 통해 제공되며, 로컬 배포도 가능하다.

아키텍처 및 훈련

Gemma 2 모델은 Transformer 아키텍처를 기반으로 하며, 효율성을 위한 특정 개선 사항을 포함한다. 27B 모델은 전역 및 로컬 어텐션의 조합을 사용하여 메모리 사용량을 줄이면서 장기 컨텍스트 이해를 유지한다. 모든 변형은 안정적인 훈련을 위해 레이어 정규화잔차 연결을 사용한다. 훈련 과정은 웹 텍스트, 책, 코드를 포함한 다양한 데이터 소스를 혼합하여 사용하며, 고품질 필터링에 중점을 둔다.

모델들은 AdamSGD 변형을 사용하여 학습률 스케줄과 함께 훈련되며, 여기에는 워밍업과 코사인 감쇠가 포함된다. 그래디언트 클리핑이 불안정성을 방지하기 위해 적용된다. 27B 모델은 TSMC 제조 칩의 대규모 클러스터에서 훈련되었지만, 구체적인 하드웨어 세부 사항은 공개되지 않았다. 훈련 데이터에는 여러 언어가 포함되며, 상당 부분이 영어 및 기타 주요 언어에서 비롯된다.

출시 및 변형

Gemma 2는 2B, 9B, 27B 파라미터의 세 가지 주요 크기로 출시되었다. 9B 및 27B 모델은 기본 및 지시 튜닝 버전 모두로 제공되며, 2B 모델은 주로 경량 애플리케이션용이다. 지시 튜닝 변형은 RLHF 및 기타 정렬 기술을 사용하여 유용성과 안전성을 개선하기 위해 미세 조정되었다. 모델들은 상업적 사용을 허용하지만 특정 고위험 애플리케이션에 제한을 두는 Gemma 라이선스 하에 배포된다.

출시에는 사전 훈련된 체크포인트와 토크나이저가 포함되었으며, TensorFlow 및 PyTorch와 같은 프레임워크를 지원한다. 27B 모델은 MMLU 및 HumanEval과 같은 벤치마크에서 경쟁력 있는 성능으로 주목받았으며, 종종 다른 조직의 유사한 크기 모델을 능가한다. 특히 9B 모델은 효율성으로 강조되었으며, 더 적은 계산 리소스를 요구하면서 더 큰 모델과 비교 가능한 성능을 달성한다.

성능 및 벤치마크

Gemma 2 모델은 AI 추론, 코딩 및 다국어 작업을 포함한 다양한 공개 벤치마크에서 평가되었다. 27B 모델은 MMLU(대규모 멀티태스크 언어 이해) 및 GSM8K(초등 수학)에서 높은 점수를 기록하며, 9B 모델은 HumanEval과 같은 코딩 벤치마크에서 강력한 결과를 보여준다. 공개 리더보드에서 Gemma 2 변형들은 최고의 오픈 가중치 모델 중 하나로 순위를 매겼으며, 종종 특정 작업에서 OpenAI의 GPT-3.5 및 Anthropic의 Claude 2의 이전 버전을 능가한다.

모델들은 양자화 및 가지치기 기술을 지원하는 효율적인 추론을 위해 설계되었다. 2B 모델은 엣지 디바이스에서 실행될 수 있으며, 9B 및 27B 모델은 클라우드 배포에 적합하다. 2024년 기준으로 Gemma 2는 Hugging FaceGroq의 빠른 추론 하드웨어를 포함한 다양한 생성형 AI 플랫폼에 통합되었다.

생태계 및 채택

Gemma 2는 학계와 산업계에서 널리 채택되었다. 연구자들은 과학 발견을 위한 머신 러닝이나 의료 애플리케이션을 위한 딥 러닝과 같은 도메인 특정 작업에 모델을 미세 조정한다. 삼성전자Intel과 같은 기업들은 제품에 Gemma 2를 통합하는 것을 탐구했지만, 구체적인 배포는 공개적으로 상세히 설명되지 않았다.

모델들은 Microsoft AzureOracle Cloud를 포함한 주요 클라우드 제공업체와 온프레미스 솔루션을 통해 제공된다. 오픈 가중치 특성은 사용자 정의를 허용하며, 커뮤니티는 특수 사용 사례를 위한 수많은 미세 조정 변형을 생산했다. Gemma 2의 출시는 특히 신경망 연구 커뮤니티에서 독점 시스템에 도전하는 오픈 가중치 모델의 광범위한 추세에 기여했다.

한계 및 향후 방향

강점에도 불구하고 Gemma 2는 훈련 데이터의 잠재적 편향과 가끔 발생하는 사실적 오류를 포함한 한계가 있다. 이 모델들은 복잡한 추론 작업에서 OpenAI의 GPT-4와 같은 가장 큰 독점 시스템만큼 능력이 뛰어나지 않다. 그러나 효율성과 개방성은 많은 애플리케이션에서 매력적으로 만든다. 2024년 기준으로 Google DeepMind는 Gemma 시리즈를 계속 반복하며, 향후 버전은 멀티 헤드 어텐션 변형 및 개선된 정렬 방법과 같은 새로운 기술을 통합할 것으로 예상된다.

Gemma 2의 출시는 또한 대규모 모델 훈련의 환경 영향에 대한 논의를 촉발했지만, 구체적인 에너지 소비 수치는 공개되지 않았다. 모델들은 이전 모델보다 더 효율적으로 설계되었으며, 2B 변형은 최소한의 리소스를 요구한다. 전반적으로 Gemma 2는 고품질 언어 모델을 더 넓은 청중에게 접근 가능하게 만드는 중요한 단계를 나타낸다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·google-deepmind·open-weight·generative-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사