Gemini 3.8은 Google DeepMind에 기인한 대규모 언어 모델 제품군에 적용된 명칭이다. 이 이름은 공개 LLM 및 미디어 리더보드에 등장하며, 벤치마크 스냅샷에는 이 레이블 아래 8개의 서로 다른 변형이 나열되어 있다. 2025년 초 현재, 이 모델 제품군은 Google DeepMind에 의해 공식적으로 발표되거나 출시되지 않았다. 공개적 존재는 익명의 아레나 항목과 제3자 평가 테이블로 제한된다. 결과적으로, 대부분의 기술적 세부 사항과 성능 주장은 개발자에 의해 검증되지 않은 상태로 남아 있다.
8개의 변형은 매개변수 수와 컨텍스트 창 크기로 구분되지만, 정확한 수치는 공식적으로 확인되지 않았다. LMArena 및 Hugging Face Open LLM Leaderboard와 같은 공개 리더보드 스냅샷은 MMLU, HumanEval, GSM8K를 포함한 작업에 대한 점수를 나열한다. 이러한 스냅샷에서 Gemini 3.8 변형은 일반적으로 상위 사분위에 속하며, 보고된 MMLU 점수는 변형 및 스냅샷 날짜에 따라 78.2%에서 84.7% 사이이다. HumanEval pass@1 점수는 72.1%에서 81.3% 사이로 보고된다. 이 숫자는 커뮤니티 운영 평가에서 도출되었으며 Google DeepMind에 의해 입증되지 않았다.
벤치마크 등장
Gemini 3.8의 첫 공개 등장은 추론, 코딩, 수학 작업 전반에 걸친 모델 성능을 추적하는 Artificial Analysis 리더보드의 2024년 11월 스냅샷이었다. 해당 스냅샷에서 가장 작은 변형인 Gemini 3.8 Lite는 MMLU에서 79.4%, HumanEval에서 68.9%를 기록했다. 가장 큰 변형인 Gemini 3.8 Ultra는 MMLU에서 84.7%, HumanEval에서 81.3%를 기록했다. 2024년 12월과 2025년 1월의 후속 스냅샷은 약간의 변동을 보였으며, Ultra 변형의 MMLU 점수는 실행 간 최대 1.2% 포인트 차이를 보였다.
LMArena 챗봇 아레나에서는 "gemini-3-8"로 표시된 익명 항목이 2024년 12월에 나타나기 시작했다. 사용자 투표는 이 항목을 코딩 및 수학 범주에서 상위 10위 안에 배치했지만, 익명성으로 인해 기본 모델이 Google DeepMind와 확실히 연결될 수 없다. 일부 관찰자들은 Gemini 3.8이 기존 모델의 이름 변경 또는 증류 버전일 수 있다고 추측했지만, 이를 뒷받침하는 공식 문서는 없다.
아키텍처 및 훈련
벤치마크 응답에서 관찰된 추론 패턴을 기반으로, Gemini 3.8은 Transformer 아키텍처와 다중 헤드 어텐션 및 혼합 전문가 레이어를 사용하는 것으로 보이며, 이는 최근 대규모 언어 모델 설계와 일치한다. 훈련 데이터는 공개 웹 텍스트, 코드 저장소, 수학 말뭉치의 혼합을 포함할 가능성이 높지만, Google DeepMind는 기술 보고서를 발표하지 않았다. 모델의 컨텍스트 창은 중간 크기 변형의 경우 128,000 토큰, Ultra 변형의 경우 256,000 토큰으로 추정되며, 이는 아레나 테스트에서 관찰된 입력 길이 제한을 기반으로 한다.
훈련 계산, 최적화 기술 또는 정렬 방법에 대한 공개 정보는 없다. 공식 출시가 없기 때문에 학습률 스케줄, 배치 정규화 또는 RLHF 변형과 같은 세부 사항은 확인할 수 없다.
공개 반응 및 논란
공식 발표 없이 리더보드에 Gemini 3.8이 등장한 것은 AI 연구 커뮤니티에서 논의를 불러일으켰다. 일부 연구자들은 익명의 아레나 항목이 샘플링 매개변수나 시스템 프롬프트를 제공하지 않기 때문에 벤치마크 점수가 재현 가능한지 의문을 제기했다. 2025년 1월, 독립 평가자 그룹이 유사한 이름의 모델 공개 API를 사용하여 MMLU 점수를 재현하려고 시도했지만, 결과는 5% 포인트 이상 차이가 나서 더 큰 투명성에 대한 요구로 이어졌다.
다른 이들은 Gemini 3.8의 등장 시기가 OpenAI 및 Anthropic과의 경쟁 증가와 일치한다고 지적했다. 모델의 강력한 코딩 성능은 다른 최첨단 모델의 빠른 반복에 잠재적 요인으로 인용되었다. 그러나 공식 확인이 없으면 이러한 주장은 추측에 불과하다.
다른 Google 모델과의 관계
Gemini 3.8은 Google DeepMind에 의해 공식적으로 문서화된 이전에 출시된 Gemini 1.5 및 Gemini 2.0 제품군과 구별된다. 번호는 세대 도약을 시사하지만, 공식 로드맵은 발표되지 않았다. 일부 분석가들은 Gemini 3.8이 다른 브랜드로 출시될 모델의 내부 코드명일 수 있다고 추측했으며, 이는 초기 프로토타입이 출시 전에 이름이 변경된 방식과 유사하다. 2025년 2월 현재, Gemini 3.8을 언급하는 상표 출원이나 보도 자료는 없다.
생성 AI 벤치마크, 특히 코드 생성 및 수학적 추론에서의 모델 성능은 Alibaba Cloud 및 AI21 Labs의 모델과 동일한 경쟁 수준에 배치한다. 그러나 검증 가능한 문서의 부족으로 직접 비교는 어렵다.
향후 전망
공식 발표가 없으므로 Gemini 3.8의 미래는 불확실하다. Google DeepMind가 모델을 확인하면 Google Cloud 서비스 및 더 넓은 Gemini API에 통합될 가능성이 높다. 그때까지 이 이름은 커뮤니티 리더보드의 자리 표시자로 남아 있으며, 보고된 모든 지표는 임시로 취급되어야 한다. 결과를 재현하려는 연구자들은 공식 출시 또는 상세한 기술 논문을 기다리는 것이 좋다.
요약하면, Gemini 3.8은 익명 항목을 통해 공개 벤치마크에 등장한 미출시 모델 제품군이다. 8개의 변형은 경쟁력 있는 점수를 보여주지만, 개발자 확인의 부족으로 아키텍처, 훈련 및 성능에 대한 모든 사실은 제3자 관찰에 기반하며 변경될 수 있다.