Gemini 1은 Google DeepMind가 개발한 다중 모드 대규모 언어 모델 제품군으로, 2023년 12월 6일에 LaMDA와 PaLM 2의 후속 모델로 발표되었다. 이 제품군은 세 가지 초기 모델로 구성된다: 매우 복잡한 작업을 위해 설계된 Gemini Ultra, 다양한 작업을 위한 Gemini Pro, 그리고 기기 내 작업을 위한 Gemini Nano이다. 이 제품군은 Gemini 챗봇을 구동하며, Google Brain과 DeepMind의 합병을 반영하여 쌍둥이자리에서 이름을 따왔다. 텍스트 전용 전임 모델과 달리 Gemini는 텍스트, 이미지, 오디오, 비디오 및 컴퓨터 코드를 동시에 처리하도록 훈련되었으며, 이를 통해 OpenAI의 GPT-4 및 기타 생성형 AI 시스템의 직접적인 경쟁자로 자리매김했다.
이번 출시는 인공지능 개발의 중대한 전환점이 되었는데, Gemini Ultra는 57개 과목으로 구성된 MMLU(Massive Multitask Language Understanding) 테스트에서 90%의 점수를 기록하며 인간 전문가를 능가한 최초의 모델이 되었다. Google은 이를 "가장 크고 가장 강력한 AI 모델"이라고 선전했으며, 그 기능은 머신 러닝, 딥 러닝, 신경망 아키텍처에 걸쳐 있다.
개발 배경
Google은 2023년 5월 10일 Google I/O 기조 연설에서 Gemini를 처음 발표했으며, CEO 순다르 피차이는 아직 초기 개발 단계라고 설명했다. 이 모델은 Google DeepMind 산하로 합병된 DeepMind와 Google Brain의 협업으로 구축되었다. DeepMind CEO 데미스 허사비스는 인터뷰에서 Gemini가 대화형 텍스트 기능과 AI 기반 이미지 생성 기능을 결합할 것이라고 강조했으며, 2016년에 전 세계적인 주목을 받은 DeepMind의 AlphaGo 프로그램의 강점을 활용할 것이라고 밝혔다.
개발에는 수백 명의 엔지니어가 참여했으며, Google 공동 창업자 세르게이 브린이 은퇴에서 복귀하여 이후 "핵심 기여자"로 인정받았다. 이 모델은 YouTube 동영상의 대본으로 훈련되었으며, 변호사들이 잠재적으로 저작권이 있는 자료를 필터링했다. 2023년 8월까지 2023년 말 출시를 목표로 한다는 보고가 있었으며, 일부 선정된 기업에는 Google Cloud의 Vertex AI 서비스를 통해 조기 액세스가 제공되었다.
출시 및 초기 모델
2023년 12월 6일, 피차이와 허사비스는 가상 기자 회견에서 "Gemini 1.0"을 발표했다. 출시 당시 Gemini Pro와 Nano는 각각 Bard와 Pixel 8 Pro 스마트폰에 통합되었으며, Gemini Ultra는 2024년 초 "Bard Advanced" 및 개발자용으로 제공될 예정이었다. 이 모델은 처음에는 영어로만 제공되었으며, Google은 광범위한 출시 전에 "광범위한 안전성 테스트"가 필요하다고 밝혔다.
Gemini는 Google의 Tensor Processing Unit(TPU)에서 훈련되었다. Gemini Ultra는 업계 벤치마크에서 GPT-4, Anthropic의 Claude 2, Inflection AI의 Inflection-2, Meta의 LLaMA 2, xAI의 Grok 1을 능가하는 것으로 알려졌으며, Gemini Pro는 GPT-3.5를 능가했다. Gemini Pro는 2023년 12월 13일 Google Cloud 고객에게 AI Studio 및 Vertex AI에서 제공되기 시작했다. 2023년 10월 미국 행정 명령에 따라 Google은 테스트 결과를 연방 정부와 공유했으며, Bletchley Park 정상 회담의 AI 안전 원칙에 대해 영국 정부와 협력했다.
기술 아키텍처 및 기능
Gemini의 아키텍처는 트랜스포머 모델을 활용했으며, 멀티 헤드 어텐션 및 위치 인코딩 메커니즘을 통합했다. 다중 모드 설계는 다양한 데이터 유형을 동시에 처리할 수 있게 했으며, 이는 텍스트 전용 LLM과의 차별점이었다. 이 모델은 출력 제어를 위해 AI 피드백 기반 강화 학습 및 온도 스케일링과 같은 기술을 통합했으며, 생성 다양성을 위해 top-k 샘플링 및 top-p 샘플링을 사용했다.
모델 훈련에는 Adam 옵티마이저 변형, 학습률 스케줄, 그래디언트 클리핑이 사용되어 딥 러닝 프로세스를 안정화했다. 배치 정규화 및 드롭아웃은 일반화를 개선하는 데 사용되었으며, 모델 가지치기는 Gemini Nano의 기기 내 배포를 위한 효율성 최적화에 도움이 되었다.
업데이트 및 확장
2024년 1월, Google은 삼성전자와 협력하여 Gemini Nano 및 Pro를 Galaxy S24 스마트폰 라인업에 통합했다. 다음 달, Bard와 Duet AI는 Gemini 브랜드로 통합되었으며, Google One의 새로운 "AI Premium" 등급을 통해 "Gemini Advanced with Ultra 1.0"이 출시되었다. Gemini Pro는 전 세계적으로 출시되었다.
2024년 2월, Google은 새로운 아키텍처, 혼합 전문가 접근 방식, 백만 토큰 컨텍스트 창을 갖춘 Gemini 1.5를 출시했다. 같은 달, Google은 Meta의 오픈소스 관행에 대한 대응으로 설명된 더 작고 무료이며 오픈소스인 Gemini 모델 제품군인 Gemma를 공개했다. Gemini 1.5 Flash는 2024년 5월 14일 I/O 기조 연설에서 발표되었으며, Gemini Nano를 "Built-in AI" 아키텍처를 통해 Google Chrome에 통합할 계획이었다. 업데이트된 모델인 Gemini-1.5-Pro-002 및 Gemini-1.5-Flash-002는 2024년 9월 24일에 출시되었다.
영향 및 유산
Gemini 1은 Google DeepMind를 생성형 AI 분야의 선도적인 세력으로 확립했으며, OpenAI 및 Anthropic과 직접 경쟁했다. 다중 모드 접근 방식은 이후 업계 전반의 모델 개발에 영향을 미쳤으며, 여기에는 클라우드 기반 AI 서비스 분야의 Amazon Web Services 및 Microsoft Azure의 노력도 포함된다. 이 모델의 Pixel 스마트폰 및 삼성 기기와 같은 소비자 제품 통합은 AI 접근성을 확대했으며, 오픈소스 Gemma 모델은 더 넓은 AI 연구 커뮤니티에 기여했다.
이번 출시는 또한 규제 논의를 촉발했으며, Google은 안전성 테스트에 대해 미국 및 영국 정부와 협력했다. 2025년 현재 Gemini는 여러 버전으로 진화했으며, Gemini 2.0이 2024년 12월에 발표되었지만, Gemini 1은 대규모 다중 모드 AI 시스템의 실현 가능성을 입증한 기초적인 출시로서 여전히 중요한 의미를 지닌다.