Gemini는 Google의 자회사인 Google DeepMind가 개발한 다중 모달 대규모 언어 모델(LLM) 제품군이다. 2023년 12월 6일에 발표된 Gemini는 이전 Google 모델인 LaMDA와 PaLM 2의 후속 모델로 자리매김한다. 모델 제품군에는 Gemini Pro, Gemini Deep Think, Gemini Flash, Gemini Flash Lite가 포함되며, Gemini 챗봇을 구동한다. 이름은 Gemini 별자리에서 유래했으며, Google Brain과 DeepMind를 통합한 프로젝트의 이중적 성격을 상징한다. Gemini는 텍스트, 이미지, 오디오, 비디오, 컴퓨터 코드 등 여러 데이터 유형을 동시에 처리하도록 설계되어, 대부분 텍스트 전용이었던 이전 모델들과 차별화된다.
개발 배경
Google은 2023년 5월 10일 Google I/O 기조 연설에서 Gemini를 처음 발표했으며, 같은 행사에서 공개된 PaLM 2의 더 강력한 후속 모델로 포지셔닝했다. Google CEO 순다르 피차이는 Gemini가 아직 초기 개발 단계에 있다고 밝혔다. 텍스트 말뭉치로만 훈련된 일반적인 대규모 언어 모델과 달리, Gemini는 처음부터 다중 모달로 설계되어 다양한 입력 유형을 동시에 처리할 수 있게 했다. 개발은 DeepMind와 Google Brain 간의 협업으로 이루어졌으며, 이 두 조직은 단일 기관인 Google DeepMind로 통합되었다.
Wired와의 인터뷰에서 DeepMind CEO 데미스 허사비스는 Gemini의 고급 기능을 강조하며 GPT-4로 구동되는 OpenAI의 ChatGPT를 능가할 것이라고 시사했다. 허사비스는 2016년 바둑 챔피언 이세돌을 꺾으며 전 세계의 주목을 받은 DeepMind의 AlphaGo 프로그램의 강점을 부각하며, Gemini가 AlphaGo의 힘과 다른 Google-DeepMind LLM을 결합할 것이라고 말했다. 이러한 야망은 ChatGPT와 자사의 초기 Bard 챗봇의 인기 증가에 대한 Google의 공격적인 대응을 반영했다.
2023년 8월, The Information은 Google의 Gemini 로드맵을 설명하는 보고서를 발표하며 2023년 말 출시 목표를 공개했다. 보고서는 Google이 대화형 텍스트 기능과 인공지능 기반 이미지 생성 기능을 결합하여 상황에 맞는 이미지와 더 넓은 사용 사례를 제공함으로써 OpenAI 및 다른 경쟁사를 능가하기를 희망한다고 밝혔다. Google 공동 창업자 세르게이 브린은 개발을 돕기 위해 은퇴에서 소환되었으며, Google Brain과 DeepMind의 수백 명의 엔지니어와 함께 참여했고, 이후 "핵심 기여자"로 인정받았다. Gemini가 YouTube 동영상의 대본으로 훈련되었기 때문에, 잠재적인 저작권 자료를 걸러내기 위해 변호사들이 투입되었다.
출시 및 초기 모델
2023년 12월 6일, 피차이와 허사비스는 가상 기자 회견에서 "Gemini 1.0"을 발표했다. 출시는 세 가지 모델로 구성되었다: "매우 복잡한 작업"을 위해 설계된 Gemini Ultra, "다양한 작업"을 위한 Gemini Pro, "기기 내 작업"을 위한 Gemini Nano. 출시 당시 Gemini Pro와 Nano는 각각 Bard와 Pixel 8 Pro 스마트폰에 통합되었다. Gemini Ultra는 "Bard Advanced"를 구동하고 2024년 초에 소프트웨어 개발자에게 제공될 예정이었다. 통합 예정인 다른 제품에는 Search, Ads, Chrome, Google Workspace의 Duet AI, AlphaCode 2가 포함되었다. 초기 출시는 영어로만 제공되었다.
Google은 Gemini를 "가장 크고 가장 유능한 AI 모델"로 선전하며 인간 행동을 모방하도록 설계되었다고 밝혔다. 회사는 "광범위한 안전 테스트"의 필요성으로 인해 Gemini를 다음 해까지 널리 제공하지 않을 것이라고 명시했다. Gemini는 Google의 Tensor Processing Units(TPU)로 훈련되고 구동되었다. 이름은 또한 NASA의 Project Gemini를 참조하며, DeepMind와 Google Brain의 통합을 반영한다.
성능 및 벤치마크
Gemini Ultra는 다양한 산업 벤치마크에서 GPT-4, Anthropic의 Claude 2, Inflection AI의 Inflection-2, Meta의 LLaMA 2, xAI의 Grok 1을 능가하는 성능을 보인 것으로 보고되었다. Gemini Pro는 GPT-3.5를 능가하는 것으로 알려졌다. 특히, Gemini Ultra는 57개 주제의 Massive Multitask Language Understanding(MMLU) 테스트에서 인간 전문가를 능가한 최초의 언어 모델로, 90%의 점수를 달성했다. 이 벤치마크 결과는 Gemini를 Artificial intelligence 및 Large language model 연구 분야의 선도 모델로 자리매김하게 했다.
Gemini Pro는 2023년 12월 13일에 Google Cloud 고객에게 AI Studio 및 Vertex AI를 통해 제공되었다. Gemini Nano는 이후 Android 개발자에게 제공되었다. 허사비스는 또한 DeepMind가 Gemini를 로봇 공학과 결합하여 물리적으로 세계와 상호 작용하는 방법을 탐구하고 있다고 밝혔다. 2023년 10월 미국 대통령 조 바이든이 서명한 행정 명령에 따라, Google은 Gemini Ultra의 테스트 결과를 연방 정부와 공유할 것이라고 밝혔다. 마찬가지로, 회사는 2023년 11월 Bletchley Park에서 열린 AI 안전 정상 회의에서 제시된 원칙을 준수하기 위해 영국 정부와 논의를 진행했다.
Google 제품과의 통합
출시 이후, Gemini는 Google 생태계 전반에 빠르게 통합되었다. 2024년 1월, Google은 Samsung과 협력하여 Gemini Nano와 Gemini Pro를 Galaxy S24 스마트폰 라인업에 통합했다. 다음 달, Bard와 Duet AI는 Gemini 브랜드로 통합되었으며, "Gemini Advanced with Ultra 1.0"은 Google One 구독 서비스의 새로운 "AI Premium" 등급을 통해 출시되었다. Gemini Pro는 또한 초기 영어 전용 제공을 넘어 전 세계적으로 출시되었다.
2024년 2월, Google은 Gemini 1.5를 출시하며 1.0 Ultra보다 더 강력하고 유능하다고 설명했다. 변경 사항에는 새로운 아키텍처, mixture-of-experts 접근 방식, 더 큰 100만 토큰 컨텍스트 창이 포함되었다. 같은 달, Google은 더 작고 무료이며 오픈 소스인 Gemma 모델 범위를 공개했다. 여러 언론은 이를 Meta 및 다른 기업들이 AI 모델을 오픈 소스화하는 것에 대한 대응이자, Google이 자사 AI를 독점적으로 유지하던 이전 관행에서 전환한 것이라고 설명했다.
Google은 2024년 5월 14일 I/O 기조 연설에서 추가 모델인 Gemini 1.5 Flash를 발표했다. 같은 행사에서 Google은 데스크톱 최적화 빌드인 Gemini Nano를 "Built-in AI" 아키텍처를 통해 Google Chrome 브라우저에 직접 통합할 계획을 발표했으며, Prompt API("window.ai")와 같은 실험적 API를 통해 웹 개발자에게 로컬 처리 기능을 노출했다.
후속 업데이트 및 모델
두 개의 업데이트된 Gemini 모델인 Gemini-1.5-Pro-002와 Gemini-1.5-Flash-002가 2024년 9월 24일에 출시되었다. 2024년 12월 11일, Google은 새로운 Gemini 2.0 Flash Experimental 모델을 발표했다. 기능에는 실시간 오디오 및 비디오 상호 작용을 위한 Multimodal Live API, 네이티브 이미지 및 제어 가능한 텍스트 음성 변환 생성(워터마킹 포함), 통합 Google Search가 포함되었다. 이번 버전은 다중 모달 AI 기능의 경계를 계속 확장했다.
2025년 6월, Google은 Gemini CLI를 도입했다. 이는 Gemini의 기능을 터미널에 직접 제공하는 오픈 소스 AI 에이전트로, 고급 코딩, 자동화, 문제 해결 기능을 제공하며 개별 개발자에게 넉넉한 무료 사용 한도를 제공한다. 이 움직임은 개발자 접근성과 오픈 소스 도구에 대한 Google의 헌신을 강조했다.
경쟁적 포지셔닝
Gemini의 출시는 Generative AI의 경쟁 구도에서 중요한 사건이었다. Google은 Gemini를 OpenAI, Anthropic 및 기타 AI 연구 기관의 모델과 직접적으로 경쟁시켰다. 모델의 다중 모달 기능과 강력한 벤치마크 성능은 GPT-4 및 다른 선도 LLM의 지배력에 도전하기 위한 것이었다. Google은 Search, Workspace, Android를 포함한 광범위한 제품 생태계에 Gemini를 통합함으로써 경쟁사보다 유통 우위를 확보했다.
Gemini의 개발은 하드웨어 파트너와의 협업도 포함했다. Samsung Galaxy S24와의 통합은 기기 내 AI의 중요성을 강조했으며, Google TPU의 사용은 대규모 모델 훈련에서 특수 하드웨어의 역할을 부각시켰다. 경쟁 역학은 클라우드 서비스로 확장되어, Gemini Pro는 Google Cloud의 Vertex AI에서 제공되며 Amazon Web Services 및 Microsoft Azure의 제품과 경쟁했다.
기술 아키텍처 및 연구
Gemini의 아키텍처는 Deep learning 및 Transformer (architecture) 모델의 발전을 기반으로 한다. 다중 모달 모델로서, Multi-Head Attention 및 Cross-Attention의 기술을 통합하여 다양한 양식 간의 정보를 처리하고 연관시킨다. Gemini 1.5의 mixture-of-experts 접근 방식은 주어진 작업에 대해 네트워크의 관련 부분만 활성화하여 더 효율적인 확장을 가능하게 한다. 모델 훈련에는 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 및 Curriculum Learning과 같은 기술이 포함되었을 가능성이 높으며, 성능과 정렬을 개선하기 위한 것이다.
Gemini 뒤의 연구는 Machine learning의 더 넓은 분야에서 비롯되며, MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research)와 같은 기관의 기여를 포함한다. Google DeepMind의 유산, 특히 AlphaGo 프로그램은 복잡한 다단계 추론 작업을 처리하는 능력에 특히 영향을 미쳤다. 개발에는 데미스 허사비스 및 AI 커뮤니티의 다른 주요 인물들도 참여했다.
안전 및 거버넌스
Google은 Gemini에 대한 안전 테스트를 강조하며, 광범위한 평가를 수행하기 위해 널리 제공을 지연했다. 회사는 2023년 10월 AI에 대한 행정 명령에 따라 테스트 결과를 미국 연방 정부와 공유하기로 약속했다. 영국 정부와의 논의는 Bletchley Park AI 안전 정상 회의의 원칙에 부합하는 것을 목표로 했다. 이러한 조치는 Artificial intelligence에 대한 규제 감독 강화와 강력한 모델의 책임 있는 배포 필요성을 반영했다.
Pixel 8 Pro 및 Galaxy S24와 같은 소비자 제품에 Gemini를 통합한 것은 개인 정보 보호 및 기기 내 처리에 대한 질문을 제기했다. Gemini Nano의 로컬 처리 기능은 데이터 전송을 최소화하도록 설계되어 일부 개인 정보 보호 문제를 해결했다. 그러나 다중 모달 AI의 광범위한 배포는 윤리적 사용과 잠재적 사회적 영향에 대한 논쟁을 계속 촉발하고 있다.
향후 방향
2025년 현재, Gemini는 새로운 모델과 기능으로 계속 진화하고 있다. Gemini CLI 및 오픈 소스 Gemma 모델의 도입은 AI 기능에 대한 접근을 확대하는 전략을 나타낸다. Google의 Google DeepMind에 대한 지속적인 투자와 Google Cloud와의 통합은 Gemini가 회사의 AI 전략의 중심 기둥으로 남을 것임을 시사한다. 향후 개발에는 추론의 추가 개선, 더 효율적인 아키텍처, 그리고 허사비스가 Gemini와 로봇 공학의 결합에 대해 언급한 것처럼 로봇 및 물리적 시스템과의 더 깊은 통합이 포함될 수 있다.
경쟁 구도는 여전히 역동적이며, OpenAI 및 Anthropic이 고급 모델을 계속 출시하고 있다. Gemini의 성공은 성능 리더십을 유지하고, 다중 모달 기능을 확장하며, AI의 복잡한 규제 및 윤리적 환경을 탐색하는 능력에 달려 있을 것이다. 별자리의 이중적 성격을 연상시키는 모델의 이름은 다양한 AI 기능을 단일 강력한 시스템으로 통합하려는 프로젝트의 야망을 적절히 포착한다.