Gemini는 Google의 자회사인 Google DeepMind가 개발한 다중 모드 대규모 언어 모델(LLM) 제품군이다. 이는 이전 Google 모델인 LaMDA 및 PaLM 2의 후속 모델 역할을 한다. Gemini 제품군에는 Gemini Pro, Gemini Deep Think, Gemini Flash, Gemini Flash Lite 등 여러 변형이 포함되며, Gemini 챗봇을 구동한다. Gemini라는 이름은 쌍둥이자리를 의미하며, Google Brain과 DeepMind의 합병 및 NASA의 제미니 계획을 암시하기도 한다. 2023년 12월 6일에 발표된 Gemini는 텍스트, 이미지, 오디오, 비디오 및 컴퓨터 코드를 포함한 여러 데이터 유형을 동시에 처리하도록 설계되어, 대부분 텍스트만 처리하던 이전 모델들과 차별화된다.
Gemini의 개발은 생성형 AI 분야, 특히 OpenAI의 GPT-4 및 기타 대규모 언어 모델과의 경쟁에서 Google의 노력에 중요한 진전을 의미했다. Google은 Gemini를 "가장 크고 가장 유능한 AI 모델"로 포지셔닝했으며, 그 기능은 텍스트 생성 이상으로 이미지 이해 및 생성, 로봇 공학과의 잠재적 통합까지 확장된다. 이 모델은 Google의 텐서 처리 장치(TPU)로 훈련되었으며, 처음에는 영어로만 제공되었고, Google 제품 및 서비스 전반에 걸쳐 단계적으로 출시되었다.
개발
Google은 2023년 5월 10일 Google I/O 기조 연설에서 Gemini를 처음 발표했으며, CEO 순다르 피차이는 이를 같은 행사에서 공개된 PaLM 2보다 더 강력한 후속 모델이라고 설명했다. 당시 Gemini는 초기 개발 단계였지만, 기존 LLM이 주로 텍스트 말뭉치에 의존했던 것과 달리 다중 모드 설계로 이미 주목을 받았다. 이 모델은 2023년 4월 Google DeepMind로 합병된 두 AI 연구 그룹인 DeepMind와 Google Brain 간의 협업으로 개발되었다.
DeepMind CEO 데미스 허사비스는 Wired와의 인터뷰에서 Gemini의 잠재력을 강조하며, GPT-4로 구동되는 OpenAI의 ChatGPT를 능가할 수 있다고 시사했다. 허사비스는 2016년 바둑 챔피언 이세돌을 꺾은 프로그램인 AlphaGo에 대한 DeepMind의 경험을 바탕으로, Gemini가 AlphaGo의 강점과 다른 Google-DeepMind LLM을 결합할 것이라고 밝혔다. 2023년 8월, The Information은 Google이 2023년 말까지 Gemini 출시를 목표로 하고 있으며, 대화형 텍스트 기능과 AI 기반 이미지 생성 기능을 통합하여 상황에 맞는 이미지 생성 및 더 넓은 사용 사례를 가능하게 할 계획이라고 보도했다.
Google 공동 창업자 세르게이 브린은 은퇴를 접고 Gemini 개발을 돕기 위해 복귀하여 Google Brain과 DeepMind의 수백 명의 엔지니어와 함께 작업했다. 브린은 이후 이 프로젝트의 "핵심 기여자"로 인정받았다. Gemini가 YouTube 동영상의 대본으로 훈련되었기 때문에, Google은 저작권이 있는 자료를 걸러내기 위해 변호사들을 고용했다. 개발 과정에는 광범위한 안전 테스트도 포함되었으며, Google은 책임 있는 배포를 보장하기 위해 Gemini를 2024년까지 널리 출시하지 않을 것이라고 밝혔다.
Gemini 출시 임박에 대응하여 OpenAI는 GPT-4에 다중 모드 기능을 통합하는 작업을 가속화했다. 2023년 9월까지 여러 기업이 Gemini 초기 버전에 대한 조기 액세스 권한을 부여받았으며, Google은 이를 Google Cloud의 Vertex AI 서비스를 통해 제공할 계획이었다. 이 모델은 또한 코딩 어시스턴트 분야에서 Microsoft의 GitHub Copilot과 경쟁하도록 포지셔닝되었다.
출시
2023년 12월 6일, 순다르 피차이와 데미스 허사비스는 가상 기자 회견에서 "Gemini 1.0"을 발표했다. 초기 출시에는 세 가지 모델이 포함되었다: "매우 복잡한 작업"을 위해 설계된 Gemini Ultra, "광범위한 작업"을 위한 Gemini Pro, "기기 내 작업"을 위한 Gemini Nano. 출시 당시 Gemini Pro와 Nano는 각각 Google의 챗봇인 Bard와 Pixel 8 Pro 스마트폰에 통합되었다. Gemini Ultra는 "Bard Advanced"를 구동하고 2024년 초에 개발자에게 제공될 예정이었다. Google은 또한 Gemini를 Search, Ads, Chrome, Google Workspace의 Duet AI 및 AlphaCode 2에 통합할 계획이었다.
Gemini는 처음에는 영어로만 제공되었다. Google은 이를 "가장 크고 가장 유능한 AI 모델"로 선전하며 인간 행동을 모방하도록 설계되었다고 강조했다. 회사는 "광범위한 안전 테스트"의 필요성으로 인해 Gemini가 다음 해까지 널리 제공되지 않을 것이라고 강조했다. Gemini는 Google의 TPU로 훈련되고 구동되었으며, 그 이름은 DeepMind-Google Brain 합병과 NASA의 제미니 계획을 참조했다.
Gemini Ultra는 다양한 산업 벤치마크에서 GPT-4, Anthropic의 Claude 2, Inflection AI의 Inflection-2, Meta의 LLaMA 2 및 xAI의 Grok 1을 포함한 여러 경쟁 모델을 능가하는 것으로 알려졌다. Gemini Pro는 GPT-3.5를 능가하는 것으로 알려졌다. 특히 Gemini Ultra는 57개 과목의 MMLU(Massive Multitask Language Understanding) 테스트에서 인간 전문가를 능가한 최초의 언어 모델로 90%의 점수를 달성했다. Gemini Pro는 2023년 12월 13일에 AI Studio 및 Vertex AI의 Google Cloud 고객에게 제공되었으며, Gemini Nano는 이후 Android 개발자에게 제공되었다.
허사비스는 또한 DeepMind가 Gemini를 로봇 공학과 결합하여 세계와의 물리적 상호 작용을 가능하게 하는 방법을 모색하고 있다고 밝혔다. 2023년 10월 조 바이든 대통령이 서명한 미국 행정 명령에 따라 Google은 Gemini Ultra의 테스트 결과를 미국 연방 정부와 공유할 것이라고 밝혔다. 마찬가지로 Google은 2023년 11월 Bletchley Park에서 열린 AI 안전 정상 회의의 원칙에 맞춰 영국 정부와 협력했다.
2025년 6월, Google은 Gemini CLI를 도입했다. 이는 Gemini의 기능을 터미널에 제공하는 오픈 소스 AI 에이전트로, 코딩, 자동화 및 문제 해결 기능을 제공하며 개인 개발자에게 넉넉한 무료 사용 한도를 제공한다.
업데이트
2024년 1월, Google은 삼성과 협력하여 Gemini Nano와 Gemini Pro를 Galaxy S24 스마트폰 라인업에 통합했다. 다음 달, Bard와 Duet AI는 Gemini 브랜드로 통합되었고, "Gemini Advanced with Ultra 1.0"은 Google One 구독 서비스의 새로운 "AI Premium" 등급을 통해 출시되었다. Gemini Pro도 전 세계적으로 출시되었다.
2024년 2월, Google은 Gemini 1.5를 출시하며 1.0 Ultra보다 더 강력하고 유능하다고 설명했다. 변경 사항에는 새로운 아키텍처, 전문가 혼합 방식 및 더 큰 100만 토큰 컨텍스트 창이 포함되었다. 같은 달, Google은 더 작고 무료이며 오픈 소스인 Gemma 모델 제품군을 공개했다. 여러 언론은 이를 Meta 및 다른 기업들의 AI 모델 오픈 소스화에 대한 대응이자, AI를 독점적으로 유지해 온 Google의 기존 관행에서의 전환으로 설명했다.
Google은 2024년 5월 14일 Google I/O 기조 연설에서 추가 모델인 Gemini 1.5 Flash를 발표했다. 같은 행사에서 Google은 데스크톱 최적화 빌드인 Gemini Nano를 "Built-in AI" 아키텍처를 통해 Google Chrome 브라우저에 직접 통합하고, Prompt API("window.ai")와 같은 실험적 API를 통해 웹 개발자에게 로컬 처리 기능을 노출할 계획을 발표했다.
두 가지 업데이트된 Gemini 모델인 Gemini-1.5-Pro-002와 Gemini-1.5-Flash-002가 2024년 9월 24일에 출시되었다.
2024년 12월 11일, Google은 새로운 Gemini 2.0 Flash Experimental 모델을 발표했다. 기능에는 실시간 오디오 및 비디오 상호 작용을 위한 Multimodal Live API, 네이티브 이미지 및 제어 가능한 텍스트 음성 변환 생성(워터마킹 포함), 통합 Google Search가 포함된다. 또한 추론 및 코딩 기능의 개선도 도입되었다.
아키텍처 및 훈련
Gemini는 많은 현대 대규모 언어 모델의 기반이 되는 트랜스포머 아키텍처를 기반으로 구축되었다. 이 모델은 이후 버전에서 전문가 혼합 방식을 사용하여 각 작업에 관련 하위 네트워크만 활성화함으로써 효율적으로 확장할 수 있다. 훈련에는 저작권 준수를 위해 신중한 필터링이 필요한 YouTube 대본을 포함한 다양한 저장소에서 가져온 텍스트, 이미지, 오디오, 비디오 및 코드를 포함한 대규모 데이터 세트가 사용되었다.
이 모델은 Google의 맞춤형 인공 지능 가속기인 TPU로 훈련되었다. 이 인프라는 Gemini가 대규모 훈련 실행을 처리할 수 있게 하여 MMLU와 같은 벤치마크에서의 성능에 기여했다. 다중 모드 훈련 접근 방식은 Gemini가 다양한 양식에 걸쳐 콘텐츠를 처리하고 생성할 수 있게 하여 텍스트 생성에서 이미지 이해에 이르는 응용 분야에 다재다능함을 제공한다.
기능 및 성능
Gemini의 기능은 여러 영역에 걸쳐 있다. 복잡한 추론 작업을 수행하고, 코드를 생성하고, 이미지를 이해하고 생성하며, 오디오와 비디오를 처리할 수 있다. 산업 벤치마크에서의 모델 성능은 주요 판매 포인트였다. Gemini Ultra가 인간 전문가를 능가한 MMLU에서의 90% 점수는 57개 과목에 걸친 광범위한 지식을 강조하는 주목할 만한 성과였다.
벤치마크 외에도 Gemini는 Search, Ads 및 Chrome을 포함한 다양한 Google 제품에 통합되어 AI 기반 기능을 강화했다. Gemini 1.5에서 최대 100만 토큰의 긴 컨텍스트 창을 처리하는 모델의 능력은 대규모 문서나 전체 코드베이스를 처리할 수 있게 하여 개발자와 연구자에게 유용하다.
통합 및 생태계
Gemini는 Google Cloud 및 Vertex AI를 포함한 Google의 클라우드 서비스에 통합되어 기업이 그 기능에 액세스할 수 있다. 또한 2024년 2월 Bard에서 브랜드가 변경된 Gemini 챗봇을 구동한다. Gemini Nano를 통해 Android 기기에서 모델을 사용할 수 있게 되어 개인 정보 보호 및 지연 시간에 민감한 응용 프로그램에 중요한 기기 내 AI 처리가 가능하다.
Google은 또한 삼성전자와의 Galaxy S24 파트너십 및 더 작고 접근하기 쉬운 모델인 Gemma와 같은 오픈 소스 출시를 통해 Gemini를 제공하고 있다. 2025년에 도입된 Gemini CLI는 개발자에게 명령줄 인터페이스를 제공하여 생태계를 더욱 확장한다.
평가 및 영향
Gemini는 다중 모드 기능과 강력한 벤치마크 성능으로 AI 커뮤니티에서 좋은 평가를 받았다. 그러나 안전, 저작권 문제 및 대규모 모델 훈련의 환경 영향과 관련하여 비판에 직면하기도 했다. Google이 테스트 결과를 정부와 공유하기로 한 결정은 AI 규제 및 안전에 대한 더 넓은 우려를 반영한다.
Gemini의 출시는 AI 산업의 경쟁을 심화시켜 OpenAI 및 Anthropic과 같은 경쟁사들이 자체 개발을 가속화하도록 촉구했다. Gemini의 Google 제품 통합은 시장 지배력과 AI 배포의 윤리적 영향에 대한 의문도 제기했다.
향후 방향
Google은 Gemini 2.0 Flash Experimental와 같은 업데이트를 통해 실시간 상호 작용 및 다중 모드 생성에 초점을 맞추며 Gemini를 계속 발전시키고 있다. 로봇 공학 통합 탐구는 물리적 AI 시스템에서의 잠재적 응용을 시사한다. 2025년 현재, Gemini는 추론, 효율성 및 안전성 개선에 대한 지속적인 연구와 함께 더욱 진화할 것으로 예상된다.
Gemini의 개발은 또한 모델이 더욱 다중 모드화되고 복잡한 작업을 처리할 수 있게 되는 생성형 AI의 더 넓은 추세와 일치한다. 맞춤형 칩을 위한 Google의 TPU 투자 및 브로드컴과의 파트너십은 AI 인프라 발전에 대한 헌신을 강조한다.