Gemini 2023년 12월

영어에서 번역됨

Gemini는 2023년 12월 6일에 발표된 Google DeepMind가 개발한 다중 모드 대규모 언어 모델 제품군으로, 세 가지 등급(Ultra, Pro, Nano)으로 제공되며 Bard 및 Pixel 8과 같은 Google 제품에 통합되었습니다.

Gemini는 Google의 자회사인 Google DeepMind가 개발한 다중 모드 대규모 언어 모델(LLM) 제품군이다. 2023년 12월 6일에 발표된 Gemini는 이전 Google 모델인 LaMDA와 PaLM 2의 후속 모델로, 텍스트, 이미지, 오디오, 비디오, 컴퓨터 코드 등 여러 유형의 데이터를 동시에 처리할 수 있도록 설계되어 많은 텍스트 전용 LLM과는 구별된다. Gemini라는 이름은 별자리 쌍둥이자리를 가리키며, 동시에 Google Brain과 DeepMind의 합병과 NASA의 제미니 계획을 암시한다.

출시 당시에는 세 가지 모델 계층이 공개되었다: 고도로 복잡한 작업을 목표로 하는 Gemini Ultra, 다양한 작업을 위한 Gemini Pro, 온디바이스 작업에 최적화된 Gemini Nano이다. 출시 시점에 Gemini Pro는 구글의 바드 챗봇에 통합되었고, Gemini Nano는 Pixel 8 Pro 스마트폰 기능을 구동했다. Gemini Ultra는 2024년 초에 "Bard Advanced"라는 이름으로 출시될 예정이었다. 모델은 초기에 영어로만 제공되었으며, Google은 광범위한 배포 전에 광범위한 안전 테스트의 필요성을 언급했다.

개발

Google은 2023년 5월 10일 Google I/O 기조 연설에서 처음으로 Gemini를 발표했으며, CEO 순다르 피차이는 이를 해당 이벤트에서 공개된 PaLM 2보다 더욱 강력한 후속 모델로 칭했다. 일반적인 LLM과 달리 Gemini는 처음부터 다중 모드 시스템으로 설계되어 텍스트, 이미지, 오디오, 비디오, 코드를 포아 서 이해하고 생성할 수 있다. 이 개발은 해당 연도 초에 Google DeepMind로 합병된 DeepMind와 Google Brain 간의 협업이었다.

DeepMind CEO 데미스 하사비스는 Gemini이 GPT-4를 기반으로 실행되는 OpenAI의 ChatGPT를 능가할 잠재력을 강조했다. 그는 2016년 바둑 챔피언 이세돌을 이긴 DeepMind 프로그램인 AlphaGo와의 유사점을 들어, Gemini이 AlphaGo의 강점에 고급 언어 기능을 결합할 것이라고 인식했다. 2023년 8월, The Information은 Google이 2023년 후반 출시를 목표로 하고 있으며, 이미지 생성과 기타 다중 모드 기능을 통합하여 경쟁사들보다 앞서 나가 있는 계획이 있다고 보도했다.

Google 공동 창립자 세르게이 브린은 "핵심 기여자"로 인정 발으며 Gemini 개발에 참여하기 위해 은퇴에서 귀환되었다. 수백 명의 엔지니어들이 Google Brain와 DeepMind로프로젝트에 참여했다. Gemini가 YouTube 비디오 대본으로 학습된 충돌로 인해 저작권이 있을 수 있는 자료를 필터링하기 위해 변호사들이 참여했다.

출시 및 초기 배포

2023년 12월 6일, 피차이와 하사비시는 가상 기자 회견에서 Gemini 1.0을 발표했다. Ultra, 일반 작업용 Pro, 온디바이스 응용 프로그램용 Nano로 구성된 삼중 계층 구조가 공개되었다. 출시 시점에는 Gemini Pro가 Bard에 통합되었고, Gemini Nano가 Pixel 8 Pro에 내장되었다. Gemini Ultra는 2024년 초반에 예정되어 "Bard Advanced"를 제공하며 개발자에게 제공될 계획이었다. Google은 Gemini을 검색, 광고, Chrome, Google Workspace의 Duet AI 및 AlphaCode 2에 통합할 것으로 목표했다.

Gemini는 Google의 텐서 처리 유닛(TPU)에서 학습되었습니다. 구글은 이를 "가장 크고 유능한 인공 지능 모델"이라고 자랑하며, 인간의 행동을 모방하도록 설계되었다고 설명했다. 회사는 안전 테스트 요구로 인해 다음 연도 이전에 Gemini을 광범위하게 배포하지 않을 것이라고 밝혔다. 2023년 10월 조이 바이든이 서명한 미국 행정 명령에 따라, Google은 Gemini Ultra의 테스트 결과를 종종 정부와 공유하기로 합의했다. 영국 정부와의 논의도 11월에 열린 AI 보안 서밋에서 원칙과의 일치를 목표로 삼았다.

Gemini Ultra는 GPT-4, Anthropic의 Claude 2, Inflectionc의 Inflection-2, Meta의의 LLaMA 2 및 xAI의 Grok 1보다 산업 벤치마크에서 우수한 성능을 보였다고 한다. Gemini Pro는 GPT-3.5보다 우수하다고 말했다. Gemini Ultra는 57개 과목의 대규모 다중 작업 언어 이해(MMLU) 테스트에서 인간 전문가보다 우수한 최초의 언어 모델로, 90% 점수를 기록했다. Gemini는 2023년 12월 13일 AI Studio와 Vertex AI를 통해 Google Cloud 고객에게 제공되었다.

통합 및 추가 확장

2024년 1월, Google은 삼성과 협력하여 Gemini Nano와 Gemini Pro를 Galaxy S24 스마트폰 라인업에 통합했다. 다음 달, Bard와 Duet AI는 Gemini 브랜드로 통합되었고, "Gemini Ultra 1.0"은 구글 원의 새로운 "AI Premium" 계획을 통해 출시되었다. Gemini Pro도 세계 출시를 받았다.

2024년 2월, Google은 1.0 Ultra보다 "더 강력한" 것으로 설명되는 Gemini 1.5를 도입하면서, 새로운 아키텍처, 전문가 혼합 접근방식, 백만 토큰의 문맥 창을 갖추어라고 밝혔다. 같은 달 구글은 Meta와 다른 업체들이 AI 모델을 오픈소스로 공개하는 것에 대한 대응으로 부각되는 더 작고 오픈소스 인 Gemini 모델 시리즈인 Gemma를 공개했다.

2024년 5월 14일 Google I/O 기조 연설에서 Google은 빠르고 효율적인 모델인 Gemini 1.5 Flash를 발표했다. 또한 데스크톱 최적화 빌드 Gemini Nano를 Chrome 브라우저의 "각형 AI" 아키텍처를 통해 통합하고, Prompt API("window.ai")와같은 실험적 API를 통해 웹 개발자에게 로컬 처리 기능을 제공할 계획이 발표되었다.

후속 업데이트

두 개의 새로운 모델은 Gemini-1.5-Pro-002와 Gemini-1.5-Flash-002이며, 2024년 9월 24일에 출시되었다. 2024년 12월 11일, Google은 실시간 오디오 및 비디오 상호 작용을 위한 멀티 모달 라이브 API, 온디바이스 이미지 생성, 워터마크가 있는 제어식 텍스트 음성 변환 및 통합 Google 검색을 갖춘 Gemini 2.0 Flash Experimental을 발표했다.

2025년 6월, Google은 Gemini CLI를 도입했다. 이는 Gemini이 터미네이터한 AI 에이전트로, 코딩, 자동화 및 문제 해결 기능을 제공하며, 개별 개발자에게는 제공 가능한 무료 사용 한도가 제공된다.

기술 구조 및 성능

Gemini는 Transformer (architecture) 아키텍처에 기반하며, 다른 최근 Large language model와 유사하다. 이는 Multi-Head Attention 메커니즘과 Positional Encoding을 사용하여 순차 데이터를 처리한다. 이 모델은 다양한 데이터 유형으로 학습된 다중 모드이며, 학습 및 추론에 Google TPU를 사용한다. Gemini의 설계는 후속 버전에서 Mixture of experts와 같은 기술을 통합하고, 긴 문서와 복잡한 추론 과제를 처리할 수 있는 큰 컨텍스트 창을 지원합니다.

Gemini의 기능에는 자연 언어 이해, 코드 생성, 이미지 및 오디오 처리, 외부 도구와의 통합이 포함됩니다. 이 모델은 소비자 응용 프로그램인 Bard부터 Google Cloud의 엔터프라이즈 솔루션까지 다양한 영역에 더 좋은 활용할 수 있도록 설계되었습니다.

영향과 반응

Gemini의 출시는 Generative AI 분야의 경쟁을 격화시켰으며, 특히 OpenAI의 GPT-4 및 Anthropic의 Claude 모델과의 직접적인 대결을 제기합니다. Google은 Gemini를 이러한 시스템의 직접적인 도전자로 포지셔닝하고 있는데, 검색, 워크스페이스, 클라우드 등 Google의 생태계에 대한 깊은 통합을 활용했습니다. 다중 모드 특성은 더 인간적인 AI에 대한 중요한 단계으로 여겨지며, 하사비스가 Gemini신과 로봇공학을 결합한 신체적 상호작용을 위한 응용 가능성에 대해 암시한 바와 같이 로봇 공학 분야에 유의한 적용 가능성을 나타냈습니다.

산업 분석가는 MMLU과 같은 벤처와 같은 기준에서 강력한 성과를 것을 인정했지만, 안전, 편향성 및 대형 달 루안 모델의 학습에 따른 부담 환경 영향에 관한 우려도 직전했다. Google이 Gemma를 오픈소스로 만든 것은 커뮤니티 채택을 촉진하기 위한 전략적인 움직으로 관련 시각이며, 독점적 인공 지능에 대한 비판에 대응하기 위한 것이라는 것으로 읽혔다.

미래 방향

Google은 지속적으로 Gemini을 발전시키며 지속적인 업데이트와 버전을 제공합니다. Gemini과 Chrome 및 Android 기기에 통합 대중으로 인해 넓은 사용자 대중에게 온디바이스 AI를 접근 가능하게 하는 것을 목표하고 있습니다. Gemini CLI와 같은 개발을 지속적으로 확장함에 따라 개발자 중심 사용 사례에 초점을 맞추고 있습니다. 2025년 기준으로, Gemini는 Google의 AI 전략의 중심 부분이며 다른 주요 플레이어와 경쟁합니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ai-model·google-deepmind·large-language-model·multimodal-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사