Google Gemini 3 멀티모달 출시

영어에서 번역됨

2025년 11월 Google DeepMind가 발표한 Gemini 3는 텍스트, 이미지, 비디오, 오디오를 동시에 처리하는 네이티브 멀티모달 대규모 언어 모델로, Gemini 2.0의 후속 모델이며 Gemini 챗봇을 구동한다.

Gemini 3는 Google DeepMind가 개발한 다중 모드 대규모 언어 모델(LLM) 제품군으로, 2025년 11월에 Gemini 2.0의 후속 모델로 발표되었다. 이 모델은 본래 다중 모드(natively multimodal)로, 텍스트, 이미지, 비디오, 오디오를 처음부터 동시에 처리하며, 각 양식에 대해 별도의 구성 요소에 의존하지 않는다. 이 모델은 Gemini 챗봇을 구동하며, 2023년 12월에 출시된 원래 Gemini 1.0에서 확립된 명명 규칙을 이어받아 쌍둥이자리(Gemini) 별자리에서 이름을 따왔다.

이번 출시로 Gemini 3는 OpenAIAnthropic의 모델과 직접 경쟁하는 위치에 놓였으며, Google은 통합 아키텍처를 핵심 차별점으로 강조했다. 보조 모듈을 통해 다중 모드 기능을 통합했던 초기 버전과 달리, Gemini 3는 모든 데이터 유형에 대해 종단 간(end-to-end)으로 훈련되어 단일 패스에서 여러 양식에 걸쳐 추론할 수 있다. 이 설계는 2023년에 DeepMind와 Google Brain을 합병하여 개발을 가속화한 Google DeepMind의 기초 작업을 기반으로 한다.

개발 배경

Gemini 3의 개발은 2023년 5월 10일 Google I/O에서 CEO 순다르 피차이(Sundar Pichai)가 처음 발표한 원래 Gemini 프로젝트로 거슬러 올라간다. 초기 모델인 Gemini 1.0은 2023년 12월 6일에 출시되었으며, 복잡한 작업용 Ultra, 일반 사용용 Pro, 온디바이스 처리용 Nano의 세 가지 변형으로 제공되었다. 이 모델은 Google의 텐서 처리 장치(TPU)로 훈련되었으며, 2016년 바둑 챔피언 이세돌을 꺾은 DeepMind의 AlphaGo 프로그램에서 얻은 교훈을 통합했다.

이후 반복을 통해 아키텍처가 개선되었다. 2024년 2월에 출시된 Gemini 1.5는 혼합 전문가(mixture-of-experts) 접근 방식과 100만 토큰 컨텍스트 창을 도입했다. 2024년 12월 11일에 발표된 Gemini 2.0 Flash Experimental는 실시간 오디오 및 비디오 상호 작용을 위한 다중 모드 라이브 API를 추가했다. Gemini 3는 이러한 발전을 기반으로 하며, 2025년 11월 출시는 본래 다중 모드를 부가 기능이 아닌 핵심 기능으로 중점을 두었다.

개발 팀에는 Google Brain과 DeepMind의 수백 명의 엔지니어가 포함되었으며, 공동 창립자 세르게이 브린(Sergey Brin)이 이전 버전과 마찬가지로 핵심 기여자로 참여했다. 훈련 데이터에는 YouTube 비디오의 대본이 포함되었으며, 법무 팀이 잠재적으로 저작권이 있는 자료를 필터링했는데, 이 관행은 Gemini 3에서도 계속되었다.

본래 다중 모드 아키텍처

Gemini 3의 정의적 특징은 텍스트, 이미지, 비디오, 오디오를 통합 트랜스포머 아키텍처를 통해 처리하는 본래 다중 모드 설계이다. 이는 각 양식을 별도의 인코더와 디코더로 처리했던 Gemini 1.0과 같은 초기 모델과 대조된다. 통합 접근 방식은 중간 변환 단계 없이 양식 간 정보를 연관시킬 수 있어, 동기화된 오디오와 시각적 추론을 통한 비디오 이해와 같은 작업을 개선한다.

이 아키텍처는 여러 입력 스트림을 처리하도록 확장된 멀티 헤드 어텐션 메커니즘을 활용한다. 위치 인코딩은 시간적 및 공간적 차원에 적용되어 모델이 비디오 프레임 전체에서 객체를 추적하고 음성을 해당 시각적 요소와 정렬할 수 있게 한다. 이 설계는 많은 기존 LLM에서 사용된 인코더-디코더 구조에서 벗어나, 모든 양식을 공동으로 처리하는 단일 트랜스포머를 선호한다.

훈련에는 오디오 대본이 포함된 비디오 클립과 이미지 캡션과 같은 짝을 이룬 다중 모드 예제를 생성하기 위한 데이터 증강 기법이 사용되었다. 모델은 다양한 데이터 유형에 걸쳐 훈련을 안정화하기 위해 레이어 정규화잔차 연결을 사용한다. Google DeepMind는 이 접근 방식이 각 양식에 대한 별도의 미세 조정 단계의 필요성을 줄였다고 보고했다.

모델 변형 및 기능

Gemini 3는 이전 버전의 계층적 접근 방식을 이어받아 다양한 사용 사례를 지원하기 위해 여러 구성으로 제공된다. 제품군에는 복잡한 추론 작업용 Gemini 3 Ultra, 일반 응용 프로그램용 Gemini 3 Pro, 저지연 응답용 Gemini 3 Flash, 리소스 제한 환경용 Gemini 3 Flash Lite가 포함된다. 각 변형은 동일한 본래 다중 모드 코어를 공유하지만 매개변수 수와 속도 대 정확도 최적화에서 차이가 있다.

기능에는 오디오 통합 실시간 비디오 분석, 텍스트 설명에서 이미지 생성, 교차 양식 검색(예: 음성 쿼리를 기반으로 비디오에서 특정 순간 찾기)이 포함된다. 모델은 또한 출력 생성을 제어하기 위한 top-p 샘플링온도 스케일링을 지원하며, Gemini 2.0에서 상속된 기능인 워터마킹을 통한 텍스트 음성 변환을 생성하여 진위를 확인할 수 있다.

개발자를 위해 Gemini 3는 Google Cloud의 Vertex AI 및 AI Studio 플랫폼을 통해 액세스할 수 있으며, 스트리밍 오디오 및 비디오 입력을 지원하는 API를 제공한다. 모델은 최신 정보 검색을 위해 Google 검색과 통합되며, 웹 및 모바일 인터페이스에서 Gemini 챗봇을 구동한다.

성능 및 벤치마크

출시 당시 Google DeepMind는 Gemini 3 Ultra가 여러 산업 벤치마크에서 전임자 및 경쟁 모델보다 우수한 성능을 보였다고 보고했지만, 구체적인 점수는 완전히 공개되지 않았다. 회사는 양식을 별도로 처리하는 모델보다 본래 아키텍처가 이점을 제공하는 시각적 질문 응답 및 비디오 이해와 같은 다중 모드 추론 작업에서 개선을 주장했다.

이전 Gemini 버전은 높은 기대치를 설정했다. Gemini Ultra는 57개 주제의 대규모 다중 작업 언어 이해(MMLU) 테스트에서 90% 점수로 인간 전문가 성능을 초과한 최초의 LLM이었다. Gemini 3는 이 유산을 기반으로 하며, 초기 보고에 따르면 Video-MMLU 및 AudioQA와 같은 다중 모드 벤치마크에서 강력한 결과를 보였지만, 출시 날짜 기준으로 독립적 검증은 진행 중이었다.

모델의 성능은 TPU 훈련과 다중 모드 데이터에 맞게 조정된 배치 정규화 기법 사용에 기인한다. Google DeepMind는 Gemini 3의 통합 아키텍처가 초기 다중 모드 시스템에서 흔한 문제인 양식별 구성 요소 간 오류 전파를 줄인다고 강조했다.

통합 및 생태계

Gemini 3는 이전 Gemini 출시의 패턴을 따라 Google 검색, Chrome, Google Workspace를 포함한 Google 제품 생태계 전반에 통합된다. 모델은 2024년 2월에 Bard에서 브랜드가 변경된 Gemini 챗봇을 구동한다. Android에서 Gemini 3 Nano는 온디바이스 작업에 최적화되어 클라우드 연결 없이 이미지와 오디오의 오프라인 처리를 가능하게 한다.

하드웨어 파트너십에서 Google은 삼성전자와 협력하여 2025년 초에 발표된 Galaxy S25 스마트폰 제품군에 Gemini 3를 통합했다. 이는 2024년 1월에 Gemini Nano 및 Pro를 Galaxy S24에 가져온 파트너십에 이은 것이다. 통합에는 화상 통화의 실시간 번역과 자연어 명령을 통한 온디바이스 사진 편집과 같은 기능이 포함된다.

엔터프라이즈 사용자를 위해 Gemini 3는 Google Cloud를 통해 제공되며, AI-as-a-service 시장에서 Amazon Web ServicesMicrosoft Azure와 경쟁한다. Google은 또한 2025년 6월에 Gemini CLI를 도입했는데, 이는 터미널에 Gemini 기능을 제공하는 오픈 소스 AI 에이전트로, 코딩, 자동화, 문제 해결 작업을 지원하며 개별 개발자에게 무료 사용 한도를 제공한다.

안전 및 규제

Google DeepMind는 원래 Gemini 출시 이후 회사가 밝힌 접근 방식에 따라 Gemini 3에 대한 안전 테스트를 강조했다. 회사는 2023년 10월 조 바이든 대통령이 서명한 행정 명령에 따라 테스트 결과를 미국 연방 정부와 공유했다. 영국 정부와의 논의도 2023년 11월 블레츨리 파크에서 열린 AI 안전 정상 회의에서 수립된 원칙에 따라 계속되었다.

안전 조치에는 생성된 이미지와 오디오에 워터마킹을 적용하여 오용을 방지하는 기능이 포함되며, 이는 Gemini 2.0에서 도입되고 Gemini 3에서 확장되었다. 모델에는 유해한 출력을 줄이기 위한 필터가 포함되며, Google은 Gemini 1.0의 신중한 출시와 유사하게 Gemini 3가 광범위한 배포 전에 광범위한 평가를 거칠 것이라고 밝혔다.

2025년 11월 출시 기준으로 Gemini 3는 처음에 영어로 제공되었으며, 다국어 확장 계획이 있었다. Google은 추가 언어와 지역별 가용성이 규제 승인에 따라 이후 몇 달에 걸쳐 출시될 것이라고 밝혔다.

경쟁 구도

Gemini 3는 OpenAI의 GPT-4 및 GPT-4o, Anthropic의 Claude 3, 그리고 AI21 LabsInflection AI와 같은 회사의 다른 모델이 지배하는 경쟁 시장에 진입한다. Google의 본래 다중 모드 접근 방식은 2023년 Gemini의 초기 발표에 대응하여 서둘러진 OpenAI의 GPT-4에 대한 비전 및 오디오 통합에 대한 직접적인 도전이다.

업계 분석가들은 Gemini 3의 통합 아키텍처가 다중 모드 AI의 새로운 표준을 설정할 수 있으며, 경쟁사의 향후 모델에 영향을 미칠 수 있다고 지적했다. 이번 출시는 또한 Google DeepMind와 OpenAI 간의 지속적인 경쟁을 부각시키며, 두 회사 모두 인공 일반 지능(AGI) 달성을 위해 경쟁하고 있다. Google의 TPU 투자와 Broadcom과 같은 칩 제조업체와의 파트너십은 하드웨어 이점을 제공하지만, OpenAI는 클라우드 제공업체를 통해 NVIDIA GPU에 의존한다.

Gemini 3의 출시는 시각 및 청각 데이터의 동시 처리가 중요한 미디어, 의료, 로봇 공학과 같은 산업에서 다중 모드 AI 채택을 가속화할 것으로 예상된다. Google DeepMind는 물리적 시스템과 Gemini를 결합한 초기 탐구를 기반으로 로봇 공학과의 향후 통합을 암시했다.

향후 방향

Google DeepMind는 Gemini 3에 대한 반복을 계속할 계획이며, 효율성 개선과 Gemini 1.5의 100만 토큰 용량을 넘어선 컨텍스트 창 확장이 포함된 업데이트가 예상된다. 회사는 또한 모델 가지치기 및 양자화를 통해 계산 비용을 줄여 모델을 소규모 개발자에게 더 접근하기 쉽게 만드는 방법을 탐구하고 있다.

연구 방향에는 Gemini 3를 Waymo의 자율 주행 시스템 및 기타 로봇 공학 응용 프로그램과 통합하여 다중 모드 이해를 실시간 의사 결정에 활용하는 것이 포함된다. 또한 Google은 실험 데이터를 여러 양식으로 분석하는 것과 같은 과학 연구에서 Gemini 3의 사용을 조사하고 있다.

출시 기준으로 Google DeepMind는 Gemini 4에 대한 일정을 발표하지 않았지만, 2023년 12월 Gemini 1.0에서 2025년 11월 Gemini 3까지의 빠른 개발 속도는 연간 업데이트가 계속될 것임을 시사한다. 회사의 본래 다중 모드에 대한 헌신은 Gemini 3를 여러 감각을 통해 세계와 상호 작용하는 미래 AI 시스템의 기반 모델로 자리매김한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:google-deepmind·multimodal-ai·large-language-model·ai-launch
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사