Google Gemini, anteriormente conhecido como Bard, é um chatbot de inteligência artificial generativa e assistente virtual desenvolvido pelo Google. É alimentado pela família de modelos de linguagem de grande porte (LLMs) de mesmo nome, depois de ter sido baseado anteriormente em LaMDA e PaLM 2. A arquitetura Gemini é treinada nativamente em múltiplos tipos de dados, permitindo que os modelos processem e gerem texto, código de computador, imagens, áudio e vídeo simultaneamente. O Google distribui a tecnologia em capacidades variadas, desde versões eficientes para dispositivos ("Nano") e variantes econômicas de alta produtividade ("Flash") até modelos de alta computação projetados para raciocínio complexo ("Pro" e "Ultra"). As gerações de modelos 1.5 e 3 introduziram janelas de contexto estendidas, permitindo a análise de grandes conjuntos de dados, como bases de código inteiras, vídeos de longa duração ou arquivos de documentos extensos em um único prompt.
O Gemini foi anunciado pela primeira vez em 6 de dezembro de 2023 e substituiu a marca existente do Google para serviços de IA. Em fevereiro de 2024, o chatbot Bard foi renomeado para Gemini, e a marca "Duet AI" para Google Cloud e Workspace foi aposentada em favor do identificador Gemini. Os modelos integram-se ao ecossistema do Google por meio do aplicativo móvel Gemini, que funciona como um assistente sobreposto em dispositivos Android, e através da plataforma Vertex AI para desenvolvedores terceirizados.
História
Antecedentes
Em novembro de 2022, a OpenAI lançou o ChatGPT, um chatbot baseado na família de modelos de linguagem de grande porte GPT-3. O ChatGPT ganhou atenção mundial, tornando-se uma sensação viral na internet. Alarmados com a ameaça potencial do ChatGPT ao Google Search, os executivos do Google emitiram um alerta de "código vermelho", realocando várias equipes para auxiliar nos esforços de inteligência artificial da empresa. Sundar Pichai, CEO do Google e da empresa controladora Alphabet, foi amplamente noticiado como o emissor do alerta, mas Pichai negou isso mais tarde ao The New York Times. Em uma medida rara, os cofundadores do Google, Larry Page e Sergey Brin, que haviam renunciado aos seus cargos como co-CEOs da Alphabet em 2019, participaram de reuniões de emergência com executivos da empresa para discutir a resposta do Google ao ChatGPT. Brin solicitou acesso ao código do Google em fevereiro de 2023, pela primeira vez em anos.
O Google havia revelado o LaMDA, um protótipo de LLM, no início de 2021, mas ele não foi lançado ao público. Quando questionados por funcionários em uma reunião geral se o LaMDA era uma oportunidade perdida para o Google competir com o ChatGPT, Pichai e o chefe de IA do Google, Jeff Dean, disseram que, embora o chatbot da empresa tivesse capacidades semelhantes às do ChatGPT, havia riscos em introduzir um LLM que pudesse espalhar informações falsas, então decidiram esperar. Em janeiro de 2023, o CEO da DeepMind, empresa irmã do Google Brain, Demis Hassabis, insinuou planos para um rival do ChatGPT, e os funcionários do Google foram instruídos a acelerar o progresso em um concorrente do ChatGPT, testando intensivamente o "Apprentice Bard" e outros chatbots. Pichai garantiu aos investidores durante a teleconferência de resultados trimestrais do Google em fevereiro que a empresa tinha planos de expandir a disponibilidade e as aplicações do LaMDA.
Bard
#### Anúncio
Em 6 de fevereiro de 2023, o Google anunciou o Bard, um chatbot de inteligência artificial generativa alimentado por LaMDA. O Bard foi inicialmente lançado para um grupo seleto de 10.000 "testadores confiáveis", antes de um lançamento amplo programado para o final do mês. O projeto foi supervisionado pelo líder de produto Jack Krawczyk, que descreveu o produto como um "serviço de IA colaborativo" em vez de um mecanismo de busca, enquanto Pichai detalhou como o Bard seria integrado ao Google Search. A Reuters calculou que adicionar recursos semelhantes aos do ChatGPT ao Google Search poderia custar à empresa US$ 6 bilhões em despesas adicionais até 2024, enquanto a empresa de pesquisa e consultoria SemiAnalysis calculou que custaria ao Google US$ 3 bilhões. A tecnologia foi desenvolvida sob o codinome "Atlas", com o nome "Bard" em referência ao termo celta para contador de histórias e escolhido para "refletir a natureza criativa do algoritmo subjacente".
Vários veículos de mídia e analistas financeiros descreveram o Google como "apressando" o anúncio do Bard para antecipar o evento planejado pela rival Microsoft em 7 de fevereiro, que revelaria sua parceria com a OpenAI para integrar o ChatGPT ao seu mecanismo de busca Bing na forma de Bing AI (mais tarde renomeado como Microsoft Copilot), bem como para evitar ficar "atrás" da Microsoft. O CEO da Microsoft, Satya Nadella, disse ao The Verge: "Quero que as pessoas saibam que os fizemos dançar." Tom Warren, do The Verge, e Davey Alba, da Bloomberg News, observaram que isso marcou o início de outro confronto entre as duas empresas de Big Tech sobre "o futuro da busca", após sua "trégua" de seis anos expirar em 2021; Chris Stokel-Walker, do The Guardian, Sara Morrison, do Recode, e o analista Dan Ives, da firma de investimentos Wedbush Securities, classificaram isso como uma corrida armamentista de IA entre as duas.
Após uma transmissão ao vivo "decepcionante" em Paris em 8 de fevereiro, mostrando o Bard, as ações do Google caíram oito por cento, equivalente a uma perda de US$ 100 bilhões em valor de mercado, e o vídeo do YouTube da transmissão foi tornado privado. Muitos espectadores também apontaram um erro durante a demonstração em que o Bard fornece informações imprecisas sobre o Telescópio Espacial James Webb em resposta a uma consulta. Funcionários do Google criticaram o anúncio "apressado" e "mal executado" do Bard por Pichai no Memegen, o fórum interno da empresa, enquanto Maggie Harrison, da Futurism, chamou o lançamento de "caos". Pichai defendeu suas ações dizendo que o Google estava "trabalhando profundamente em IA há muito tempo", rejeitando a noção de que o lançamento do Bard foi uma reação instintiva.
Uma semana após a transmissão ao vivo em Paris, Pichai pediu a 80.000 funcionários que gastassem de duas a quatro horas testando o Bard internamente, enquanto o executivo do Google, Prabhakar Raghavan, pediu-lhes que corrigissem quaisquer erros que o Bard cometesse. Nas semanas seguintes, os funcionários do Google criticaram o Bard em mensagens internas, citando preocupações de segurança e ética e pedindo aos líderes da empresa que não lançassem o serviço. Os executivos do Google lançaram o produto, anulando um relatório de avaliação de risco negativo conduzido por sua equipe de ética em IA. Depois que Pichai demitiu repentinamente 12.000 funcionários no final daquele mês devido à desaceleração do crescimento da receita, os funcionários restantes compartilharam memes e trechos de suas trocas humorísticas com o Bard, solicitando sua "opinião" sobre as demissões.
Arquitetura Técnica
Os modelos Gemini são construídos em uma arquitetura Transformer (architecture), semelhante a outros Large language models, mas com uma diferença fundamental: eles são treinados nativamente em múltiplos tipos de dados. Este treinamento multimodal permite que os modelos processem e gerem texto, código, imagens, áudio e vídeo simultaneamente, ao contrário de modelos anteriores que lidavam com cada modalidade separadamente. A arquitetura incorpora técnicas como Multi-Head Attention e Positional Encoding para lidar com sequências longas. As gerações 1.5 e 3 estenderam as janelas de contexto, permitindo a análise de grandes conjuntos de dados, como bases de código inteiras, vídeos de longa duração ou arquivos de documentos extensos em um único prompt. Isso é alcançado por meio de mecanismos de atenção eficientes que reduzem a sobrecarga computacional.
O Google distribui o Gemini em várias variantes para equilibrar desempenho e eficiência. A variante "Nano" é projetada para uso em dispositivos, funcionando eficientemente em hardware móvel. A variante "Flash" é otimizada para tarefas de alta produtividade e baixo custo. A variante "Pro" lida com raciocínio complexo, enquanto a variante "Ultra" é o modelo de maior computação para as aplicações mais exigentes. Essas variantes são integradas à plataforma Google Cloud do Google via Vertex AI, permitindo que desenvolvedores terceirizados acessem os modelos por meio de APIs.
Integração e Disponibilidade
O aplicativo móvel Gemini funciona como um assistente sobreposto em dispositivos Android, substituindo o Google Assistant anterior em algumas capacidades. Ele é integrado ao Google Workspace, incluindo Gmail, Docs e Sheets, sob a marca Gemini. Os modelos também estão disponíveis através da plataforma Vertex AI do Google Cloud, que fornece ferramentas para desenvolvedores construírem e implantarem aplicações de IA. Em fevereiro de 2024, o chatbot Bard foi renomeado para Gemini, e a marca "Duet AI" para Google Cloud e Workspace foi aposentada em favor do identificador Gemini. Essa reformulação unificou as ofertas de IA do Google sob um único nome.
Recepção e Controvérsias
O lançamento do Gemini gerou elogios técnicos e controvérsia pública. Comentadores destacaram os benchmarks dos modelos em tarefas de codificação e recuperação como competitivos com o GPT-4 e GPT-5 da OpenAI. No entanto, o lançamento do produto enfrentou críticas em relação à confiabilidade de suas saídas. No início de 2024, o Google suspendeu a capacidade do modelo de gerar imagens de pessoas depois que usuários relataram imprecisões históricas e viés em suas representações de sujeitos humanos. Atualizações subsequentes, incluindo as séries Gemini 1.5 e 3 lançadas ao longo de 2025, focaram em reduzir alucinações, melhorar a latência e aprimorar capacidades agênticas para pesquisa autônoma e desenvolvimento de software. As controvérsias destacam desafios contínuos em Generative AI em relação a viés e precisão factual.