Gemini é uma família de modelos de linguagem de grande escala (LLMs) multimodais desenvolvidos pelo Google DeepMind, uma subsidiária do Google. Serve como sucessor dos modelos anteriores do Google, LaMDA e PaLM 2. A família Gemini incluye várias variantes, como Gemini Pro, Gemini Deep Think, Gemini Flash e Gemini Flash Lite, e alimenta o chatbot Gemini. O nome Gemini refere-se ao signo zodiacal de Gêmeos e também acena à fusão do Google Brain e DeepMind, bem como ao Projeto Gemini da NASA. Anunciado em 6 de dezembro de 2023, Gemini foi projetado para processar simultaneamente vários tipos de dados, incluindo texto, imagens, áudio, vídeo e código de computador, distinguindo-o de muitos predecesores somente de texto.
O desenvolvimento de Gemini marcou um passo significativo nos esforços do Google para competir no espaço de IA generativa, particularmente contra o GPT-4 da OpenAI e outros modelos de linguagem de grande escala. Google posicionou Gemini como seu "modelo de IA maior e mais capaz", com capacidades que se estendem além da geração de texto para incluir compreensão e geração de imagens, e potencial integração com robótica. O modelo foi treinado nas Unidades de Processamento Tensor (TPUs) do Google e estava inicialmente disponível apenas em inglês, com uma implementação gradual em produtos e serviços do Google.
Desenvolvimento
O Google anunciou pela primeira vez Gemini durante a keynote do Google I/O em 10 de maio de 2023, com o CEO Sundar Pichai descrevendo-o como um sucessor mais poderoso do PaLM 2, que também foi revelado nesse evento. Na época, Gemini ainda estava em desenvolvimento inicial, mas já era notável por seu design multimodal, que o distinguía de muitos LLMs existentes que dependiam principalmente de corpora de texto. O modelo foi desenvolvido como uma colaboração entre DeepMind e Google Brain, dois grupos de pesquisa de IA que foram fundidos no Google DeepMind em abril de 2023.
Demis Hassabis, CEO de DeepMind, destacou o potencial de Gemini em uma entrevista com Wired, sugerendo que poderia superar o ChatGPT da OpenAI, que funciona com GPT-4. Hassabis baseou-se na experiência de DeepMind com AlphaGo, o programa que derrotou o campeão de Go Lee Sedol em 2016, e indicou que Gemini combinaría os pontos fortes de AlphaGo com outros LLMs do Google-DeepMind. Em agosto de 2023, The Information informou que o Google pretendía lançar Gemini até finais de 2023, com planos para integrar capacidades de texto conversacional com geração de imágenes impulsionada por IA, permitindo a criação contextual de imágenes e casos de uso más amplios.
O cofundador do Google, Sergey Brin, foi trazido de volta da aposentação para ajudar no desenvolvimento de Gemini, trabalhando ao lado de centenas de engenieros de Google Brain e DeepMind. Brin foi posteriormente creditado como "contribuidor principal" do projeto. Como Gemini foi treinado em transcripciones de vídeos do YouTube, Google contrató advogados para filtrar material potencialmente protegido por direitos de autor. O processo de desenvolvimento também envolvió extensas pruebas de segurança, já que Google afirmó que Gemini não sería amplamente liberado até 2024 para garantir uma implementación responsable.
En resposta ao próximo lanzamiento de Gemini, OpenAI aceleró su trabajo en la integración de características multimodales en GPT-4. Para septiembre de 2023, varias empresas habían recibido acceso temprano a una versión inicial de Gemini, que Google planeaba ofrecer a través del servicio Vertex AI de Google Cloud. El modelo también fue posicionado para competir con GitHub Copilot de Microsoft en el espacio de asistentes de codificación.
Lanzamiento
El 6 de diciembre de 2023, Sundar Pichai y Demis Hassabis anunciaron "Gemini 1.0" en una conferencia de prensa virtual. El lanzamiento inicial incluyó tres modelos: Gemini Ultra, diseñado para "tareas altamente complejas"; Gemini Pro, para "una amplia gama de tareas"; y Gemini Nano, para "tareas en el dispositivo". En el lanzamiento, Gemini Pro y Nano fueron integrados en Bard (el chatbot de Google) y el teléfono inteligente Pixel 8 Pro, respectivamente. Gemini Ultra estaba destinado a impulsar "Bard Advanced" y estar disponible para desarrolladores a principios de 2024. Google también planeaba incorporar Gemini en Search, Ads, Chrome, Duet AI en Google Workspace y AlphaCode 2.
Gemini estaba inicialmente disponible solo en inglés. Google lo promocionó como su "modelo de IA más grande y capaz", diseñado para emular el comportamiento humano. La compañía enfatizó que Gemini no estaría ampliamente disponible hasta el año siguiente debido a la necesidad de "pruebas de seguridad exhaustivas". Gemini fue entrenado y alimentado por las TPUs de Google, y el nombre hacía referencia a la fusión de DeepMind-Google Brain, así como al Proyecto Gemini de la NASA.
Se informó que Gemini Ultra superó a varios modelos competidores, incluidos GPT-4, Claude 2 de Anthropic, Inflection-2 de Inflection AI, LLaMA 2 de Meta y Grok 1 de xAI, en varios puntos de referencia de la industria. Se dijo que Gemini Pro superaba a GPT-3.5. Notablemente, Gemini Ultra fue el primer modelo de lenguaje en superar a los expertos humanos en la prueba de Comprensión de Lenguaje Multitarea Masiva (MMLU) de 57 materias, logrando una puntuación del 90%. Gemini Pro se puso a disposición de los clientes de Google Cloud en AI Studio y Vertex AI el 13 de diciembre de 2023, y Gemini Nano se puso a disposición de los desarrolladores de Android más tarde.
Hassabis también reveló que DeepMind estaba explorando cómo Gemini podría combinarse con robótica para permitir la interacción física con el mundo. En línea con una orden ejecutiva de EE. UU. firmada por el presidente Joe Biden en octubre de 2023, Google declaró que compartiría los resultados de las pruebas de Gemini Ultra con el gobierno federal de EE. UU. De manera similar, Google se comprometió con el gobierno del Reino Unido para alinearse con los principios de la Cumbre de Seguridad de IA en Bletchley Park en noviembre de 2023.
En junio de 2025, Google presentó Gemini CLI, un agente de IA de código abierto que lleva las capacidades de Gemini a la terminal, ofreciendo características de codificación, automatización y resolución de problemas con límites de uso gratuitos generosos para desarrolladores individuales.
Actualizaciones
En enero de 2024, Google se asoció con Samsung para integrar Gemini Nano y Gemini Pro en la línea de teléfonos inteligentes Galaxy S24. El mes siguiente, Bard y Duet AI se unificaron bajo la marca Gemini, y "Gemini Advanced con Ultra 1.0" se lanzó a través de un nuevo nivel "AI Premium" del servicio de suscripción Google One. Gemini Pro también recibió un lanzamiento global.
En febrero de 2024, Google lanzó Gemini 1.5, describiéndolo como más potente y capaz que 1.0 Ultra. Los cambios incluyeron una nueva arquitectura, un enfoque de mezcla de expertos y una ventana de contexto más grande de un millón de tokens. El mismo mes, Google presentó Gemma, una gama más pequeña, gratuita y de código abierto de modelos Gemini. Varias publicaciones describieron esto como una respuesta a Meta y otros que abren sus modelos de IA, y una reversión de la práctica previa de Google de mantener su IA propietaria.
Google anunció un modelo adicional, Gemini 1.5 Flash, el 14 de mayo de 2024, en la keynote de Google I/O. En el mismo evento, Google anunció planes para integrar una compilación optimizada para escritorio de Gemini Nano directamente en el navegador Google Chrome a través de su arquitectura "Built-in AI", exponiendo capacidades de procesamiento local a desarrolladores web a través de APIs experimentales como la API Prompt ("window.ai").
Dos modelos Gemini actualizados, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, se lanzaron el 24 de septiembre de 2024.
El 11 de diciembre de 2024, Google anunció el nuevo modelo experimental Gemini 2.0 Flash. Las características incluyen una API Multimodal Live para interacciones de audio y video en tiempo real, generación nativa de imágenes y texto a voz controlable (con marca de agua), y búsqueda de Google integrada. También introdujo mejoras en las capacidades de razonamiento y codificación.
Arquitectura y Entrenamiento
Gemini se basa en una arquitectura Transformer (architecture), que es la base de muchos Large language models modernos. El modelo emplea un enfoque de mezcla de expertos en versiones posteriores, lo que le permite escalar eficientemente activando solo subredes relevantes para cada tarea. El entrenamiento involucró conjuntos de datos masivos, incluidos texto, imágenes, audio, video y código, obtenidos de varios repositorios, incluidas transcripciones de YouTube, que requirieron un filtrado cuidadoso para cumplir con los derechos de autor.
El modelo fue entrenado en las TPUs de Google, que son aceleradores de Artificial intelligence personalizados. Esta infraestructura permitió a Gemini manejar ejecuciones de entrenamiento a gran escala, contribuyendo a su rendimiento en puntos de referencia como MMLU. El enfoque de entrenamiento multimodal permite a Gemini procesar y generar contenido en diferentes modalidades, haciéndolo versátil para aplicaciones que van desde la generación de texto hasta la comprensión de imágenes.
Capacidades y Rendimiento
Las capacidades de Gemini abarcan múltiples dominios. Puede realizar tareas de razonamiento complejo, generar código, comprender y generar imágenes, y procesar audio y video. El rendimiento del modelo en puntos de referencia de la industria ha sido un punto de venta clave. La puntuación del 90% de Gemini Ultra en MMLU, donde superó a los expertos humanos, fue un logro notable, destacando su amplio conocimiento en 57 materias.
Además de los puntos de referencia, Gemini se ha integrado en varios productos de Google, incluidos Search, Ads y Chrome, mejorando sus características impulsadas por IA. La capacidad del modelo para manejar ventanas de contexto largas, hasta un millón de tokens en Gemini 1.5, le permite procesar documentos grandes o bases de código completas, lo que lo hace útil para desarrolladores e investigadores.
Integración y Ecosistema
Gemini está integrado en los servicios de nube de Google, incluidos Google Cloud y Vertex AI, lo que permite a las empresas acceder a sus capacidades. También impulsa el chatbot Gemini, que fue renombrado de Bard en febrero de 2024. La disponibilidad del modelo en dispositivos Android, a través de Gemini Nano, permite el procesamiento de IA en el dispositivo, lo que es importante para aplicaciones sensibles a la privacidad y la latencia.
Google también ha hecho que Gemini esté disponible a través de asociaciones, como con Samsung Electronics para el Galaxy S24, y a través de lanzamientos de código abierto como Gemma, que son modelos más pequeños y accesibles. El CLI de Gemini, presentado en 2025, proporciona una interfaz de línea de comandos para desarrolladores, expandiendo aún más su ecosistema.
Recepción e Impacto
Gemini ha sido bien recibido en la comunidad de IA por sus capacidades multimodales y su fuerte rendimiento en puntos de referencia. Sin embargo, también ha enfrentado escrutinio con respecto a la seguridad, problemas de derechos de autor y el impacto ambiental del entrenamiento de modelos grandes. La decisión de Google de compartir los resultados de las pruebas con los gobiernos refleja preocupaciones más amplias sobre la regulación y la seguridad de la IA.
El lanzamiento de Gemini intensificó la competencia en la industria de la IA, llevando a rivales como OpenAI y Anthropic a acelerar sus propios desarrollos. La integración de Gemini en los productos de Google también ha planteado preguntas sobre el dominio del mercado y las implicaciones éticas del despliegue de la IA.
Direcciones Futuras
Google continúa iterando en Gemini, con actualizaciones como Gemini 2.0 Flash Experimental que indican un enfoque en interacciones en tiempo real y generación multimodal. La exploración de la integración de robótica sugiere aplicaciones potenciales en sistemas de IA físicos. A partir de 2025, se espera que Gemini evolucione aún más, con investigación continua en mejorar el razonamiento, la eficiencia y la seguridad.
El desarrollo de Gemini también se alinea con tendencias más amplias en Generative AI, donde los modelos se están volviendo más multimodales y capaces de manejar tareas complejas. La inversión de Google en TPUs y su asociación con Broadcom para chips personalizados subrayan su compromiso con el avance de la infraestructura de IA.