Gemini es una familia de modelos de lenguaje de gran tamaño (LLM) multimodales desarrollados por Google DeepMind, una subsidiaria de Google. Anunciado el 6 de diciembre de 2023, Gemini sirve como sucesor de los modelos anteriores de Google, LaMDA y PaLM 2. La familia de modelos incluye Gemini Pro, Gemini Deep Think, Gemini Flash y Gemini Flash Lite, y alimenta el chatbot Gemini. El nombre deriva del signo zodiacal Géminis, que simboliza la naturaleza dual del proyecto, que fusionó Google Brain y DeepMind. Gemini está diseñado para procesar múltiples tipos de datos simultáneamente, incluidos texto, imágenes, audio, video y código informático, lo que lo distingue de muchos predecesores que solo manejan texto.
Antecedentes de desarrollo
Google anunció por primera vez Gemini durante la conferencia magistral de Google I/O el 10 de mayo de 2023, posicionándolo como un sucesor más potente de PaLM 2, que también se presentó en ese evento. El CEO de Google, Sundar Pichai, declaró que Gemini aún se encontraba en sus primeras etapas de desarrollo. A diferencia de los modelos de lenguaje de gran tamaño típicos, entrenados únicamente con corpus de texto, Gemini fue diseñado desde el principio para ser multimodal, lo que le permite manejar diversos tipos de entrada de forma concurrente. El desarrollo fue una colaboración entre DeepMind y Google Brain, dos ramas que se fusionaron en una sola entidad, Google DeepMind.
En una entrevista con Wired, el CEO de DeepMind, Demis Hassabis, elogió las capacidades avanzadas de Gemini, sugiriendo que superaría a ChatGPT de OpenAI, que funciona con GPT-4. Hassabis destacó las fortalezas del programa AlphaGo de DeepMind, que ganó atención mundial en 2016 cuando derrotó al campeón de Go, Lee Sedol, diciendo que Gemini combinaría el poder de AlphaGo con otros LLM de Google-DeepMind. Esta ambición reflejaba la respuesta agresiva de Google a la creciente popularidad de ChatGPT y su propio chatbot anterior, Bard.
En agosto de 2023, The Information publicó un informe que describía la hoja de ruta de Google para Gemini, revelando una fecha de lanzamiento objetivo a finales de 2023. El informe indicaba que Google esperaba superar a OpenAI y otros competidores combinando capacidades de texto conversacional con generación de imágenes impulsada por inteligencia artificial, lo que permitiría imágenes contextuales y una gama más amplia de casos de uso. El cofundador de Google, Sergey Brin, fue convocado de su retiro para ayudar en el desarrollo, junto con cientos de ingenieros de Google Brain y DeepMind; más tarde fue acreditado como un "contribuyente principal". Debido a que Gemini fue entrenado con transcripciones de videos de YouTube, se contrataron abogados para filtrar materiales potencialmente protegidos por derechos de autor.
Lanzamiento y modelos iniciales
El 6 de diciembre de 2023, Pichai y Hassabis anunciaron "Gemini 1.0" en una conferencia de prensa virtual. El lanzamiento comprendió tres modelos: Gemini Ultra, diseñado para "tareas altamente complejas"; Gemini Pro, para "una amplia gama de tareas"; y Gemini Nano, para "tareas en el dispositivo". En el lanzamiento, Gemini Pro y Nano se integraron en Bard y el teléfono inteligente Pixel 8 Pro, respectivamente. Gemini Ultra estaba destinado a impulsar "Bard Advanced" y estar disponible para desarrolladores de software a principios de 2024. Otros productos previstos para la integración incluían Search, Ads, Chrome, Duet AI en Google Workspace y AlphaCode 2. El lanzamiento inicial estaba disponible solo en inglés.
Google promocionó a Gemini como su "modelo de IA más grande y capaz", diseñado para emular el comportamiento humano. La compañía declaró que Gemini no se pondría a disposición general hasta el año siguiente debido a la necesidad de "pruebas de seguridad exhaustivas". Gemini fue entrenado y potenciado por las Unidades de Procesamiento Tensorial (TPU) de Google. El nombre también hace referencia al Proyecto Gemini de la NASA, reflejando la fusión de DeepMind y Google Brain.
Rendimiento y puntos de referencia
Se informó que Gemini Ultra superó a GPT-4, Claude 2 de Anthropic, Inflection-2 de Inflection AI, LLaMA 2 de Meta y Grok 1 de xAI en varios puntos de referencia de la industria. Se dijo que Gemini Pro superó a GPT-3.5. Notablemente, Gemini Ultra fue el primer modelo de lenguaje en superar a expertos humanos en la prueba de Comprensión de Lenguaje Masivo Multitarea (MMLU) de 57 materias, logrando una puntuación del 90%. Este resultado de referencia posicionó a Gemini como un modelo líder en el campo de la Artificial intelligence y la investigación de Large language model.
Gemini Pro se puso a disposición de los clientes de Google Cloud en AI Studio y Vertex AI el 13 de diciembre de 2023. Gemini Nano se puso a disposición de los desarrolladores de Android más tarde. Hassabis reveló además que DeepMind estaba explorando cómo combinar Gemini con robótica para interactuar físicamente con el mundo. De acuerdo con una orden ejecutiva firmada por el presidente de EE. UU., Joe Biden, en octubre de 2023, Google declaró que compartiría los resultados de las pruebas de Gemini Ultra con el gobierno federal. De manera similar, la compañía entabló discusiones con el gobierno del Reino Unido para cumplir con los principios establecidos en la Cumbre de Seguridad de la IA en Bletchley Park en noviembre de 2023.
Integración con productos de Google
Tras su lanzamiento, Gemini se integró rápidamente en todo el ecosistema de Google. En enero de 2024, Google se asoció con Samsung para integrar Gemini Nano y Gemini Pro en la línea de teléfonos inteligentes Galaxy S24. El mes siguiente, Bard y Duet AI se unificaron bajo la marca Gemini, con "Gemini Advanced con Ultra 1.0" lanzándose a través de un nuevo nivel "AI Premium" del servicio de suscripción Google One. Gemini Pro también recibió un lanzamiento global, expandiéndose más allá de su disponibilidad inicial solo en inglés.
En febrero de 2024, Google lanzó Gemini 1.5, describiéndolo como más potente y capaz que 1.0 Ultra. Los cambios incluyeron una nueva arquitectura, un enfoque de mezcla de expertos y una ventana de contexto más grande de un millón de tokens. El mismo mes, Google presentó Gemma, una gama más pequeña, gratuita y de código abierto de modelos Gemini. Varias publicaciones describieron esto como una respuesta a Meta y otros que abrieron sus modelos de IA, y un cambio respecto a la práctica anterior de Google de mantener su IA propietaria.
Google anunció un modelo adicional, Gemini 1.5 Flash, el 14 de mayo en la conferencia magistral de I/O 2024. En el mismo evento, Google anunció planes para integrar una compilación de Gemini Nano optimizada para escritorio directamente en el navegador Google Chrome a través de su arquitectura "Built-in AI", exponiendo capacidades de procesamiento local a desarrolladores web a través de API experimentales como la API Prompt ("window.ai").
Actualizaciones y modelos posteriores
Dos modelos Gemini actualizados, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, se lanzaron el 24 de septiembre de 2024. El 11 de diciembre de 2024, Google anunció el nuevo modelo Gemini 2.0 Flash Experimental. Las características incluían una API multimodal en vivo para interacciones de audio y video en tiempo real, generación de imágenes nativa y texto a voz controlable (con marca de agua), y búsqueda de Google integrada. Esta iteración continuó empujando los límites de las capacidades de IA multimodal.
En junio de 2025, Google presentó Gemini CLI, un agente de IA de código abierto que lleva las capacidades de Gemini directamente al terminal, ofreciendo funciones avanzadas de codificación, automatización y resolución de problemas con generosos límites de uso gratuito para desarrolladores individuales. Este movimiento destacó el compromiso de Google con la accesibilidad para desarrolladores y las herramientas de código abierto.
Posicionamiento competitivo
El lanzamiento de Gemini fue un evento significativo en el panorama competitivo de la Generative AI. Google posicionó a Gemini directamente contra los modelos de OpenAI, Anthropic y otras organizaciones de investigación de IA. Las capacidades multimodales del modelo y su sólido rendimiento en puntos de referencia estaban destinados a desafiar el dominio de GPT-4 y otros LLM líderes. La integración de Gemini en el vasto ecosistema de productos de Google, incluidos Search, Workspace y Android, proporcionó una ventaja de distribución sobre los competidores.
El desarrollo de Gemini también implicó colaboraciones con socios de hardware. La integración con el Galaxy S24 de Samsung destacó la importancia de la IA en el dispositivo, mientras que el uso de TPU de Google subrayó el papel del hardware especializado en el entrenamiento de modelos grandes. La dinámica competitiva se extendió a los servicios en la nube, con Gemini Pro disponible en Vertex AI de Google Cloud, compitiendo con ofertas de Amazon Web Services y Microsoft Azure.
Arquitectura técnica e investigación
La arquitectura de Gemini se basa en avances en Deep learning y modelos Transformer (architecture). Como modelo multimodal, incorpora técnicas de Multi-Head Attention y Cross-Attention para procesar y relacionar información entre diferentes modalidades. El enfoque de mezcla de expertos en Gemini 1.5 permite un escalado más eficiente, activando solo las partes relevantes de la red para tareas dadas. El entrenamiento del modelo probablemente implicó técnicas como Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo a partir de retroalimentación de IA) y Curriculum Learning para mejorar el rendimiento y la alineación.
La investigación detrás de Gemini se basa en el campo más amplio del Machine learning, incluidas contribuciones de instituciones como MIT CSAIL, Stanford AI Lab y BAIR (Berkeley AI Research). La herencia de Google DeepMind, incluido el programa AlphaGo, informó el diseño del modelo, particularmente su capacidad para manejar tareas complejas de razonamiento de múltiples pasos. El desarrollo también involucró a investigadores como Demis Hassabis y otras figuras clave en la comunidad de IA.
Seguridad y gobernanza
Google enfatizó las pruebas de seguridad para Gemini, retrasando la disponibilidad general para realizar evaluaciones exhaustivas. La compañía se comprometió a compartir los resultados de las pruebas con el gobierno federal de EE. UU. tras la orden ejecutiva sobre IA de octubre de 2023. Las discusiones con el gobierno del Reino Unido tenían como objetivo alinearse con los principios de la Cumbre de Seguridad de la IA en Bletchley Park. Estos pasos reflejaron el creciente escrutinio regulatorio de la Artificial intelligence y la necesidad de un despliegue responsable de modelos potentes.
La integración de Gemini en productos de consumo como el Pixel 8 Pro y el Galaxy S24 planteó preguntas sobre privacidad y procesamiento en el dispositivo. Las capacidades de procesamiento local de Gemini Nano fueron diseñadas para minimizar la transmisión de datos, abordando algunas preocupaciones de privacidad. Sin embargo, el despliegue más amplio de IA multimodal continúa generando debate sobre el uso ético y los posibles impactos sociales.
Direcciones futuras
A partir de 2025, Gemini continúa evolucionando con nuevos modelos y características. La introducción de Gemini CLI y los modelos Gemma de código abierto indican una estrategia de ampliar el acceso a las capacidades de IA. La inversión continua de Google en Google DeepMind y su integración con Google Cloud sugieren que Gemini seguirá siendo un pilar central de la estrategia de IA de la compañía. Los desarrollos futuros pueden incluir mejoras adicionales en el razonamiento, arquitecturas más eficientes y una integración más profunda con la robótica y los sistemas físicos, como insinuaron los comentarios de Hassabis sobre combinar Gemini con robótica.
El panorama competitivo sigue siendo dinámico, con OpenAI y Anthropic continuando lanzando modelos avanzados. El éxito de Gemini dependerá de su capacidad para mantener el liderazgo en rendimiento, expandir las capacidades multimodales y navegar el complejo panorama regulatorio y ético de la IA. El nombre del modelo, que evoca la naturaleza dual del signo zodiacal, captura acertadamente la ambición del proyecto de unificar diversas capacidades de IA en un sistema único y potente.