Gemini diciembre de 2023

Traducido del inglés

Gemini es una familia de modelos de lenguaje grandes multimodales desarrollados por Google DeepMind, anunciados el 6 de diciembre de 2023, con tres niveles (Ultra, Pro, Nano) e integrados en productos de Google como Bard y Pixel 8.

Gemini es una familia de modelos de lenguaje de gran tamaño (LLM) multimodales desarrollados por Google DeepMind, una subsidiaria de Google. Anunciado el 6 de diciembre de 2023, Gemini sirve como sucesor de los modelos anteriores de Google, LaMDA y PaLM 2. Está diseñado para procesar múltiples tipos de datos simultáneamente, incluidos texto, imágenes, audio, video y código informático, lo que lo distingue de muchos LLM que solo procesan texto. El nombre Gemini hace referencia al signo zodiacal y también alude a la fusión de Google Brain y DeepMind, así como al Proyecto Gemini de la NASA.

El lanzamiento introdujo tres niveles de modelos: Gemini Ultra, destinado a tareas altamente complejas; Gemini Pro, para una amplia gama de tareas; y Gemini Nano, optimizado para tareas en el dispositivo. En el lanzamiento, Gemini Pro se integró en el chatbot Bard de Google, y Gemini Nano impulsó funciones en el teléfono inteligente Pixel 8 Pro. Gemini Ultra estaba previsto para su lanzamiento a principios de 2024 bajo el nombre de "Bard Advanced". Los modelos estaban inicialmente disponibles solo en inglés, y Google citó la necesidad de realizar pruebas de seguridad exhaustivas antes de un despliegue más amplio.

Desarrollo

Google anunció por primera vez Gemini durante la conferencia magistral de Google I/O el 10 de mayo de 2023, y el CEO Sundar Pichai lo describió como un sucesor más potente de PaLM 2, que también se presentó en ese evento. A diferencia de los LLM típicos, Gemini fue diseñado desde el principio como un sistema multimodal, capaz de comprender y generar texto, imágenes, audio, video y código. El desarrollo fue una colaboración entre DeepMind y Google Brain, que se habían fusionado en Google DeepMind a principios de ese año.

El CEO de DeepMind, Demis Hassabis, destacó el potencial de Gemini para superar a ChatGPT de OpenAI, que funcionaba con GPT-4. Estableció paralelismos con AlphaGo, el programa de DeepMind que derrotó al campeón de Go Lee Sedol en 2016, sugiriendo que Gemini combinaría las fortalezas de AlphaGo con capacidades lingüísticas avanzadas. En agosto de 2023, The Information informó que Google apuntaba a un lanzamiento a finales de 2023, con planes para integrar la generación de imágenes y otras funciones multimodales para superar a los competidores.

El cofundador de Google, Sergey Brin, salió de su retiro para ayudar en el desarrollo de Gemini, acreditado como un "colaborador principal". Cientos de ingenieros de Google Brain y DeepMind trabajaron en el proyecto. Debido a que Gemini se entrenó con transcripciones de videos de YouTube, se involucró a abogados para filtrar material potencialmente protegido por derechos de autor.

Lanzamiento y Publicación Inicial

El 6 de diciembre de 2023, Pichai y Hassabis anunciaron Gemini 1.0 en una conferencia de prensa virtual. Se reveló la estructura de tres niveles: Ultra para tareas complejas, Pro para tareas generales y Nano para aplicaciones en el dispositivo. En el lanzamiento, Gemini Pro se integró en Bard, y Gemini Nano se incorporó en el Pixel 8 Pro. Gemini Ultra estaba planificado para principios de 2024, impulsando "Bard Advanced" y disponible para desarrolladores. Google tenía la intención de incorporar Gemini en Search, Ads, Chrome, Duet AI en Google Workspace y AlphaCode 2.

Gemini se entrenó con las Unidades de Procesamiento Tensorial (TPU) de Google. Google lo promocionó como su "modelo de IA más grande y capaz", diseñado para emular el comportamiento humano. La compañía declaró que Gemini no estaría ampliamente disponible hasta el año siguiente debido a los requisitos de pruebas de seguridad. En línea con una orden ejecutiva de EE. UU. firmada por el presidente Joe Biden en octubre de 2023, Google acordó compartir los resultados de las pruebas de Gemini Ultra con el gobierno federal. Las conversaciones con el gobierno del Reino Unido también tenían como objetivo alinearse con los principios de la Cumbre de Seguridad de la IA en Bletchley Park en noviembre.

Se informó que Gemini Ultra superó a GPT-4, Claude 2 de Anthropic, Inflection-2 de Inflection AI, LLaMA 2 de Meta y Grok 1 de xAI en los puntos de referencia de la industria. Se dijo que Gemini Pro superaba a GPT-3.5. Gemini Ultra fue el primer modelo de lenguaje en superar a los expertos humanos en la prueba de Comprensión Masiva de Lenguaje Multitarea (MMLU) de 57 materias, logrando un 90%. Gemini Pro estuvo disponible para los clientes de Google Cloud a través de AI Studio y Vertex AI el 13 de diciembre de 2023.

Integración y Expansión

En enero de 2024, Google se asoció con Samsung para integrar Gemini Nano y Gemini Pro en la línea de teléfonos inteligentes Galaxy S24. Al mes siguiente, Bard y Duet AI se unificaron bajo la marca Gemini, y "Gemini Advanced con Ultra 1.0" se lanzó a través de un nuevo nivel "AI Premium" de Google One. Gemini Pro también recibió un lanzamiento global.

En febrero de 2024, Google presentó Gemini 1.5, descrito como más potente que 1.0 Ultra, con una nueva arquitectura, un enfoque de mezcla de expertos y una ventana de contexto de un millón de tokens. El mismo mes, Google presentó Gemma, una gama más pequeña y de código abierto de modelos Gemini, vista como una respuesta a Meta y otros que abren el código de sus modelos de IA.

En la conferencia magistral de Google I/O el 14 de mayo de 2024, Google anunció Gemini 1.5 Flash, un modelo más rápido y eficiente. También se revelaron planes para integrar una versión de Gemini Nano optimizada para escritorio en el navegador Google Chrome a través de su arquitectura "Built-in AI", exponiendo capacidades de procesamiento local a los desarrolladores web a través de API experimentales como la API Prompt ("window.ai").

Actualizaciones Posteriores

Se lanzaron dos modelos actualizados, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, el 24 de septiembre de 2024. El 11 de diciembre de 2024, Google anunció Gemini 2.0 Flash Experimental, con una API Live Multimodal para interacciones de audio y video en tiempo real, generación de imágenes nativa, texto a voz controlable con marca de agua y búsqueda de Google integrada.

En junio de 2025, Google presentó Gemini CLI, un agente de IA de código abierto que lleva las capacidades de Gemini a la terminal, ofreciendo funciones de codificación, automatización y resolución de problemas con límites de uso gratuito generosos para desarrolladores individuales.

Arquitectura Técnica y Capacidades

Gemini se basa en una arquitectura Transformer (architecture), similar a otros Large language model modernos. Emplea mecanismos de Multi-Head Attention y Positional Encoding para procesar datos secuenciales. El modelo es multimodal, entrenado con diversos tipos de datos, y utiliza las TPU de Google para el entrenamiento y la inferencia. El diseño de Gemini incorpora técnicas como Mixture of experts (en versiones posteriores) y admite una gran ventana de contexto, lo que le permite manejar documentos largos y tareas de razonamiento complejas.

Las capacidades de Gemini incluyen comprensión del lenguaje natural, generación de código, procesamiento de imágenes y audio, e integración con herramientas externas. El modelo está diseñado para ser adaptable en varios dominios, desde aplicaciones de consumo como Bard hasta soluciones empresariales en Google Cloud.

Impacto y Recepción

El lanzamiento de Gemini intensificó la competencia en el espacio de la Generative AI, particularmente con GPT-4 de OpenAI y los modelos Claude de Anthropic. Google posicionó a Gemini como un desafío directo a estos sistemas, aprovechando su profunda integración con el ecosistema de Google, incluidos Search, Workspace y Cloud. La naturaleza multimodal del modelo se consideró un paso significativo hacia una IA más similar a la humana, con aplicaciones potenciales en robótica, como Hassabis insinuó al combinar Gemini con robótica para la interacción física.

Los analistas de la industria notaron el sólido rendimiento de Gemini en puntos de referencia como MMLU, pero también plantearon preocupaciones sobre la seguridad, el sesgo y el impacto ambiental del entrenamiento de modelos grandes. La decisión de Google de abrir el código de Gemma se consideró un movimiento estratégico para fomentar la adopción por parte de la comunidad y abordar las críticas sobre la IA propietaria.

Direcciones Futuras

Google continúa evolucionando Gemini, con actualizaciones continuas y nuevas versiones de modelos. La integración de Gemini en Chrome y dispositivos Android tiene como objetivo llevar la IA en el dispositivo a una audiencia amplia. El desarrollo de Gemini CLI y otras herramientas sugiere un enfoque en aplicaciones centradas en el desarrollador. A partir de 2025, Gemini sigue siendo una parte central de la estrategia de IA de Google, compitiendo con otros actores importantes en el campo.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:ai-model·google-deepmind·large-language-model·multimodal-ai
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial