Lanzamiento de Gemini 1

Traducido del inglés

Gemini 1 fue la familia de modelos de lenguaje grande multimodales de primera generación de Google DeepMind, anunciada el 6 de diciembre de 2023, sucediendo a LaMDA y PaLM 2. Introdujo tres modelos - Ultra, Pro y Nano - y alimentó el chatbot Gemini, marcando un paso importante en la IA generativa.

Gemini 1 es una familia de modelos de lenguaje grandes multimodales desarrollados por Google DeepMind, anunciados el 6 de diciembre de 2023, como sucesores de LaMDA y PaLM 2. Comprende tres modelos iniciales: Gemini Ultra, diseñado para tareas altamente complejas; Gemini Pro, para una amplia gama de tareas; y Gemini Nano, para tareas en el dispositivo. La familia impulsa el chatbot Gemini y recibió su nombre por el signo zodiacal Géminis, reflejando la fusión de Google Brain y DeepMind. A diferencia de los predecesores solo de texto, Gemini fue entrenado para procesar texto, imágenes, audio, video y código informático simultáneamente, posicionándose como un competidor directo de GPT-4 de OpenAI y otros sistemas de IA generativa.

El lanzamiento marcó un momento crucial en el desarrollo de la inteligencia artificial, ya que Gemini Ultra se convirtió en el primer modelo en superar a expertos humanos en la prueba Massive Multitask Language Understanding (MMLU) de 57 materias, logrando una puntuación del 90%. Google lo promocionó como su «modelo de IA más grande y capaz», con capacidades que abarcan arquitecturas de aprendizaje automático, aprendizaje profundo y redes neuronales.

Antecedentes de desarrollo

Google anunció por primera vez Gemini durante la conferencia magistral de Google I/O el 10 de mayo de 2023, y su CEO, Sundar Pichai, lo describió como aún en sus primeras etapas de desarrollo. Fue construido como una colaboración entre DeepMind y Google Brain, que se habían fusionado bajo el paraguas de Google DeepMind. El CEO de DeepMind, Demis Hassabis, destacó en entrevistas que Gemini combinaría capacidades de texto conversacional con generación de imágenes impulsada por IA, aprovechando las fortalezas del programa AlphaGo de DeepMind, que ganó atención mundial en 2016.

El desarrollo involucró a cientos de ingenieros, y el cofundador de Google, Sergey Brin, fue reincorporado para ayudar, siendo acreditado más tarde como un «colaborador principal». El modelo fue entrenado con transcripciones de videos de YouTube, con abogados filtrando materiales potencialmente protegidos por derechos de autor. En agosto de 2023, los informes indicaban un objetivo de lanzamiento para finales de 2023, con acceso temprano otorgado a empresas seleccionadas a través del servicio Vertex AI de Google Cloud.

Lanzamiento y modelos iniciales

El 6 de diciembre de 2023, Pichai y Hassabis anunciaron «Gemini 1.0» en una conferencia de prensa virtual. En el lanzamiento, Gemini Pro y Nano se integraron en Bard y en el smartphone Pixel 8 Pro, respectivamente, mientras que Gemini Ultra estaba previsto para «Bard Advanced» y su disponibilidad para desarrolladores a principios de 2024. El modelo estuvo inicialmente disponible solo en inglés, y Google citó la necesidad de «pruebas de seguridad exhaustivas» antes de un lanzamiento más amplio.

Gemini fue entrenado en las Unidades de Procesamiento Tensorial (TPU) de Google. Gemini Ultra superó a GPT-4, Claude 2 de Anthropic, Inflection-2 de Inflection AI, LLaMA 2 de Meta y Grok 1 de xAI en puntos de referencia de la industria, mientras que Gemini Pro superó a GPT-3.5. Gemini Pro estuvo disponible para clientes de Google Cloud en AI Studio y Vertex AI el 13 de diciembre de 2023. De acuerdo con una orden ejecutiva de EE. UU. de octubre de 2023, Google compartió los resultados de las pruebas con el gobierno federal y se comprometió con el gobierno del Reino Unido en los principios de seguridad de la IA de la cumbre de Bletchley Park.

Arquitectura técnica y capacidades

La arquitectura de Gemini se basó en modelos transformers, incorporando mecanismos de atención de múltiples cabezas y codificación posicional. Su diseño multimodal permitía el procesamiento simultáneo de diversos tipos de datos, una desviación de los LLM solo de texto. El modelo integró técnicas como aprendizaje por refuerzo a partir de retroalimentación de IA y escalado de temperatura para el control de la salida, con muestreo top-k y muestreo top-p para la diversidad en la generación.

El entrenamiento del modelo empleó variantes del optimizador Adam, programas de tasa de aprendizaje y recorte de gradientes para estabilizar los procesos de aprendizaje profundo. Se utilizaron normalización por lotes y abandono para mejorar la generalización, mientras que el poda de modelos ayudó a optimizar la eficiencia para el despliegue en el dispositivo en Gemini Nano.

Actualizaciones y expansión

En enero de 2024, Google se asoció con Samsung para integrar Gemini Nano y Pro en la línea de smartphones Galaxy S24. Al mes siguiente, Bard y Duet AI se unificaron bajo la marca Gemini, con «Gemini Advanced con Ultra 1.0» lanzado a través de un nuevo nivel «IA Premium» de Google One. Gemini Pro recibió un lanzamiento global.

En febrero de 2024, Google lanzó Gemini 1.5, que presentaba una nueva arquitectura, un enfoque de mezcla de expertos y una ventana de contexto de un millón de tokens. Ese mismo mes, Google presentó Gemma, una gama más pequeña, gratuita y de código abierto de modelos Gemini, descrita como una respuesta a las prácticas de código abierto de Meta. Gemini 1.5 Flash se anunció el 14 de mayo de 2024, en la conferencia magistral de I/O, con planes para integrar Gemini Nano en Google Chrome a través de su arquitectura «IA integrada». Los modelos actualizados, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, se lanzaron el 24 de septiembre de 2024.

Impacto y legado

Gemini 1 estableció a Google DeepMind como una fuerza líder en la IA generativa, compitiendo directamente con OpenAI y Anthropic. Su enfoque multimodal influyó en el desarrollo de modelos posteriores en toda la industria, incluidos los esfuerzos de Amazon Web Services y Microsoft Azure en servicios de IA en la nube. La integración del modelo en productos de consumo como los smartphones Pixel y los dispositivos Samsung amplió la accesibilidad de la IA, mientras que sus modelos Gemma de código abierto contribuyeron a la comunidad de investigación de IA en general.

El lanzamiento también provocó discusiones regulatorias, con Google interactuando con los gobiernos de EE. UU. y el Reino Unido sobre pruebas de seguridad. En 2025, Gemini ha evolucionado a través de múltiples versiones, con Gemini 2.0 anunciado en diciembre de 2024, pero Gemini 1 sigue siendo significativo como el lanzamiento fundacional que demostró la viabilidad de los sistemas de IA multimodales a gran escala.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:google-deepmind·large-language-model·generative-ai·ai-release
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial