El lanzamiento de Google Gemini Ultra en febrero de 2024 marcó la publicación pública de Gemini Ultra 1.0, el modelo más grande y capaz de la familia Gemini de modelos de lenguaje grandes multimodales desarrollados por Google DeepMind. Este lanzamiento siguió al anuncio inicial de Gemini 1.0 el 6 de diciembre de 2023, e hizo que el modelo estuviera disponible para los consumidores a través de un nuevo nivel de suscripción, posicionándolo como un competidor directo de otros sistemas avanzados de IA como el GPT-4 de OpenAI.
Gemini Ultra 1.0 fue diseñado para tareas altamente complejas, distinguiéndolo de los otros modelos de la familia Gemini, como Gemini Pro y Gemini Nano. Se integró en Bard Advanced, una versión premium del chatbot de IA de Google, y también se ofreció a través del servicio de suscripción Google One bajo el nivel "AI Premium". El lanzamiento representó un paso significativo en los esfuerzos de Google por comercializar su tecnología de IA más avanzada y competir en el mercado de la IA generativa en rápida evolución.
Antecedentes y desarrollo
El desarrollo de Gemini comenzó como una colaboración entre Google Brain y DeepMind, que se fusionaron en abril de 2023 para formar Google DeepMind. Anunciado en la conferencia magistral de Google I/O el 10 de mayo de 2023, Gemini se posicionó como un sucesor de PaLM 2, con un enfoque en la multimodalidad - la capacidad de procesar texto, imágenes, audio, video y código informático simultáneamente. El CEO de Google, Sundar Pichai, y el CEO de DeepMind, Demis Hassabis, lideraron el proyecto, con el cofundador Sergey Brin contribuyendo supuestamente como un "colaborador principal".
Durante el desarrollo, Google buscó superar modelos existentes como GPT-4 y Claude 2 de Anthropic. El modelo se entrenó en las Unidades de Procesamiento Tensorial (TPU) de Google e incorporó técnicas del programa AlphaGo de DeepMind. Para agosto de 2023, los informes indicaban que Google apuntaba a un lanzamiento a finales de 2023, y se otorgó acceso temprano a empresas seleccionadas a través del servicio Vertex AI de Google Cloud.
Anuncio y lanzamiento inicial
El 6 de diciembre de 2023, Pichai y Hassabis anunciaron Gemini 1.0 en una conferencia de prensa virtual. El lanzamiento incluyó tres modelos: Gemini Ultra, diseñado para "tareas altamente complejas"; Gemini Pro, para "una amplia gama de tareas"; y Gemini Nano, para "tareas en el dispositivo". En el lanzamiento, Gemini Pro y Nano se integraron en Bard y en el teléfono inteligente Pixel 8 Pro, respectivamente, mientras que Gemini Ultra estaba programado para estar disponible a principios de 2024 a través de Bard Advanced.
Gemini Ultra fue promocionado como el "modelo de IA más grande y capaz" de Google y fue el primero en superar a los expertos humanos en la prueba de Comprensión Masiva de Lenguaje Multitarea (MMLU) de 57 materias, obteniendo un 90%. También superó a GPT-4, Claude 2, Inflection-2, LLaMA 2 y Grok 1 en varios puntos de referencia. Debido a los extensos requisitos de pruebas de seguridad, el modelo no estuvo ampliamente disponible hasta el año siguiente.
El lanzamiento de febrero de 2024
En febrero de 2024, Google lanzó Gemini Ultra 1.0 como parte de la experiencia "Gemini Advanced", disponible a través del nivel de suscripción Google One AI Premium. Este lanzamiento también vio la unificación de Bard y Duet AI bajo la marca Gemini, con Bard Advanced convirtiéndose en Gemini Advanced. El modelo se puso a disposición de los usuarios en inglés, con un costo de suscripción que lo posicionó como una oferta premium.
El lanzamiento fue acompañado por un despliegue global de Gemini Pro, ampliando el acceso al modelo en más regiones. Google también comenzó a integrar Gemini en otros productos, incluidos Search, Ads, Chrome y Google Workspace, lo que indica una estrategia más amplia para incorporar la IA en todo su ecosistema.
Capacidades técnicas y arquitectura
Gemini Ultra 1.0 se construyó sobre una arquitectura transformador, similar a otros modelos de lenguaje grandes, pero con mejoras para el procesamiento multimodal. Podía manejar texto, imágenes, audio, video y código, lo que lo hacía versátil para aplicaciones que van desde la comprensión del lenguaje natural hasta la generación de código. El modelo se entrenó en un conjunto de datos masivo, incluidos transcripciones de videos de YouTube, con equipos legales que filtraban material con derechos de autor.
Una característica notable fue su capacidad para generar imágenes contextuales, una capacidad que lo diferenciaba de los modelos de solo texto. Esto se logró mediante la integración con la generación de imágenes impulsada por IA, lo que permitía al modelo crear contenido visual basado en indicaciones textuales. El modelo también demostró un fuerte rendimiento en tareas de razonamiento y resolución de problemas, aprovechando técnicas de aprendizaje profundo y redes neuronales.
Integración y asociaciones
Tras el lanzamiento, Google se asoció con Samsung para integrar Gemini Nano y Pro en la línea de teléfonos inteligentes Galaxy S24 en enero de 2024. Esto marcó un paso significativo en llevar IA avanzada a los dispositivos móviles, con procesamiento en el dispositivo para tareas como resumen y traducción.
En el espacio empresarial, Gemini Ultra se puso a disposición de los desarrolladores a través de Vertex AI y AI Studio de Google Cloud, lo que permitía a las empresas crear aplicaciones personalizadas. El modelo también se integró en Duet AI de Google para Workspace, mejorando las herramientas de productividad con asistencia impulsada por IA.
Recepción e impacto
El lanzamiento de Gemini Ultra 1.0 recibió una atención significativa en la comunidad de IA, ya que representó un hito importante en la carrera por capacidades avanzadas de IA. Su rendimiento en puntos de referencia como MMLU estableció un nuevo estándar, y sus características multimodales se consideraron un paso hacia una IA más similar a la humana.
Sin embargo, algunos críticos señalaron que la disponibilidad del modelo era limitada, y el acceso basado en suscripción se consideró una barrera para algunos usuarios. A pesar de esto, el lanzamiento consolidó la posición de Google como líder en inteligencia artificial, compitiendo directamente con OpenAI y otros actores.
Desarrollos posteriores
En los meses posteriores al lanzamiento, Google continuó iterando en la familia Gemini. En febrero de 2024, la compañía presentó Gemini 1.5, que presentaba una arquitectura de mezcla de expertos y una ventana de contexto más grande de un millón de tokens. Más tarde ese año, Google lanzó versiones actualizadas, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, y en diciembre de 2024, anunció Gemini 2.0 Flash Experimental.
Estas actualizaciones demostraron el compromiso de Google con el avance rápido en IA, con cada iteración trayendo mejoras en rendimiento, eficiencia y capacidades. El lanzamiento de Gemini Ultra marcó así el comienzo de una nueva era en las ofertas de IA de Google, sentando las bases para futuras innovaciones en el campo.