Gemini (modelo de lenguaje)

Traducido del inglés

Gemini es la familia de modelos de lenguaje grandes multimodales de Google DeepMind, anunciada el 6 de diciembre de 2023, que sucede a LaMDA y PaLM 2. Impulsa el chatbot [[gemini-chatbot|Gemini]] e incluye modelos como Pro, Flash y Nano.

Gemini es una familia de modelos de lenguaje de gran tamaño (LLM) multimodales desarrollados por Google DeepMind, una subsidiaria de Google. Sirve como sucesor de los modelos anteriores de Google, LaMDA y PaLM 2. La familia Gemini incluye varias variantes, como Gemini Pro, Gemini Deep Think, Gemini Flash y Gemini Flash Lite, y alimenta el chatbot Gemini. El nombre Gemini hace referencia al signo zodiacal de Géminis y también alude a la fusión de Google Brain y DeepMind, así como al Proyecto Gemini de la NASA. Anunciado el 6 de diciembre de 2023, Gemini fue diseñado para procesar múltiples tipos de datos simultáneamente, incluidos texto, imágenes, audio, video y código informático, lo que lo distingue de muchos predecesores que solo manejaban texto.

El desarrollo de Gemini marcó un paso significativo en los esfuerzos de Google por competir en el espacio de la IA generativa, particularmente contra el GPT-4 de OpenAI y otros modelos de lenguaje de gran tamaño. Google posicionó a Gemini como su "modelo de IA más grande y capaz", con capacidades que se extienden más allá de la generación de texto para incluir comprensión y generación de imágenes, y una posible integración con la robótica. El modelo fue entrenado en las Unidades de Procesamiento Tensorial (TPU) de Google y estuvo inicialmente disponible solo en inglés, con un despliegue gradual en los productos y servicios de Google.

Desarrollo

Google anunció por primera vez Gemini durante la conferencia magistral de Google I/O el 10 de mayo de 2023, y el CEO Sundar Pichai lo describió como un sucesor más potente de PaLM 2, que también se presentó en ese evento. En ese momento, Gemini aún estaba en desarrollo temprano, pero ya era notable por su diseño multimodal, que lo diferenciaba de muchos LLM existentes que se basaban principalmente en corpus de texto. El modelo se desarrolló como una colaboración entre DeepMind y Google Brain, dos grupos de investigación de IA que se fusionaron en Google DeepMind en abril de 2023.

Demis Hassabis, CEO de DeepMind, destacó el potencial de Gemini en una entrevista con Wired, sugiriendo que podría superar a ChatGPT de OpenAI, que funciona con GPT-4. Hassabis se basó en la experiencia de DeepMind con AlphaGo, el programa que derrotó al campeón de Go Lee Sedol en 2016, e indicó que Gemini combinaría las fortalezas de AlphaGo con otros LLM de Google-DeepMind. En agosto de 2023, The Information informó que Google tenía como objetivo lanzar Gemini a finales de 2023, con planes de integrar capacidades de texto conversacional con generación de imágenes impulsada por IA, lo que permitiría la creación de imágenes contextuales y casos de uso más amplios.

El cofundador de Google, Sergey Brin, salió de su retiro para ayudar en el desarrollo de Gemini, trabajando junto a cientos de ingenieros de Google Brain y DeepMind. Más tarde, Brin fue acreditado como un "contribuyente principal" del proyecto. Debido a que Gemini fue entrenado con transcripciones de videos de YouTube, Google contrató abogados para filtrar material potencialmente protegido por derechos de autor. El proceso de desarrollo también implicó extensas pruebas de seguridad, ya que Google declaró que Gemini no se lanzaría ampliamente hasta 2024 para garantizar un despliegue responsable.

En respuesta al inminente lanzamiento de Gemini, OpenAI aceleró su trabajo en la integración de funciones multimodales en GPT-4. Para septiembre de 2023, varias empresas habían recibido acceso temprano a una versión inicial de Gemini, que Google planeaba ofrecer a través del servicio Vertex AI de Google Cloud. El modelo también se posicionó para competir con GitHub Copilot de Microsoft en el espacio de asistentes de codificación.

Lanzamiento

El 6 de diciembre de 2023, Sundar Pichai y Demis Hassabis anunciaron "Gemini 1.0" en una conferencia de prensa virtual. El lanzamiento inicial incluyó tres modelos: Gemini Ultra, diseñado para "tareas altamente complejas"; Gemini Pro, para "una amplia gama de tareas"; y Gemini Nano, para "tareas en el dispositivo". En el lanzamiento, Gemini Pro y Nano se integraron en Bard (el chatbot de Google) y el teléfono inteligente Pixel 8 Pro, respectivamente. Gemini Ultra estaba destinado a impulsar "Bard Advanced" y estar disponible para desarrolladores a principios de 2024. Google también planeó incorporar Gemini en Search, Ads, Chrome, Duet AI en Google Workspace y AlphaCode 2.

Gemini estuvo inicialmente disponible solo en inglés. Google lo promocionó como su "modelo de IA más grande y capaz", diseñado para emular el comportamiento humano. La empresa enfatizó que Gemini no estaría ampliamente disponible hasta el año siguiente debido a la necesidad de "pruebas de seguridad exhaustivas". Gemini fue entrenado y alimentado por las TPU de Google, y el nombre hacía referencia a la fusión DeepMind-Google Brain, así como al Proyecto Gemini de la NASA.

Se informó que Gemini Ultra superó a varios modelos competidores, incluidos GPT-4, Claude 2 de Anthropic, Inflection-2 de Inflection AI, LLaMA 2 de Meta y Grok 1 de xAI, en varios puntos de referencia de la industria. Se dijo que Gemini Pro superaba a GPT-3.5. En particular, Gemini Ultra fue el primer modelo de lenguaje en superar a expertos humanos en la prueba de Comprensión de Lenguaje Multitarea Masiva (MMLU) de 57 materias, logrando una puntuación del 90%. Gemini Pro se puso a disposición de los clientes de Google Cloud en AI Studio y Vertex AI el 13 de diciembre de 2023, y Gemini Nano se puso a disposición de los desarrolladores de Android más tarde.

Hassabis también reveló que DeepMind estaba explorando cómo Gemini podría combinarse con la robótica para permitir la interacción física con el mundo. En línea con una orden ejecutiva de EE. UU. firmada por el presidente Joe Biden en octubre de 2023, Google declaró que compartiría los resultados de las pruebas de Gemini Ultra con el gobierno federal de EE. UU. Del mismo modo, Google se comprometió con el gobierno del Reino Unido para alinearse con los principios de la Cumbre de Seguridad de la IA en Bletchley Park en noviembre de 2023.

En junio de 2025, Google presentó Gemini CLI, un agente de IA de código abierto que lleva las capacidades de Gemini al terminal, ofreciendo funciones de codificación, automatización y resolución de problemas con generosos límites de uso gratuito para desarrolladores individuales.

Actualizaciones

En enero de 2024, Google se asoció con Samsung para integrar Gemini Nano y Gemini Pro en la línea de teléfonos inteligentes Galaxy S24. El mes siguiente, Bard y Duet AI se unificaron bajo la marca Gemini, y "Gemini Advanced with Ultra 1.0" se lanzó a través de un nuevo nivel "AI Premium" del servicio de suscripción Google One. Gemini Pro también recibió un lanzamiento global.

En febrero de 2024, Google lanzó Gemini1.5, describiéndolo como máás potente y capaz que 1.0 Ultra. Los cambios incluyeron una nueva arquitectura, un enfoque de mezcla de expertos y una ventana de contexto máás grande de un millón de tokens. El mismo mes, Google presentó Gemma, una gama máás pequeña, gratuita y de cóódigo abierto de modelos Gemini. Varias publicaciones describieron esto como una respuesta a Meta y otros que abrieron sus modelos de IA, y un cambio respecto a la práctica anterior de Google de mantener su IA propietaria.

Google anunció un modelo adicional, Gemini 1.5 Flash, el 14 de mayo de 2024, en la conferencia magistral de Google I/O. En el mismo evento, Google anunció planes para integrar una versión de Gemini Nano optimizada para escritorio directamente en el navegador Google Chrome a través de su arquitectura "Built-in AI", exponiendo capacidades de procesamiento local a desarrolladores web mediante API experimentales como la API Prompt ("window.ai").

Dos modelos Gemini actualizados, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, se lanzaron el 24 de septiembre de 2024.

El 11 de diciembre de 2024, Google anunció el nuevo modelo experimental Gemini 2.0 Flash. Las características incluyen una API Live multimodal para interacciones de audio y video en tiempo real, generación nativa de imágenes y texto a voz controlable (con marca de agua), y búsqueda integrada de Google. También introdujo mejoras en las capacidades de razonamiento y codificación.

Arquitectura y Entrenamiento

Gemini se basa en una arquitectura de transformador, que es la base de muchos modelos de lenguaje de gran tamaño modernos. El modelo emplea un enfoque de mezcla de expertos en versiones posteriores, lo que le permite escalar de manera eficiente al activar solo subredes relevantes para cada tarea. El entrenamiento involucró conjuntos de datos masivos, incluyendo texto, imágenes, audio, video y cóódigo, provenientes de varios repositorios, incluyendo transcripciones de YouTube, lo que requirió un filtrado cuidadoso para cumplir con los derechós de autor.

El modelo fue entrenado en las TPU de Google, que son aceleradores de inteligencia artificial personalizados. Esta infraestructura permitió a Gemini manejar ejecuciones de entrenamiento a gran escala, contribuyendo a su rendimiento en puntos de referencia como MMLU. El enfoque de entrenamiento multimodal permite a Gemini procesar y generar contenido en diferentes modalidades, lo que lo hace versátil para aplicaciones que van desde la generación de texto hasta la comprensión de imágenes.

Capacidades y Rendimiento

Las capacidades de Gemini abarcan múltiples dominiios. Puede realizar tareas de razonamiento complejas, generar cóódigo, comprender y generar imágenes, y procesar audio y video. El rendimiento del modelo en puntos de referencia de la industria ha sido un punto clave de venta. La puntuación del 90% de Gemini Ultra en MMLU, donde superó a expertos humanos, fue un logro notable, destacando su amplio conocimientó en 57 materias.

Además de los puntos de referencia, Gemini se ha integrado en varios productos de Google, incluyendo Search, Ads y Chrome, mejorando sus caracteríisticas impulsadas por IA. La capacida del modelo para manejar ventanas de contexto largas, hasta un millón de tokens en Gemini1.5, le permite procesar documentos grandes o cóódigos completos, lo que lo hace úutil para desarrolladores e investigadores.

Integración y Ecosistema

Gemini está integrado en los servicíos de nube de Google, incluyendo Google Cloud y Vertex AI, lo que permite a las empresas acceder a sus capacidades. También alimenta el chatbot Gemini, que fue renombrado desde Bard en febrero de 2024. La disponibilida del modelo en disposítivos Android, a través de Gemini Nano, permite el procesamiento de IA en el disposítivo, lo que es importante para aplicaciones sensibles a la privacida y la latencia.

Google también ha hecho disponible Gemini a través de asociaciones, como con Samsung Electronics para el Galaxy S24, y a través de lanzamientos de cóódigo abierto como Gemma, que son modelos más pequeños y accesibles. El Gemini CLI, introducido en 2025, proporciona una interfaz de línea de comandos para desarrolladores, ampliando aún más su ecosistema.

Recepción e Impacto

Gemini ha sido bien recibido en la comunida de IA por sus capacidades multimodales y su fuerte rendimiento en puntos de referencia. Sin embargo, también ha enfrentado escrutinio en cuanto a segurida, problemas de derechós de autor y el impactó ambiental del entrenamiento de modelos grandes. La decición de Google de compartir los resultados de las pruebas con los gobiernos refleja preocupaciones más amplias sobre la regulación de la IA y la segurida.

El lanzamiento de Geminí intensificó la competencia en la industria de la IA, lo que llevó a rivales como OpenAI y Anthropic a acelerar sus propíos desarrollos. La integración de Geminí en los productos de Google también ha planteado preguntas sobre el dominio del mercado y las implicaciones éticas del despliegue de la IA.

Direcciones Futuras

Google continúa iterando sobre Geminí, con actualizaciones como Geminí2.0 Flash Experimental que indican un enfoque en interacciones en tiempo real y generación multimodaal. La exploración de la integración robótica sugiere aplicaciones potenciales en sistemas de IA físicos. A partír de 2025, se espera que Geminí evolucone aún más, con investigación continua en mejoras del razonamiento, la eficiencia y la segurida.

El desarrollo de Geminí también se alínea con tendencias más amplias en IA generativa, donde los modelos se están volviendo más multimodales y capaces de manejar tareas complejas. La inversión de Google en TPU y su asociación con Broadcom para chips personalizados subrayan su compromiso con el avance de la infraestructura de IA.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·large-language-models·google-deepmind·multimodal-ai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial