Traducido del inglés

Google Gemini, anteriormente Bard, es un chatbot de IA generativa y asistente virtual de Google, impulsado por modelos de lenguaje grandes. Se integra en los servicios de Google y compite con los modelos GPT de OpenAI.

Google Gemini, conocido anteriormente como Bard, es un chatbot de inteligencia artificial generativa y asistente virtual desarrollado por Google. Está impulsado por la familia de modelos de lenguaje grandes (LLM) del mismo nombre, después de haberse basado anteriormente en LaMDA y PaLM 2. La arquitectura Gemini se entrena de forma nativa en múltiples tipos de datos, lo que permite a los modelos procesar y generar texto, código informático, imágenes, audio y video simultáneamente. Google distribuye la tecnología en diversas capacidades, que van desde versiones eficientes en el dispositivo ("Nano") y variantes rentables de alto rendimiento ("Flash") hasta modelos de alta computación diseñados para razonamiento complejo ("Pro" y "Ultra"). Las generaciones de modelos 1.5 y 3 introdujeron ventanas de contexto extendidas, lo que permite el análisis de grandes conjuntos de datos, como bases de código completas, videos de larga duración o archivos documentales extensos en una sola instrucción.

Gemini se anunció por primera vez el 6 de diciembre de 2023 y reemplazó la marca existente de Google para los servicios de IA. En febrero de 2024, el chatbot Bard pasó a llamarse Gemini, y la marca "Duet AI" para Google Cloud y Workspace se retiró en favor del identificador Gemini. Los modelos se integran en el ecosistema de Google a través de la aplicación móvil Gemini, que funciona como asistente superpuesto en dispositivos Android, y a través de la plataforma Vertex AI para desarrolladores externos.

Historia

Antecedentes

En noviembre de 2022, OpenAI lanzó ChatGPT, un chatbot basado en la familia GPT-3 de modelos de lenguaje grandes. ChatGPT ganó atención mundial y se convirtió en una sensación viral en Internet. Alarmados por la posible amenaza de ChatGPT para Google Search, los ejecutivos de Google emitieron una alerta de "código rojo", reasignando varios equipos para ayudar en los esfuerzos de inteligencia artificial de la empresa. Se informó ampliamente que Sundar Pichai, CEO de Google y de la empresa matriz Alphabet, había emitido la alerta, pero Pichai luego lo negó a The New York Times. En un movimiento inusual, los cofundadores de Google, Larry Page y Sergey Brin, que habían renunciado a sus roles como co-CEO de Alphabet en 2019, asistieron a reuniones de emergencia con ejecutivos de la empresa para discutir la respuesta de Google a ChatGPT. Brin solicitó acceso al código de Google en febrero de 2023, por primera vez en años.

Google había presentado LaMDA, un LLM prototipo, a principios de 2021, pero no se lanzó al público. Cuando los empleados preguntaron en una reunión general si LaMDA era una oportunidad perdida para que Google compitiera con ChatGPT, Pichai y el jefe de IA de Google, Jeff Dean, dijeron que, aunque el chatbot de la empresa tenía capacidades similares a las de ChatGPT, existían riesgos al introducir un LLM que pudiera difundir información falsa, por lo que decidieron esperar. En enero de 2023, el CEO de DeepMind, empresa hermana de Google Brain, Demis Hassabis, insinuó planes para un rival de ChatGPT, y se instruyó a los empleados de Google a acelerar el progreso en un competidor de ChatGPT, probando intensamente "Apprentice Bard" y otros chatbots. Pichai aseguró a los inversores durante la llamada de resultados trimestrales de Google en febrero que la empresa tenía planes para expandir la disponibilidad y las aplicaciones de LaMDA.

Bard

#### Anuncio

El 6 de febrero de 2023, Google anunció Bard, un chatbot de inteligencia artificial generativa impulsado por LaMDA. Bard se implementó inicialmente a un grupo selecto de 10,000 "probadores de confianza", antes de un lanzamiento amplio programado para finales del mes. El proyecto fue supervisado por el líder de producto Jack Krawczyk, quien describió el producto como un "servicio de IA colaborativo" en lugar de un motor de búsqueda, mientras que Pichai detalló cómo Bard se integraría en Google Search. Reuters calculó que agregar funciones similares a ChatGPT a Google Search podría costarle a la empresa $6 mil millones en gastos adicionales para 2024, mientras que la firma de investigación y consultoría SemiAnalysis calculó que le costaría a Google $3 mil millones. La tecnología se desarrolló bajo el nombre en clave "Atlas", con el nombre "Bard" en referencia al término celta para narrador y elegido para "reflejar la naturaleza creativa del algoritmo subyacente".

Múltiples medios de comunicación y analistas financieros describieron a Google como "apresurando" el anuncio de Bard para adelantarse al evento planificado de Microsoft el 7 de febrero, que presentaba su asociación con OpenAI para integrar ChatGPT en su motor de búsqueda Bing en forma de Bing AI (posteriormente renombrado como Microsoft Copilot), así como para evitar jugar a "ponerse al día" con Microsoft. El CEO de Microsoft, Satya Nadella, dijo a The Verge: "Quiero que la gente sepa que los hicimos bailar". Tom Warren de The Verge y Davey Alba de Bloomberg News señalaron que esto marcó el comienzo de otro enfrentamiento entre las dos empresas de tecnología sobre "el futuro de la búsqueda", después de que su "tregua" de seis años expirara en 2021; Chris Stokel-Walker de The Guardian, Sara Morrison de Recode y el analista Dan Ives de la firma de inversión Wedbush Securities calificaron esto como una carrera armamentista de IA entre los dos.

Después de una transmisión en vivo "decepcionante" el 8 de febrero en París que mostraba Bard, las acciones de Google cayeron un ocho por ciento, equivalente a una pérdida de $100 mil millones en valor de mercado, y el video de YouTube de la transmisión se hizo privado. Muchos espectadores también señalaron un error durante la demostración en el que Bard proporciona información inexacta sobre el Telescopio Espacial James Webb en respuesta a una consulta. Los empleados de Google criticaron el anuncio "apresurado" y "mal ejecutado" de Bard por parte de Pichai en Memegen, el foro interno de la empresa, mientras que Maggie Harrison de Futurism calificó el lanzamiento como "caos". Pichai defendió sus acciones diciendo que Google había estado "trabajando profundamente en IA durante mucho tiempo", rechazando la noción de que el lanzamiento de Bard fue una reacción instintiva.

Una semana después de la transmisión en vivo de París, Pichai pidió a 80,000 empleados que dedicaran de dos a cuatro horas a probar Bard internamente, mientras que el ejecutivo de Google Prabhakar Raghavan les pidió que corrigieran cualquier error que Bard cometiera. En las semanas siguientes, los empleados de Google criticaron a Bard en mensajes internos, citando preocupaciones de seguridad y ética y pidiendo a los líderes de la empresa que no lanzaran el servicio. Los ejecutivos de Google lanzaron el producto, anulando un informe de evaluación de riesgos negativo realizado por su equipo de ética de IA. Después de que Pichai despidiera repentinamente a 12,000 empleados a finales de ese mes debido a la desaceleración del crecimiento de ingresos, los trabajadores restantes compartieron memes y fragmentos de sus intercambios humorísticos con Bard solicitando su "opinión" sobre los despidos.

Arquitectura Técnica

Los modelos Gemini se basan en una arquitectura Transformer (architecture), similar a otros Large language models, pero con una diferencia clave: se entrenan de forma nativa en múltiples tipos de datos. Este entrenamiento multimodal permite a los modelos procesar y generar texto, código, imágenes, audio y video simultáneamente, a diferencia de los modelos anteriores que manejaban cada modalidad por separado. La arquitectura incorpora técnicas como Multi-Head Attention y Positional Encoding para manejar secuencias largas. Las generaciones 1.5 y 3 extendieron las ventanas de contexto, lo que permite el análisis de grandes conjuntos de datos, como bases de código completas, videos de larga duración o archivos documentales extensos en una sola instrucción. Esto se logra mediante mecanismos de atención eficientes que reducen la sobrecarga computacional.

Google distribuye Gemini en varias variantes para equilibrar rendimiento y eficiencia. La variante "Nano" está diseñada para uso en el dispositivo, funcionando eficientemente en hardware móvil. La variante "Flash" está optimizada para tareas de alto rendimiento y rentabilidad. La variante "Pro" maneja razonamiento complejo, mientras que la variante "Ultra" es el modelo de mayor computación para las aplicaciones más exigentes. Estas variantes se integran en la plataforma Google Cloud de Google a través de Vertex AI, lo que permite a desarrolladores externos acceder a los modelos mediante API.

Integración y Disponibilidad

La aplicación móvil Gemini funciona como asistente superpuesto en dispositivos Android, reemplazando al Asistente de Google anterior en algunas capacidades. Se integra en Google Workspace, incluidos Gmail, Docs y Sheets, bajo la marca Gemini. Los modelos también están disponibles a través de la plataforma Vertex AI de Google Cloud, que proporciona herramientas para que los desarrolladores construyan e implementen aplicaciones de IA. En febrero de 2024, el chatbot Bard pasó a llamarse Gemini, y la marca "Duet AI" para Google Cloud y Workspace se retiró en favor del identificador Gemini. Este cambio de marca unificó las ofertas de IA de Google bajo un solo nombre.

Recepción y Controversias

El lanzamiento de Gemini ha generado elogios técnicos y controversia pública. Los comentaristas han destacado los puntos de referencia de los modelos en tareas de codificación y recuperación como competitivos con GPT-4 y GPT-5 de OpenAI. Sin embargo, el lanzamiento del producto enfrentó críticas con respecto a la confiabilidad de sus resultados. A principios de 2024, Google suspendió la capacidad del modelo para generar imágenes de personas después de que los usuarios informaran inexactitudes históricas y sesgos en sus representaciones de sujetos humanos. Las actualizaciones posteriores, incluidas las series Gemini 1.5 y 3 lanzadas a lo largo de 2025, se centraron en reducir las alucinaciones, mejorar la latencia y mejorar las capacidades de agente para investigación autónoma y desarrollo de software. Las controversias destacan los desafíos continuos en Generative AI con respecto al sesgo y la precisión factual.

Véase también

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·large-language-model·google·chatbot
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial