Lanzamiento multimodal de Google Gemini 3

Traducido del inglés

Gemini 3, anunciado por Google DeepMind en noviembre de 2025, es un modelo de lenguaje grande nativamente multimodal que procesa texto, imagen, video y audio simultáneamente, sucediendo a Gemini 2.0 y alimentando el chatbot Gemini.

Gemini 3 es una familia de modelos de lenguaje de gran tamaño (LLM) multimodales desarrollados por Google DeepMind, anunciada en noviembre de 2025 como sucesora de Gemini 2.0. Es nativamente multimodal, lo que significa que procesa texto, imágenes, video y audio simultáneamente desde su base, en lugar de depender de componentes separados para cada modalidad. El modelo impulsa el chatbot Gemini y recibe su nombre del signo zodiacal Géminis, continuando la convención de nomenclatura establecida con el lanzamiento original de Gemini 1.0 en diciembre de 2023.

El lanzamiento posicionó a Gemini 3 como un competidor directo de los modelos de OpenAI y Anthropic, con Google enfatizando su arquitectura unificada como un diferenciador clave. A diferencia de versiones anteriores que integraban capacidades multimodales mediante módulos auxiliares, Gemini 3 fue entrenado de extremo a extremo con todos los tipos de datos, lo que le permite razonar entre modalidades en una sola pasada. Este diseño se basa en el trabajo fundacional de Google DeepMind, que fusionó DeepMind y Google Brain en 2023 para acelerar el desarrollo.

Antecedentes de desarrollo

El desarrollo de Gemini 3 se remonta al proyecto Gemini original, anunciado por primera vez en Google I/O el 10 de mayo de 2023 por el CEO Sundar Pichai. El modelo inicial, Gemini 1.0, se lanzó el 6 de diciembre de 2023 con tres variantes: Ultra para tareas complejas, Pro para uso general y Nano para procesamiento en el dispositivo. Fue entrenado en las Unidades de Procesamiento Tensorial (TPU) de Google e incorporó lecciones del programa AlphaGo de DeepMind, que derrotó al campeón de Go Lee Sedol en 2016.

Iteraciones posteriores refinaron la arquitectura. Gemini 1.5, lanzado en febrero de 2024, introdujo un enfoque de mezcla de expertos y una ventana de contexto de un millón de tokens. Gemini 2.0 Flash Experimental, anunciado el 11 de diciembre de 2024, añadió una API multimodal en vivo para interacciones de audio y video en tiempo real. Gemini 3 se basa en estos avances, con el lanzamiento de noviembre de 2025 centrado en la multimodalidad nativa como característica principal en lugar de un complemento.

El equipo de desarrollo incluyó a cientos de ingenieros de Google Brain y DeepMind, con el cofundador Sergey Brin contribuyendo como colaborador principal, como hizo en versiones anteriores. Los datos de entrenamiento incluyeron transcripciones de videos de YouTube, con equipos legales filtrando material potencialmente protegido por derechos de autor, una práctica que continuó para Gemini 3.

Arquitectura multimodal nativa

La característica definitoria de Gemini 3 es su diseño multimodal nativo, que procesa texto, imágenes, video y audio a través de una arquitectura transformer unificada. Esto contrasta con modelos anteriores como Gemini 1.0, que manejaba las modalidades mediante codificadores y decodificadores separados. El enfoque unificado permite al modelo correlacionar información entre modalidades sin pasos de conversión intermedios, mejorando tareas como la comprensión de video con razonamiento visual y de audio sincronizado.

La arquitectura aprovecha mecanismos de atención de múltiples cabezas extendidos para manejar múltiples flujos de entrada. Se aplican codificaciones posicionales a las dimensiones temporales y espaciales, lo que permite al modelo rastrear objetos a través de fotogramas de video y alinear el habla con los elementos visuales correspondientes. Este diseño es una desviación de la estructura codificador-decodificador utilizada en muchos LLM anteriores, favoreciendo un único transformer que procesa todas las modalidades de manera conjunta.

El entrenamiento empleó técnicas de aumento de datos para generar ejemplos multimodales emparejados, como clips de video con audio transcrito y subtítulos de imágenes. El modelo utiliza normalización de capas y conexiones residuales para estabilizar el entrenamiento en diversos tipos de datos. Google DeepMind informó que este enfoque redujo la necesidad de etapas de ajuste fino separadas para cada modalidad.

Variantes y capacidades del modelo

Gemini 3 se ofrece en múltiples configuraciones para servir diferentes casos de uso, continuando el enfoque escalonado de versiones anteriores. La línea incluye Gemini 3 Ultra para tareas de razonamiento complejo, Gemini 3 Pro para aplicaciones generales, Gemini 3 Flash para respuestas de baja latencia y Gemini 3 Flash Lite para entornos con recursos limitados. Cada variante comparte el mismo núcleo multimodal nativo, pero difiere en el número de parámetros y en la optimización entre velocidad y precisión.

Las capacidades incluyen análisis de video en tiempo real con integración de audio, generación de imágenes a partir de descripciones textuales y búsqueda entre modalidades - por ejemplo, encontrar un momento específico en un video basado en una consulta hablada. El modelo también admite muestreo top-p y escalado de temperatura para la generación controlada de salidas, y puede producir texto a voz con marcas de agua para verificar la autenticidad, una característica heredada de Gemini 2.0.

Para desarrolladores, Gemini 3 es accesible a través de Google Cloud's Vertex AI y las plataformas AI Studio, con API que admiten entradas de audio y video en streaming. El modelo se integra con Google Search para la recuperación de información actualizada, y impulsa el chatbot Gemini en interfaces web y móviles.

Rendimiento y puntos de referencia

En el lanzamiento, Google DeepMind informó que Gemini 3 Ultra superó a su predecesor y a modelos competidores en varios puntos de referencia de la industria, aunque las puntuaciones específicas no se divulgaron por completo. La compañía afirmó mejoras en tareas de razonamiento multimodal, como respuesta a preguntas visuales y comprensión de video, donde la arquitectura nativa proporciona una ventaja sobre modelos que procesan modalidades por separado.

Las versiones anteriores de Gemini establecieron altas expectativas: Gemini Ultra fue el primer LLM en superar el rendimiento experto humano en la prueba de Comprensión de Lenguaje Masivo Multitarea (MMLU) de 57 materias con una puntuación del 90%. Gemini 3 se basa en este legado, con informes tempranos que indican resultados sólidos en puntos de referencia multimodales como Video-MMLU y AudioQA, aunque la verificación independiente estaba en curso en la fecha del lanzamiento.

El rendimiento del modelo se atribuye a su entrenamiento en TPU y al uso de técnicas de normalización por lotes adaptadas para datos multimodales. Google DeepMind enfatizó que la arquitectura unificada de Gemini 3 reduce la propagación de errores entre componentes específicos de modalidad, un problema común en sistemas multimodales anteriores.

Integración y ecosistema

Gemini 3 está integrado en todo el ecosistema de productos de Google, incluidos Search, Chrome y Google Workspace, siguiendo el patrón de lanzamientos anteriores de Gemini. El modelo impulsa el chatbot Gemini, que fue renombrado de Bard en febrero de 2024. En Android, Gemini 3 Nano está optimizado para tareas en el dispositivo, lo que permite el procesamiento sin conexión de imágenes y audio sin conectividad a la nube.

En asociaciones de hardware, Google colaboró con Samsung Electronics para integrar Gemini 3 en la línea de teléfonos inteligentes Galaxy S25, anunciada a principios de 2025. Esto sigue la asociación de enero de 2024 que trajo Gemini Nano y Pro al Galaxy S24. La integración incluye características como traducción en tiempo real de videollamadas y edición de fotos en el dispositivo con comandos de lenguaje natural.

Para usuarios empresariales, Gemini 3 está disponible a través de Google Cloud, compitiendo con Amazon Web Services y Microsoft Azure en el mercado de IA como servicio. Google también presentó Gemini CLI en junio de 2025, un agente de IA de código abierto que lleva las capacidades de Gemini a la terminal, admitiendo tareas de codificación, automatización y resolución de problemas con límites de uso gratuitos para desarrolladores individuales.

Seguridad y regulación

Google DeepMind enfatizó las pruebas de seguridad para Gemini 3, en línea con el enfoque declarado de la compañía desde el lanzamiento original de Gemini. La compañía compartió los resultados de las pruebas con el gobierno federal de EE. UU., de acuerdo con una orden ejecutiva firmada por el presidente Joe Biden en octubre de 2023. También continuaron las discusiones con el gobierno del Reino Unido, siguiendo los principios establecidos en la Cumbre de Seguridad de IA en Bletchley Park en noviembre de 2023.

Las medidas de seguridad incluyen marcas de agua para imágenes y audio generados para prevenir el uso indebido, una característica introducida en Gemini 2.0 y ampliada en Gemini 3. El modelo incluye filtros para reducir salidas dañinas, y Google declaró que Gemini 3 se sometería a una evaluación exhaustiva antes de su implementación generalizada, similar al lanzamiento cauteloso de Gemini 1.0.

En el momento del lanzamiento de noviembre de 2025, Gemini 3 estaba inicialmente disponible en inglés, con planes de expansión multilingüe. Google indicó que idiomas adicionales y disponibilidad regional se implementarían en los meses siguientes, sujetos a aprobaciones regulatorias.

Panorama competitivo

Gemini 3 entra en un mercado competitivo dominado por GPT-4 y GPT-4o de OpenAI, Claude 3 de Anthropic y otros modelos de compañías como AI21 Labs y Inflection AI. El enfoque multimodal nativo de Google es un desafío directo a la integración de visión y audio en GPT-4 por parte de OpenAI, que se aceleró en respuesta al anuncio inicial de Gemini en 2023.

Analistas de la industria señalaron que la arquitectura unificada de Gemini 3 podría establecer un nuevo estándar para la IA multimodal, influyendo potencialmente en futuros modelos de competidores. El lanzamiento también destaca la rivalidad continua entre Google DeepMind y OpenAI, con ambas compañías compitiendo por lograr la inteligencia artificial general (AGI). La inversión de Google en TPU y las asociaciones con fabricantes de chips como Broadcom proporcionan una ventaja de hardware, aunque OpenAI depende de GPU NVIDIA a través de proveedores de nube.

Se espera que el lanzamiento de Gemini 3 acelere la adopción de IA multimodal en industrias como medios, atención médica y robótica, donde el procesamiento simultáneo de datos visuales y auditivos es crítico. Google DeepMind ha insinuado futuras integraciones con robótica, basándose en exploraciones anteriores de combinar Gemini con sistemas físicos.

Direcciones futuras

Google DeepMind planea continuar iterando sobre Gemini 3, con actualizaciones esperadas para mejorar la eficiencia y expandir las ventanas de contexto más allá de la capacidad de un millón de tokens de Gemini 1.5. La compañía también está explorando formas de reducir los costos computacionales mediante poda de modelos y cuantización, haciendo el modelo más accesible para desarrolladores más pequeños.

Las direcciones de investigación incluyen integrar Gemini 3 con los sistemas de conducción autónoma de Waymo y otras aplicaciones robóticas, aprovechando su comprensión multimodal para la toma de decisiones en tiempo real. Además, Google está investigando el uso de Gemini 3 en investigación científica, como el análisis de datos experimentales en múltiples modalidades.

En el momento del lanzamiento, Google DeepMind no ha anunciado un cronograma para Gemini 4, pero el rápido ritmo de desarrollo - desde Gemini 1.0 en diciembre de 2023 hasta Gemini 3 en noviembre de 2025 - sugiere actualizaciones anuales continuas. El compromiso de la compañía con la multimodalidad nativa posiciona a Gemini 3 como un modelo fundacional para futuros sistemas de IA que interactúan con el mundo a través de múltiples sentidos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:google-deepmind·multimodal-ai·large-language-model·ai-launch
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial