Gemini 3 es una familia de modelos de lenguaje de gran tamaño (LLM) multimodales desarrollados por Google DeepMind, lanzados en noviembre de 2025. Sirve como sucesor de Gemini 2.0, que se anunció en diciembre de 2024, y continúa la línea Gemini que comenzó con Gemini 1.0 en diciembre de 2023. El modelo está diseñado con un enfoque en el razonamiento mejorado y el pensamiento paso a paso, lo que le permite abordar problemas complejos en campos como las matemáticas, la ciencia y la programación con mayor transparencia y precisión. Gemini 3 impulsa el chatbot Gemini y está disponible a través de los servicios de Google Cloud, incluidos Vertex AI y AI Studio, así como a través de la CLI de Gemini para interacciones basadas en terminal.
El lanzamiento de Gemini 3 se basa en la trayectoria de Google DeepMind de avanzar en la IA multimodal, que procesa texto, imágenes, audio, video y código simultáneamente. A diferencia de versiones anteriores que enfatizaban una amplia capacidad, Gemini 3 introduce un motor de razonamiento refinado que genera explícitamente pasos intermedios antes de llegar a las respuestas finales. Esta característica, a menudo denominada razonamiento de cadena de pensamiento, permite al modelo explicar su lógica, verificar sus propias conclusiones y reducir errores en tareas de múltiples pasos. El lanzamiento de noviembre de 2025 posicionó a Gemini 3 como un competidor directo de otros modelos de vanguardia de OpenAI y Anthropic, con Google enfatizando su rendimiento superior en puntos de referencia de razonamiento y su integración en el ecosistema de Google, incluidos Search, Workspace y Android.
Desarrollo y antecedentes
El desarrollo de Gemini 3 comenzó poco después del lanzamiento de Gemini 2.0 en diciembre de 2024, que introdujo características como una API multimodal en vivo para interacciones de audio y video en tiempo real, generación de imágenes nativa y búsqueda de Google integrada. Google DeepMind, liderado por el CEO Demis Hassabis, aprovechó los conocimientos de modelos anteriores, incluido el programa AlphaGo que ganó fama en 2016, para diseñar las capacidades de razonamiento de Gemini 3. El modelo se entrenó en las unidades de procesamiento tensorial (TPU) de Google, que son aceleradores personalizados de Machine learning, e incorporó una arquitectura de mezcla de expertos para mejorar la eficiencia y la escalabilidad. Este enfoque permite al modelo activar solo las subredes relevantes para cada consulta, reduciendo los costos computacionales y manteniendo un alto rendimiento.
Durante el desarrollo, Google DeepMind colaboró con diversas instituciones de investigación y se basó en avances en el diseño de Deep learning y Neural network. El equipo incluyó ingenieros de Google Brain y DeepMind, que se habían fusionado en 2023, y recibió contribuciones del cofundador Sergey Brin, a quien se le atribuyó ser un contribuyente principal en versiones anteriores de Gemini. El proceso de entrenamiento involucró conjuntos de datos masivos, incluidos transcripciones de videos de YouTube, con equipos legales filtrando material potencialmente protegido por derechos de autor. Como en lanzamientos anteriores, Google enfatizó las pruebas de seguridad y, de acuerdo con las órdenes ejecutivas de EE. UU. y los acuerdos internacionales de la Cumbre de Seguridad de la IA en Bletchley Park, Google compartió los resultados de evaluación con agencias gubernamentales en los Estados Unidos y el Reino Unido.
Lanzamiento y disponibilidad
Gemini 3 se anunció oficialmente en una conferencia de prensa virtual en noviembre de 2025, con Sundar Pichai, CEO de Google, y Demis Hassabis presentando el nuevo modelo. El lanzamiento incluyó múltiples variantes: Gemini 3 Pro, diseñado para una amplia gama de tareas; Gemini 3 Ultra, para razonamiento altamente complejo; Gemini 3 Flash, optimizado para velocidad y eficiencia; y Gemini 3 Nano, destinado a aplicaciones en el dispositivo. En el lanzamiento, Gemini 3 Pro y Nano se integraron en el chatbot Gemini y en teléfonos inteligentes Android seleccionados, respectivamente, mientras que Gemini 3 Ultra se puso a disposición de los desarrolladores a través de las plataformas Vertex AI y AI Studio de Google Cloud. El modelo se lanzó inicialmente en inglés, con planes de expansión multilingüe en los meses siguientes.
Google también presentó Gemini 3 CLI, una herramienta de línea de comandos de código abierto que lleva las capacidades del modelo a los terminales de los desarrolladores, ofreciendo funciones avanzadas de programación, automatización y resolución de problemas con límites de uso gratuito generosos. Este movimiento reflejó el lanzamiento anterior de Gemini CLI en junio de 2025, que había ganado popularidad entre los desarrolladores individuales. El lanzamiento de noviembre estuvo acompañado de una asociación con Samsung Electronics para integrar Gemini 3 en su línea de teléfonos inteligentes Galaxy S26, siguiendo una colaboración similar para Gemini 1.5 en enero de 2024. Además, Google anunció que Gemini 3 estaría disponible en Google Cloud para clientes empresariales, con niveles de precios basados en el uso y la variante del modelo.
Capacidades de razonamiento mejoradas
La característica definitoria de Gemini 3 es su razonamiento mejorado, que permite al modelo producir procesos de pensamiento paso a paso antes de generar resultados finales. Esta capacidad es particularmente notable en dominios que requieren deducción lógica, como matemáticas avanzadas, resolución de problemas científicos y generación de código. En pruebas de referencia, se informó que Gemini 3 Ultra superó a modelos anteriores, incluidos Gemini 2.0 y competidores como GPT-4 de OpenAI, en la prueba de comprensión de lenguaje multitarea masiva (MMLU), logrando una puntuación superior al 90%. El modelo también demostró un rendimiento mejorado en puntos de referencia de razonamiento especializados, como aquellos que involucran preguntas de múltiples saltos e inferencia causal.
El pensamiento paso a paso se implementa mediante una combinación de técnicas, que incluyen el prompting de Chain-of-thought, Reinforcement learning a partir de retroalimentación humana (RLHF) y Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo a partir de retroalimentación de IA). Estos métodos permiten al modelo descomponer consultas complejas en subproblemas más pequeños y manejables, resolver cada uno y luego sintetizar los resultados. Este enfoque no solo mejora la precisión, sino que también proporciona a los usuarios explicaciones transparentes de cómo el modelo llegó a sus respuestas, lo que es valioso para la depuración, la educación y la generación de confianza. Sin embargo, el proceso de razonamiento puede aumentar la latencia, y Google ha optimizado Gemini 3 Flash para equilibrar la velocidad y la profundidad del razonamiento en aplicaciones en tiempo real.
Características multimodales e integración
Gemini 3 continúa la tradición multimodal de sus predecesores, procesando texto, imágenes, audio, video y código simultáneamente. El modelo puede generar imágenes a partir de descripciones de texto, crear respuestas de audio con texto a voz controlable y analizar contenido de video en tiempo real. Una adición notable es la API multimodal en vivo, que admite interacciones de audio y video en tiempo real, lo que permite aplicaciones como asistentes virtuales, servicios de traducción y herramientas educativas interactivas. La generación de imágenes nativa incluye marcas de agua para identificar contenido creado por IA, abordando preocupaciones sobre la desinformación.
La integración con el ecosistema de Google es extensa. Gemini 3 impulsa funciones en Google Search, proporcionando respuestas más detalladas y razonadas a consultas complejas. En Google Workspace, mejora Duet AI, ayudando con la redacción de documentos, el análisis de hojas de cálculo y la composición de correos electrónicos. En Android, Gemini 3 Nano permite el procesamiento en el dispositivo para tareas como resúmenes y respuestas inteligentes, con beneficios de privacidad ya que los datos permanecen en el dispositivo. El modelo también se integra con los servicios de Google Cloud, lo que permite a los desarrolladores crear aplicaciones personalizadas utilizando API y SDK. Además, Gemini 3 admite la integración con herramientas y bases de datos externas, lo que le permite acceder a información actualizada y realizar acciones como reservar citas o consultar sistemas empresariales.
Rendimiento y puntos de referencia
En evaluaciones independientes, Gemini 3 demostró un rendimiento sólido en una variedad de puntos de referencia. En la prueba MMLU, que cubre 57 materias, Gemini 3 Ultra obtuvo una puntuación del 92%, superando el rendimiento experto humano y excediendo la puntuación del 90% lograda por Gemini 1.0 Ultra. En puntos de referencia de programación, como HumanEval y Codeforces, Gemini 3 Pro superó a GPT-4 y Claude 3.5, con tasas de aprobación más altas en el código generado y mejor adherencia a las especificaciones del problema. En razonamiento matemático, el modelo resolvió un mayor porcentaje de problemas del conjunto de datos MATH, particularmente aquellos que requieren derivaciones de múltiples pasos.
Sin embargo, algunos investigadores señalaron que las mejoras de razonamiento de Gemini 3 conllevan compensaciones. El pensamiento paso a paso del modelo puede ser verboso y, en algunos casos, puede explicar en exceso consultas simples, lo que lleva a un mayor uso de tokens y costos computacionales más altos. Google abordó esto ofreciendo una profundidad de razonamiento configurable, lo que permite a los usuarios elegir entre explicaciones concisas y detalladas. Además, aunque Gemini 3 sobresale en tareas de razonamiento estructurado, su rendimiento en escritura creativa abierta sigue siendo comparable al de modelos anteriores, sin ganancias significativas en originalidad o variedad estilística.
Panorama competitivo
El lanzamiento de Gemini 3 intensificó la competencia en el mercado de Large language model. OpenAI, que había lanzado GPT-4 y estaba desarrollando GPT-5, respondió acelerando sus propios modelos centrados en el razonamiento, como la serie o1, que también emplean pensamiento paso a paso. Anthropic, con sus modelos Claude 3.5 y Claude 4, enfatizó la seguridad y la interpretabilidad, posicionándose como una alternativa para clientes empresariales preocupados por la alineación de la IA. Otros actores, incluidos meta (con LLaMA 3), Mistral AI y xAI (con Grok 3), continuaron lanzando modelos de código abierto y propietarios, aunque ninguno igualó las puntuaciones de referencia reportadas de Gemini 3 en el lanzamiento.
La estrategia de Google de integrar Gemini 3 en todos sus productos le dio una ventaja de distribución, ya que el modelo era accesible para miles de millones de usuarios a través de Search, Android y Chrome. Sin embargo, las preocupaciones sobre la privacidad de los datos y las prácticas monopolísticas llevaron a un escrutinio regulatorio, particularmente en la Unión Europea, donde las investigaciones sobre las asociaciones de IA y el manejo de datos de Google estaban en curso. En respuesta, Google enfatizó su compromiso con el desarrollo responsable de la IA, publicando informes de transparencia y ofreciendo opciones de exclusión para la recopilación de datos en algunas regiones.
Direcciones futuras
Tras el lanzamiento de noviembre de 2025, Google DeepMind anunció planes para actualizaciones iterativas de Gemini 3, incluidas versiones ajustadas para industrias específicas como la atención médica, las finanzas y la educación. La compañía también insinuó Gemini 3.5, esperado para mediados de 2026, que incorporaría avances en la eficiencia del Machine learning y posiblemente una ventana de contexto más grande, basándose en la capacidad de un millón de tokens introducida en Gemini 1.5. La investigación sobre la combinación de Gemini con robótica, mencionada por Hassabis en lanzamientos anteriores, continuó, con prototipos para la interacción con el mundo físico probados en entornos controlados.
Además, Google exploró asociaciones con otras empresas de tecnología, incluidas AMD y Qualcomm, para optimizar Gemini 3 para dispositivos de borde y reducir la dependencia de la infraestructura en la nube. La comunidad de código abierto recibió acceso a una versión más pequeña y destilada de Gemini 3, similar a los modelos Gemma lanzados en febrero de 2024, lo que permite a los investigadores experimentar con técnicas de razonamiento. A partir de la fecha de lanzamiento, Gemini 3 representó un paso significativo en el razonamiento de la IA, pero su impacto a largo plazo dependerá de cómo se adopte y refine en los próximos años.
Recepción e impacto
Las primeras reseñas de Gemini 3 fueron en gran medida positivas, con periodistas tecnológicos e investigadores elogiando su transparencia de razonamiento y precisión en tareas complejas. Los educadores notaron su potencial como herramienta de tutoría, ya que las explicaciones paso a paso podrían ayudar a los estudiantes a comprender los procesos de resolución de problemas. Los desarrolladores de software apreciaron la mejora en la generación de código y la asistencia de depuración, y muchos informaron una reducción del tiempo dedicado a tareas de programación rutinarias. Sin embargo, algunos críticos plantearon preocupaciones sobre el impacto ambiental de entrenar modelos tan grandes, así como el potencial de uso indebido para generar desinformación convincente o automatizar ciberataques.
Google respondió a estas preocupaciones destacando su uso de energía renovable para los centros de datos y su inversión en investigación de seguridad de la IA. La compañía también colaboró con instituciones académicas, como MIT CSAIL y Stanford AI Lab, para estudiar las implicaciones sociales de la IA con capacidad de razonamiento. En general, el lanzamiento de Gemini 3 marcó un hito en la evolución de la Generative AI, demostrando que los modelos de lenguaje de gran tamaño podían ir más allá del reconocimiento de patrones hacia un razonamiento lógico más deliberado. A partir de noviembre de 2025, se consideraba uno de los sistemas de IA más avanzados disponibles, estableciendo un nuevo estándar para lo que los usuarios podían esperar de las herramientas de IA conversacionales y analíticas.