Lanzamiento del uso de herramientas de Google Gemini 3

Traducido del inglés

En noviembre de 2025, Google DeepMind lanzó Gemini 3, un modelo de lenguaje grande multimodal con uso de herramientas y llamadas a funciones mejorados, basado en la arquitectura de Gemini 2.0 y ampliando las capacidades agénticas para desarrolladores y usuarios empresariales.

Gemini 3 es un modelo de lenguaje multimodal de gran tamaño desarrollado por Google DeepMind, lanzado en noviembre de 2025 como sucesor de Gemini 2.0. El lanzamiento se centró en un uso de herramientas y capacidades de llamada a funciones significativamente mejoradas, lo que permite al modelo interactuar con sistemas de software externos, API y bases de datos de manera más fiable que las versiones anteriores. Gemini 3 se posicionó como un paso importante hacia la inteligencia artificial agéntica, donde los modelos pueden ejecutar de forma autónoma tareas de múltiples pasos en entornos digitales.

La familia de modelos mantuvo la convención de nomenclatura establecida con los lanzamientos anteriores de Gemini, incluyendo variantes optimizadas para diferentes casos de uso. Google DeepMind enfatizó que las mejoras de Gemini 3 en la orquestación de herramientas estaban diseñadas para cerrar la brecha entre la IA conversacional y la automatización práctica, permitiendo aplicaciones en desarrollo de software, análisis de datos y flujos de trabajo empresariales.

Antecedentes de Desarrollo

El desarrollo de Gemini 3 se basó en el trabajo fundacional de los modelos Gemini originales, que se anunciaron el 6 de diciembre de 2023 como sucesores de LaMDA y PaLM 2. El lanzamiento inicial de Gemini 1.0 introdujo tres niveles - Ultra, Pro y Nano - con Gemini Pro impulsando el chatbot Bard y Gemini Nano ejecutándose en el dispositivo del teléfono inteligente Pixel 8 Pro. La arquitectura se desarrolló mediante la fusión de Google Brain y DeepMind, que se habían consolidado como Google DeepMind en abril de 2023.

Las actualizaciones posteriores establecieron la trayectoria hacia Gemini 3. En febrero de 2024, Gemini 1.5 introdujo un enfoque de mezcla de expertos y una ventana de contexto de un millón de tokens, una expansión significativa sobre el modelo original. Gemini 2.0 Flash Experimental llegó el 11 de diciembre de 2024, añadiendo una API Multimodal en Vivo para interacciones de audio y video en tiempo real, generación de imágenes nativa y Búsqueda de Google integrada. Estas características sentaron las bases para las capacidades de uso de herramientas más sofisticadas que se convirtieron en el centro de Gemini 3.

Durante el período de desarrollo, Google DeepMind exploró cómo Gemini podría combinarse con la robótica para interactuar físicamente con el mundo, como reveló el CEO Demis Hassabis. Esta dirección de investigación informó la filosofía de diseño agéntica detrás del marco de llamada a funciones de Gemini 3.

Arquitectura de Uso de Herramientas

Gemini 3 introdujo una arquitectura de uso de herramientas rediseñada que permitía al modelo gestionar múltiples llamadas a funciones simultáneas con mayor precisión y recuperación de errores. El sistema empleaba un enfoque estructurado para analizar la intención del usuario, seleccionar herramientas apropiadas y formatear salidas en formatos legibles por máquina como JSON. Esto representaba una desviación de los modelos anteriores que a menudo tenían dificultades con secuencias de herramientas de múltiples pasos.

La llamada a funciones mejorada admitía patrones de ejecución tanto síncronos como asíncronos, permitiendo a los desarrolladores integrar Gemini 3 en sistemas backend complejos. El modelo podía manejar llamadas a herramientas anidadas, donde la salida de una función servía como entrada para otra, sin perder contexto. Google DeepMind informó que Gemini 3 redujo los errores de selección de herramientas en un margen sustancial en comparación con Gemini 2.0, aunque las cifras específicas de referencia no se divulgaron completamente en el lanzamiento.

Una característica notable era la capacidad del modelo para generar y ejecutar fragmentos de código dentro de un entorno aislado, lo que le permitía probar sus propias salidas antes de presentarlas a los usuarios. Este bucle de autoverificación mejoró la fiabilidad en tareas de programación y flujos de trabajo de procesamiento de datos.

Capacidades de Llamada a Funciones

Las capacidades de llamada a funciones de Gemini 3 se extendieron más allá de las invocaciones simples de API para incluir descubrimiento dinámico de esquemas, donde el modelo podía consultar los puntos finales disponibles y adaptar sus llamadas en consecuencia. Esto fue particularmente útil para implementaciones empresariales donde las API internas cambiaban con frecuencia. El modelo admitía llamadas a funciones en paralelo, lo que le permitía obtener datos de múltiples fuentes simultáneamente y sintetizar resultados.

Para los desarrolladores, Google proporcionó SDK actualizados y documentación que simplificaban el proceso de definir herramientas personalizadas. El modelo podía manejar parámetros tipados, argumentos opcionales y estructuras de retorno complejas. El manejo de errores se mejoró mediante un mecanismo de reintento que permitía a Gemini 3 corregir llamadas mal formadas sin requerir intervención del usuario.

El marco de uso de herramientas fue diseñado para funcionar tanto con servicios de Google Cloud como con plataformas de terceros. La integración con Google Cloud permitía un acceso fluido a almacenamiento, bases de datos y servicios de aprendizaje automático, mientras que el soporte para Amazon Web Services y Microsoft Azure habilitaba implementaciones en múltiples nubes. Esta interoperabilidad fue un punto de venta clave para empresas con estrategias de múltiples nubes.

Integración de IA Agéntica

Gemini 3 representó un avance significativo en la IA agéntica, moviéndose más allá del simple cuestionamiento-respuesta hacia la ejecución autónoma de tareas. El modelo podía mantener un estado persistente a través de múltiples interacciones, lo que le permitía rastrear el progreso en proyectos de larga duración. Esto se logró mediante una combinación de gestión de memoria mejorada y mecanismos explícitos de seguimiento de estado.

En términos prácticos, Gemini 3 podía implementarse como un asistente virtual que programaba reuniones, gestionaba correspondencia por correo electrónico y actualizaba sistemas de gestión de relaciones con clientes sin supervisión humana. Para el desarrollo de software, podía crear solicitudes de extracción, ejecutar pruebas y corregir errores basándose en instrucciones en lenguaje natural. Estas capacidades posicionaron a Gemini 3 como un competidor directo de características agénticas similares que estaban siendo desarrolladas por OpenAI y Anthropic.

Google DeepMind enfatizó la seguridad en implementaciones agénticas, implementando salvaguardas que requerían aprobación humana para acciones de alto impacto como transacciones financieras o eliminación de datos. El modelo también incluía registro de auditoría para rastrear todas las invocaciones de herramientas, proporcionando transparencia para fines de cumplimiento.

Rendimiento y Referencias

En el lanzamiento, Google DeepMind publicó resultados de referencia que mostraban a Gemini 3 superando a su predecesor en varias evaluaciones estándar. El modelo demostró una fortaleza particular en referencias de uso de herramientas, incluyendo los conjuntos de datos ToolBench y API-Bank, donde logró resultados de última generación. En la prueba de Comprensión de Lenguaje Multitarea Masiva (MMLU), Gemini 3 continuó la tendencia establecida por Gemini Ultra, que había sido el primer modelo en superar el rendimiento experto humano con una puntuación del 90%.

Evaluaciones independientes de instituciones académicas como Stanford AI Lab y BAIR (Berkeley AI Research) confirmaron la fiabilidad mejorada del modelo en tareas de razonamiento de múltiples pasos. Sin embargo, algunos investigadores notaron que Gemini 3 todavía tenía dificultades con especificaciones de herramientas ambiguas y requería indicaciones cuidadosamente elaboradas para un rendimiento óptimo. El rendimiento del modelo en flujos de trabajo empresariales del mundo real se informó como fuerte, aunque las sesiones agénticas de larga duración ocasionalmente requerían intervención humana.

Acceso Empresarial y para Desarrolladores

Gemini 3 se puso a disposición a través de múltiples canales, incluyendo la API de Gemini, Google Cloud Vertex AI y AI Studio. Google ofreció precios escalonados basados en el uso, con un nivel gratuito para experimentación y planes pagados para cargas de trabajo de producción. El modelo era accesible en más de 100 países, con soporte para múltiples idiomas, aunque el inglés seguía siendo el más completamente optimizado.

Para clientes empresariales, Google introdujo paquetes de soporte especializados que incluían infraestructura dedicada, acceso prioritario a nuevas características y servicios de consultoría para integración de herramientas. La compañía también se asoció con Samsung Electronics para optimizar Gemini 3 para implementación en el dispositivo en futuros dispositivos Galaxy, basándose en la integración anterior de Gemini Nano en la línea Galaxy S24.

Los desarrolladores podían acceder a Gemini 3 a través de API REST, SDK de Python y JavaScript, y una interfaz de línea de comandos. El CLI de Gemini de código abierto, introducido en junio de 2025, se actualizó para soportar el uso de herramientas mejorado de Gemini 3, permitiendo a los desarrolladores automatizar flujos de trabajo basados en terminal con comandos en lenguaje natural.

Comparaciones con Competidores

Gemini 3 entró en un panorama competitivo dominado por GPT-4 y GPT-4o de OpenAI, Claude 3 y Claude 4 de Anthropic, y alternativas de código abierto de Meta y otras organizaciones. Google posicionó a Gemini 3 como teniendo una fiabilidad de uso de herramientas superior en comparación con estos rivales, citando evaluaciones internas que mostraban menos errores en escenarios de llamada a funciones de múltiples pasos.

Comparaciones independientes por investigadores de terceros encontraron que Gemini 3 era competitivo con GPT-4o en tareas de conocimiento general y superior en ciertas referencias de codificación. La integración del modelo con la Búsqueda de Google proporcionaba una ventaja en tareas que requerían información actualizada, similar al enfoque utilizado en Gemini 2.0. Sin embargo, algunos revisores notaron que los modelos Claude de Anthropic ofrecían un mejor rendimiento en tareas de razonamiento de contexto largo, un área donde Gemini 3 mostró solo mejoras modestas.

El lanzamiento de Gemini 3 también tuvo implicaciones para el ecosistema más amplio de hardware de IA. El modelo se entrenó en las Unidades de Procesamiento Tensorial (TPU) de Google, y Google continuó invirtiendo en silicio personalizado para reducir la dependencia de las GPU de NVIDIA. Esta estrategia se alineó con esfuerzos similares de Amazon Web Services con sus chips Trainium y Microsoft Azure con aceleradores personalizados.

Direcciones Futuras

Tras el lanzamiento de noviembre de 2025, Google DeepMind indicó que Gemini 3 recibiría actualizaciones regulares, con un enfoque en expandir el uso de herramientas a más dominios y mejorar la colaboración multiagente. La compañía también exploró la integración de Gemini 3 con los sistemas de conducción autónoma de Waymo y otras aplicaciones de robótica, basándose en investigaciones anteriores sobre la combinación de modelos de lenguaje con la interacción con el mundo físico.

Google anunció planes para hacer que Gemini 3 estuviera disponible en más idiomas y para reducir la latencia para aplicaciones en tiempo real. La compañía también se comprometió a pruebas de seguridad continuas, en línea con prácticas anteriores de compartir resultados con agencias gubernamentales en los Estados Unidos y el Reino Unido. A partir de la fecha de lanzamiento, Gemini 3 estaba disponible en inglés, con soporte adicional de idiomas esperado en lanzamientos posteriores.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:google-deepmind·large-language-model·tool-use·artificial-intelligence
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial