Lanzamiento de la API de Google Gemini 3

Traducido del inglés

El lanzamiento de la API de Gemini 3 en noviembre de 2025 introdujo una nueva plataforma para desarrolladores con funciones multimodales avanzadas, niveles de precios actualizados e integración ampliada en la nube, basándose en la familia de modelos Gemini de Google DeepMind.

El lanzamiento de la API de Gemini 3, anunciado en noviembre de 2025, marcó un hito significativo en la evolución de las ofertas de IA generativa de Google DeepMind. Este lanzamiento proporcionó a los desarrolladores de software acceso a la tercera iteración principal de la familia de modelos de lenguaje grandes Gemini, introduciendo un conjunto de nuevas capacidades, estructuras de precios revisadas y herramientas de integración mejoradas. El lanzamiento se posicionó como una respuesta directa a las crecientes demandas de la comunidad de desarrollo de IA y al panorama competitivo conformado por OpenAI y Anthropic.

La familia de modelos Gemini, que incluye Gemini Pro, Gemini Flash y Gemini Flash Lite, se anunció por primera vez el 6 de diciembre de 2023 como sucesora de LaMDA y PaLM 2. El lanzamiento de la API de Gemini 3 representó la culminación de mejoras iterativas desde el lanzamiento inicial, incorporando comentarios del ecosistema de desarrolladores y avances en la investigación de aprendizaje automático. El evento de noviembre de 2025 fue notable no solo por las especificaciones técnicas del modelo, sino también por las decisiones estratégicas en torno a la accesibilidad y el despliegue comercial.

Antecedentes y Desarrollo

El desarrollo de Gemini 3 comenzó tras el lanzamiento experimental de Gemini 2.0 Flash el 11 de diciembre de 2024, que introdujo características como la API Multimodal Live para interacciones de audio y video en tiempo real. El proyecto Gemini 3 fue liderado por Google DeepMind bajo la dirección del CEO Demis Hassabis, quien había destacado previamente la importancia de combinar las fortalezas de AlphaGo con el procesamiento avanzado del lenguaje. El modelo se entrenó en las unidades de procesamiento tensorial (TPU) personalizadas de Google, continuando la estrategia de infraestructura establecida con versiones anteriores.

A lo largo de 2025, Google DeepMind llevó a cabo extensas pruebas internas, centrándose en mejorar las capacidades de razonamiento del modelo, reducir la latencia y mejorar su capacidad para procesar datos multimodales - texto, imágenes, audio, video y código - simultáneamente. El equipo de desarrollo, que incluía a cientos de ingenieros de las unidades fusionadas de Google Brain y DeepMind, también trabajó en refinar los mecanismos de seguridad del modelo, una prioridad dada el escrutinio regulatorio que rodea a los sistemas de IA generativa.

Características Clave de la API de Gemini 3

La API de Gemini 3 introdujo varias características diseñadas para atraer tanto a desarrolladores empresariales como independientes. Una mejora principal fue la ventana de contexto mejorada, que se amplió para admitir hasta dos millones de tokens, permitiendo el procesamiento de bases de código completas o documentos extensos en una sola solicitud. Esto representó una duplicación de la capacidad disponible en Gemini 1.5, que tenía una ventana de contexto de un millón de tokens.

Otra adición significativa fue la API Multimodal Live mejorada, que permite interacciones de transmisión en tiempo real con entradas de audio y video. Esta característica estaba dirigida particularmente a aplicaciones en servicio al cliente, asistentes virtuales y servicios de traducción en vivo. La API también incluía capacidades nativas de generación de imágenes con marcas de agua integradas, basándose en las características experimentales vistas en Gemini 2.0. Para los desarrolladores, Google introdujo un nuevo conjunto de herramientas para ajustar el modelo en conjuntos de datos personalizados, aprovechando técnicas como RLIAF (aprendizaje por refuerzo a partir de la retroalimentación de la IA) para alinear los resultados con casos de uso específicos.

La API se puso a disposición a través de la plataforma Vertex AI de Google Cloud y AI Studio, con soporte adicional para el despliegue local mediante Anthos de Google. Esta flexibilidad pretendía abordar las preocupaciones de las organizaciones con estrictos requisitos de residencia de datos.

Precios y Modelo Comercial

El lanzamiento de noviembre de 2025 introdujo una estructura de precios revisada que buscaba equilibrar la accesibilidad con la rentabilidad. Google adoptó un modelo escalonado basado en el uso de tokens, con el nivel Gemini 3 Pro con un precio de $0.0025 por cada 1,000 tokens de entrada y $0.0075 por cada 1,000 tokens de salida. El nivel Flash, optimizado para aplicaciones de menor latencia, se fijó en $0.0005 por cada 1,000 tokens de entrada y $0.0015 por cada 1,000 tokens de salida. Además, Google ofreció un nivel gratuito para desarrolladores con límites de uso de 10 solicitudes por minuto, diseñado para fomentar la experimentación y la incorporación.

Un cambio notable fue la introducción de descuentos por volumen para empresas que se comprometieran con contratos anuales, con reducciones de hasta el 40% para un uso que superara los 100 millones de tokens al mes. Esta estrategia de precios se vio como un desafío directo a competidores como GPT-4 Turbo de OpenAI y Claude 3 de Anthropic, que habían dominado el mercado empresarial. Google también introdujo una opción de pago por uso para la API Multimodal Live, cobrando $0.04 por minuto de transmisión de audio y $0.12 por minuto de transmisión de video.

Integración con el Ecosistema de Nube y Hardware

El lanzamiento de la API de Gemini 3 estuvo estrechamente vinculado al ecosistema más amplio de nube y hardware de Google. El modelo se optimizó para ejecutarse en las TPU de sexta generación de Google, que se anunciaron a principios de 2025 y ofrecían una mejora del 30% en la velocidad de inferencia en comparación con generaciones anteriores. Google también se asoció con NVIDIA para garantizar la compatibilidad con sus GPU H200, proporcionando a los desarrolladores flexibilidad para elegir su infraestructura de cómputo.

Para los desarrolladores que usan Amazon Web Services o Azure, Google proporcionó SDK y documentación multiplataforma, aunque la paridad completa de funciones se limitó a Google Cloud. Este enfoque reflejó la estrategia de OpenAI, que había hecho que sus modelos estuvieran disponibles en múltiples proveedores de nube a través de asociaciones. La integración con Google Cloud incluyó conectores preconstruidos para fuentes de datos populares, como BigQuery y Pub/Sub, lo que permite canalizaciones de datos fluidas para aplicaciones de IA.

Panorama Competitivo y Respuesta del Mercado

El lanzamiento de Gemini 3 llegó en un momento de intensa competencia en el mercado de modelos de lenguaje grandes. OpenAI había lanzado GPT-4.5 a principios de 2025, y Anthropic había presentado Claude 3.5, ambos con un sólido rendimiento en los puntos de referencia de la industria. Los analistas de la industria señalaron que el énfasis de Gemini 3 en las capacidades multimodales y el procesamiento de contexto largo era una estrategia de diferenciación deliberada, dirigida a casos de uso que requerían una comprensión integral de los datos.

La respuesta inicial de los desarrolladores fue positiva, con los primeros usuarios elogiando la documentación de la API y la facilidad de integración con los servicios existentes de Google. Sin embargo, algunos desarrolladores expresaron su preocupación por los precios para casos de uso de alto volumen, particularmente en comparación con alternativas de código abierto como LLaMA 3 de Meta. En respuesta, Google enfatizó el costo total de propiedad, citando la eficiencia de las TPU y la menor necesidad de infraestructura adicional.

Seguridad, Ética y Cumplimiento Normativo

En línea con los compromisos de Google tras la orden ejecutiva firmada por el presidente de los Estados Unidos, Joe Biden, en octubre de 2023, la API de Gemini 3 incluía características de seguridad mejoradas. Estas incluían filtrado de contenido automatizado, marcas de agua para imágenes generadas por IA y un nuevo marco de "seguridad por diseño" que permitía a los desarrolladores establecer umbrales de seguridad personalizados para sus aplicaciones. Google también publicó un informe de transparencia que detallaba el rendimiento del modelo en puntos de referencia de equidad y sesgo, un movimiento destinado a generar confianza con los reguladores.

La empresa colaboró con el gobierno del Reino Unido para garantizar el cumplimiento de los principios establecidos en la Cumbre de Seguridad de la IA en Bletchley Park en noviembre de 2023. Además, Google estableció un consejo asesor externo compuesto por académicos de instituciones como Stanford AI Lab y MIT CSAIL para revisar las prácticas de despliegue del modelo.

Impacto en la Comunidad de Desarrolladores y Direcciones Futuras

El lanzamiento de la API de Gemini 3 tuvo un impacto notable en la comunidad de desarrolladores, particularmente en el ámbito del desarrollo de software impulsado por IA. Las avanzadas capacidades de generación de código de la API, combinadas con la ventana de contexto ampliada, la convirtieron en una opción popular para herramientas como alternativas a GitHub Copilot. Google también lanzó una versión actualizada de Gemini CLI, un agente de IA de código abierto introducido en junio de 2025, que aprovechaba la API de Gemini 3 para proporcionar asistencia de codificación basada en terminal con generosos límites de uso gratuito.

De cara al futuro, Google DeepMind indicó que las futuras actualizaciones se centrarían en mejorar las capacidades de razonamiento del modelo y ampliar su soporte multilingüe. La empresa también insinuó planes para integrar Gemini 3 con su investigación en robótica, lo que podría permitir interacciones con el mundo físico, una dirección que Hassabis había mencionado previamente en entrevistas. El lanzamiento de noviembre de 2025 sentó así las bases para una evolución continua en el panorama de la inteligencia artificial, con Google posicionándose como líder en el desarrollo de IA multimodal.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:google-deepmind·api-launch·large-language-model·generative-ai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial