Gemini 1.5 001 es la primera versión estable de la familia Gemini 1.5 de modelos de lenguaje de gran tamaño desarrollados por Google DeepMind. La familia fue anunciada el 15 de febrero de 2024, y la designación 001 se refiere a las versiones iniciales de API de sus modelos constituyentes. Estos modelos son ejemplos de IA generativa, un subcampo de la inteligencia artificial, que aceptan entradas de texto, imagen, audio y video, y se basan en una arquitectura de transformador con un diseño de mezcla de expertos.
La familia Gemini 1.5 apareció en tablas de clasificación públicas de LLM, incluyendo Chatbot Arena y Artificial Analysis, donde sus variantes fueron comparadas con otros modelos. Las versiones 001 fueron las primeras en estar disponibles para desarrolladores a través de Google AI Studio y la plataforma Vertex AI de Google Cloud.
Antecedentes y lanzamiento
Google DeepMind anunció Gemini 1.5 el 15 de febrero de 2024, como una actualización de los modelos anteriores Gemini 1.0. El lanzamiento inicial incluyó Gemini 1.5 Pro, un modelo insignia, y luego se expandió a Gemini 1.5 Flash, una variante más ligera y rápida optimizada para tareas de alto volumen. El sufijo "001" en los nombres de los modelos, como gemini-1.5-pro-001 y gemini-1.5-flash-001, identifica la primera versión estable de cada modelo en la familia. Estas versiones se pusieron a disposición de desarrolladores y clientes empresariales a través de Google AI Studio y Vertex AI, con precios basados en el uso de tokens.
Arquitectura
Los modelos Gemini 1.5 utilizan una arquitectura basada en transformadores con un diseño de red neuronal de mezcla de expertos, que activa solo un subconjunto de parámetros para cada token, mejorando la eficiencia. Soportan una ventana de contexto de hasta un millón de tokens, lo que permite procesar documentos largos, bases de código y video. Los modelos se entrenan utilizando técnicas de aprendizaje profundo sobre una variedad de tipos de datos y pueden realizar tareas en texto, imágenes, audio y video. La arquitectura incluye atención de múltiples cabezas y codificación posicional, componentes comunes en los modelos de lenguaje de gran tamaño modernos.
Variantes
El lanzamiento 001 incluye tres variantes principales en las instantáneas de referencia públicas:
- Gemini 1.5 Pro: el modelo insignia, diseñado para razonamiento complejo y tareas multimodales.
- Gemini 1.5 Flash: un modelo más rápido y rentable para aplicaciones a gran escala.
- Gemini 1.5 Flash-Lite: una variante ligera introducida posteriormente, optimizada para una latencia y un costo aún menores.
Estas variantes comparten la misma arquitectura subyacente, pero difieren en el número de parámetros y la velocidad de inferencia. Los modelos Flash y Flash-Lite están destinados a casos de uso donde el tiempo de respuesta y el costo son críticos.
Inferencia e implementación
Los desarrolladores pueden acceder a los modelos Gemini 1.5 001 a través de Google AI Studio y Vertex AI. Durante la inferencia, pueden ajustar parámetros de generación como muestreo top-k, muestreo top-p y temperatura para controlar la aleatoriedad de la salida. Los modelos también soportan decodificación determinista mediante búsqueda de haz. Los puntos finales de API están alojados en la infraestructura de Google Cloud, y los modelos soportan respuestas en streaming para aplicaciones de baja latencia.
Rendimiento y recepción
Los modelos Gemini 1.5 001 fueron evaluados en tablas de clasificación públicas como Chatbot Arena y Artificial Analysis, donde compitieron con modelos de OpenAI, Anthropic y otras organizaciones. Los modelos demostraron un rendimiento sólido en razonamiento, codificación y puntos de referencia multimodales, reflejando avances en aprendizaje automático. La ventana de contexto de un millón de tokens fue una característica notable que distinguió a la familia de muchos contemporáneos.
Legado
Las versiones 001 fueron posteriormente sucedidas por versiones actualizadas, incluyendo la serie 002, que mejoró el rendimiento y redujo la latencia. La familia Gemini 1.5 en sí fue seguida por la familia Gemini 2.0 a finales de 2024. A pesar de las actualizaciones, las versiones 001 siguen disponibles para desarrolladores que requieren puntos finales de API estables a largo plazo.