Lançamento do Gemini 1

Traduzido do inglês

O Gemini 1 foi a primeira geração da família de modelos de linguagem multimodal de grande escala do Google DeepMind, anunciada em 6 de dezembro de 2023, sucedendo o LaMDA e o PaLM 2. Introduziu três modelos - Ultra, Pro e Nano - e alimentou o chatbot Gemini, marcando um passo importante na IA generativa.

Gemini 1 é uma família de modelos de linguagem de grande escala multimodais desenvolvida por Google DeepMind, anunciada em 6 de dezembro de 2023, como sucessora de LaMDA e PaLM 2. Comprende três modelos iniciais: Gemini Ultra, projetado para tarefas altamente complexas; Gemini Pro, para uma amplia gama de tarefas; e Gemini Nano, para tarefas no dispositivo. A família alimenta o chatbot Gemini e foi nomeada em referência ao signo zodiacal de Gêmeos, refletindo a fusão de Google Brain e DeepMind. Ao contrário de seus predecessores exclusivamente textuais, Gemini foi treinado para processar simultaneamente texto, imagens, áudio, vídeo e código de computador, posicionando-o como um competidor direto do GPT-4 de OpenAI e de outros sistemas de IA generativa.

O lançamento marcou um momento crucial no desenvolvimento da inteligência artificial, já que Gemini Ultra se tornou o primeiro modelo a superar expertos humanos no teste Massive Multitask Language Understanding (MMLU) de 57 matérias, alcanzando 90%. Google o promocionou como seu "modelo de IA maior e mais capaz", com capacidades que abarcan aprendizado automático, aprendizado profundo e arquitecturas de redes neurais.

Antecedentes do Desenvolvimento

Google anunció pela primeira vez Gemini durante o discurso principal do Google I/O em 10 de maio de 2023, com o CEO Sundar Pichai descrevendo-o como ainda em desenvolvimento inicial. Fue construido como uma colaboração entre DeepMind e Google Brain, que se haviam fusionado sob o guarda-chuva de Google DeepMind. O CEO de DeepMind, Demis Hassabis, destacou em entrevistas que Gemini combinaría capacidades de conversação textual com generación de imágenes impulsada por IA, aproveitando os pontos fortes do programa AlphaGo de DeepMind, que ganó atenção mundial em 2016.

O desenvolvimento envolveu centenas de engenheiros, com o cofundador de Google, Sergey Brin, sendo chamado de volta de sua jubilación para ajudar, sendo posteriormente creditado como "contribuidor principal". O modelo foi treinado em transcripciones de vídeos do YouTube, com advogados filtrando materiais potencialmente protegidos por direitos de autor. Para agosto de 2023, informes indicaban un objetivo de lanzamiento para fin de 2023, con acceso temprano concedido a empresas seleccionadas a través del servicio Vertex AI de Google Cloud.

Lanzamiento y Modelos Iniciales

El 6 de diciembre de 2023, Pichai y Hassabis anunciaron "Gemini 1.0" en una conferencia de prensa virtual. En el lanzamiento, Gemini Pro y Nano se integraron en Bard y el smartphone Pixel 8 Pro, respectivamente, mientras que Gemini Ultra estaba previsto para "Bard Advanced" y disponibilidad para desarrolladores a principios de 2024. El modelo estuvo inicialmente disponible solo en inglés, citando Google la necesidad de "pruebas de seguridad exhaustivas" antes de una liberación más amplia.

Gemini fue entrenado en las Unidades de Procesamiento Tensorial (TPUs) de Google. Se informó que Gemini Ultra superó a GPT-4, Claude 2 de Anthropic, Inflection-2 de Inflection AI, LLaMA 2 de Meta y Grok 1 de xAI en puntos de referencia de la industria, mientras que Gemini Pro superó a GPT-3.5. Gemini Pro estuvo disponible para clientes de Google Cloud en AI Studio y Vertex AI el 13 de diciembre de 2023. De acuerdo con una orden ejecutiva de EE. UU. de octubre de 2023, Google compartió los resultados de las pruebas con el gobierno federal y se comprometió con el gobierno del Reino Unido en los principios de seguridad de IA de la cumbre de Bletchley Park.

Arquitectura Técnica y Capacidades

La arquitectura de Gemini aprovechó modelos transformadores, incorporando mecanismos de atención multi-cabeza y codificación posicional. Su diseño multimodal permitió el procesamiento simultáneo de diversos tipos de datos, una desviación de los LLM exclusivamente textuales. El modelo integró técnicas como aprendizaje por refuerzo a partir de retroalimentación de IA y escalado de temperatura para el control de la salida, con muestreo top-k y muestreo top-p para la diversidad de generación.

El entrenamiento del modelo empleó variantes del optimizador Adam, programas de tasa de aprendizaje y recorte de gradientes para estabilizar los procesos de aprendizaje profundo. Se utilizaron normalización por lotes y abandono para mejorar la generalización, mientras que poda de modelos ayudó a optimizar la eficiencia para la implementación en el dispositivo en Gemini Nano.

Actualizaciones y Expansión

En enero de 2024, Google se asoció con Samsung para integrar Gemini Nano y Pro en la línea de smartphones Galaxy S24. El mes siguiente, Bard y Duet AI se unificaron bajo la marca Gemini, con "Gemini Advanced con Ultra 1.0" lanzado a través de un nuevo nivel "AI Premium" de Google One. Gemini Pro recibió un lanzamiento global.

En febrero de 2024, Google lanzó Gemini 1.5, con una nueva arquitectura, un enfoque de mezcla de expertos y una ventana de contexto de un millón de tokens. El mismo mes, Google presentó Gemma, una gama más pequeña, gratuita y de código abierto de modelos Gemini, descrita como una respuesta a las prácticas de código abierto de Meta. Gemini 1.5 Flash fue anunciado el 14 de mayo de 2024, en el discurso principal de I/O, con planes para integrar Gemini Nano en Google Chrome a través de su arquitectura "Built-in AI". Los modelos actualizados, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, fueron lanzados el 24 de septiembre de 2024.

Impacto y Legado

Gemini 1 estableció a Google DeepMind como una fuerza líder en IA generativa, compitiendo directamente con OpenAI y Anthropic. Su enfoque multimodal influyó en el desarrollo de modelos posteriores en toda la industria, incluidos los esfuerzos de Amazon Web Services y Microsoft Azure en servicios de IA basados en la nube. La integración del modelo en productos de consumo como los smartphones Pixel y los dispositivos Samsung amplió la accesibilidad a la IA, mientras que sus modelos Gemma de código abierto contribuyeron a la comunidad de investigación de IA en general.

El lanzamiento también provocó discusiones regulatorias, con Google comprometiéndose con los gobiernos de EE. UU. y el Reino Unido en pruebas de seguridad. A partir de 2025, Gemini ha evolucionado a través de múltiples versiones, con Gemini 2.0 anunciado en diciembre de 2024, pero Gemini 1 sigue siendo significativo como el lanzamiento fundacional que demostró la viabilidad de los sistemas de IA multimodales a gran escala.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:google-deepmind·large-language-model·generative-ai·ai-release
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico