O lançamento do Google Gemini Ultra em fevereiro de 2024 marcou a divulgação pública do Gemini Ultra 1.0, o modelo mais grande e capaz da família Gemini de modelos de linguagem grandes multimodais desenvolvidos por Google DeepMind. Este lançamento seguiu o anúncio inicial do Gemini 1.0 em 6 de dezembro de 2023, e tornou o modelo disponível para consumidores através de um novo nível de assinatura, posicionando-o como um competidor direto de outros sistemas de IA avançados como o GPT-4 de OpenAI.
O Gemini Ultra 1.0 foi projetado para tarefas altamente complexas, distinguindo-o dos outros modelos da família Gemini, como Gemini Pro e Gemini Nano. Foi integrado no Bard Advanced, uma versão premium do chatbot de IA do Google, e também foi oferecido através do serviço de assinatura Google One sob o nível "AI Premium". O lançamento representou um passo significativo nos esforços do Google para comercializar sua tecnologia de IA mais avançada e competir no mercado de IA generativa em rápida evolução.
Antecedentes e Desenvolvimento
O desenvolvimento do Gemini começou como uma colaboração entre Google Brain e DeepMind, que se fundiram em abril de 2023 para formar Google DeepMind. Anunciado na keynote do Google I/O em 10 de maio de 2023, Gemini foi posicionado como um sucessor do PaLM 2, com foco na multimodalidade - a capacidade de processar texto, imagens, áudio, vídeo e código de computador simultáneamente. O CEO do Google, Sundar Pichai, e o CEO da DeepMind, Demis Hassabis, lideraram o projeto, com o cofundador Sergey Brin supostamente contribuindo como um "colaborador central".
Durante o desenvolvimento, o Google visava superar modelos existentes como GPT-4 e Claude 2 da Anthropic. O modelo foi treinado nas Unidades de Processamento Tensor (TPUs) do Google e incorporou técnicas do programa AlphaGo da DeepMind. Em agosto de 2023, relatos indicavam que o Google visava um lançamento no final de 2023, e acesso antecipado foi concedido a empresas seleccionadas através do serviço Vertex AI do Google Cloud.
Anuncio e Lançamento Inicial
Em 6 de dezembro de 2023, Pichai e Hassabis anunciaram o Gemini 1.0 numa conferência de prensa virtual. O lançamento incluiu três modelos: Gemini Ultra, projetado para "tarefas altamente complexas"; Gemini Pro, para "uma ampla gama de tarefas"; e Gemini Nano, para "tarefas no dispositivo". No lançamento, Gemini Pro e Nano foram integrados no Bard e no smartphone Pixel 8 Pro, respectivamente, enquanto Gemini Ultra estava previsto para disponibilidade no início de 2024 através do Bard Advanced.
Gemini Ultra foi apresentado como o "modelo de IA maior e mais capaz" do Google e foi o primeiro a superar expertos humanos no teste Massive Multitask Language Understanding (MMLU) de 57 matérias, alcanzando 90%. Também superou GPT-4, Claude 2, Inflection-2, LLaMA 2 e Grok 1 em vários benchmarks. Devido aos extensos requisitos de testes de segurança, o modelo não foi amplamente disponibilizado até o ano seguinte.
O Lançamento de Fevereiro de 2024
Em fevereiro de 2024, o Google lançou o Gemini Ultra 1.0 como parte da experiência "Gemini Advanced", disponível através do nível de assinatura Google One AI Premium. Este lançamento também viu a unificação de Bard e Duet AI sob a marca Gemini, com Bard Advanced tornándose Gemini Advanced. O modelo foi disponibilizado para usuários em inglês, com um custo de assinatura que o posicionava como uma oferta premium.
O lançamento foi acompanhado por uma implementação global de Gemini Pro, expandindo o acesso ao modelo em mais regiões. O Google também começou a integrar Gemini em outros produtos, incluindo Search, Ads, Chrome e Google Workspace, sinalizando uma estratégia mais ampla para incorporar IA em todo seu ecossistema.
Capacidades Técnicas e Arquitectura
O Gemini Ultra 1.0 foi construido sobre uma arquitectura transformer, similar a outros modelos de linguagem grandes, mas com melhorias para processamento multimodal. Podía manejar texto, imagens, áudio, vídeo e código, tornándose versátil para aplicações que vão desde a compreensão de linguagem natural até a generación de código. O modelo foi treinado num conjunto de dados massivo, incluindo transcripciones de vídeos do YouTube, com equipes legales filtrando material protegido por direitos de autor.
Uma característica notável era sua capacidade de generar imágenes contextuales, uma habilidade que o distinguía de modelos somente de texto. Isto foi alcanzado através da integração com generación de imágenes impulsada por IA, permitindo ao modelo criar conteúdo visual baseado em prompts textuais. O modelo também demonstrou um forte desempeño em tarefas de razonamiento e resolución de problemas, aprovechando técnicas de aprendizaje profundo e redes neuronales.
Integración y Alianzas
Después del lanzamiento, Google se asoció con Samsung para integrar Gemini Nano y Pro en la línea de smartphones Galaxy S24 en enero de 2024. Esto marcó un paso significativo en llevar IA avanzada a dispositivos móviles, con procesamiento en el dispositivo para tareas como resumen y traducción.
En el espacio empresarial, Gemini Ultra se puso a disposición de los desarrolladores a través de Vertex AI y AI Studio de Google Cloud, permitiendo a las empresas construir aplicaciones personalizadas. El modelo también se integró en Duet AI de Google para Workspace, mejorando las herramientas de productividad con asistencia impulsada por IA.
Recepción e Impacto
El lanzamiento de Gemini Ultra 1.0 fue recibido con una atención significativa en la comunidad de IA, ya que representó un hito importante en la carrera por capacidades avanzadas de IA. Su rendimiento en benchmarks como MMLU estableció un nuevo estándar, y sus características multimodales fueron vistas como un paso hacia una IA más similar a la humana.
Sin embargo, algunos críticos señalaron que la disponibilidad del modelo era limitada, y el acceso basado en suscripción se consideró una barrera para algunos usuarios. A pesar de esto, el lanzamiento consolidó la posición de Google como líder en inteligencia artificial, compitiendo directamente con OpenAI y otros actores.
Desarrollos Posteriores
En los meses siguientes al lanzamiento, Google continuó iterando sobre la familia Gemini. En febrero de 2024, la compañía introdujo Gemini 1.5, que presentaba una arquitectura de mezcla de expertos y una ventana de contexto más grande de un millón de tokens. Más tarde ese año, Google lanzó versiones actualizadas, Gemini-1.5-Pro-002 y Gemini-1.5-Flash-002, y en diciembre de 2024, anunció Gemini 2.0 Flash Experimental.
Estas actualizaciones demostraron el compromiso de Google con el avance rápido en IA, con cada iteración trayendo mejoras en rendimiento, eficiencia y capacidades. El lanzamiento de Gemini Ultra marcó así el comienzo de una nueva era en las ofertas de IA de Google, estableciendo el escenario para futuras innovaciones en el campo.