Gemma é uma série de modelos de linguagem de grande porte com código-fonte disponível, desenvolvida pela Google DeepMind. Ela é baseada em tecnologias semelhantes às da série de modelos Gemini e foi projetada para apoiar a missão do Google de 'tornar a IA útil para todos'. A primeira versão foi lançada em fevereiro de 2024, seguida pela Gemma 2 em junho de 2024, pela Gemma 3 em março de 2025 e pela Gemma 4, com pesos abertos, em abril de 2026. Variantes da Gemma também foram desenvolvidas, como o modelo de visão-linguagem PaliGemma e o modelo MedGemma para tópicos de consulta médica.
História
Em fevereiro de 2024, o Google apresentou a Gemma, uma coleção de LLMs com código-fonte disponível que serve como uma versão leve do Gemini. O lançamento inicial veio em dois tamanhos: redes neurais com dois e sete bilhões de parâmetros, respectivamente. Diversas publicações interpretaram isso como uma resposta a concorrentes como a Meta, que liberava o código-fonte de seus modelos de IA, e como uma mudança em relação à prática de longa data do Google de manter seu código-fonte de IA privado.
A Gemma 2 foi lançada em 27 de junho de 2024, e a Gemma 3 foi lançada em 12 de março de 2025. Em 2 de abril de 2026, o Google lançou a Gemma 4 sob a licença livre e de código aberto Apache 2.0.
Visão geral
Baseada em tecnologias semelhantes às da série de modelos Gemini, a Gemma é descrita pelo Google como um apoio à sua missão de 'tornar a IA útil para todos'. O Google oferece variantes oficiais da Gemma otimizadas para casos de uso específicos, como a MedGemma para análise médica.
Desde seu lançamento, os modelos Gemma tiveram mais de 150 milhões de downloads, com 70.000 variantes disponíveis no Hugging Face.
A Gemma 3 foi oferecida em tamanhos de 1, 4, 12 e 27 bilhões de parâmetros, com suporte a mais de 140 idiomas. Como modelos multimodais, eles suportam entrada de texto e imagem. O Google também oferece a Gemma 3n - modelos menores otimizados para execução em dispositivos de consumo, como smartphones, laptops e tablets.
A geração mais recente de modelos é a Gemma 4, lançada em 2 de abril de 2026. Ela está disponível em quatro tamanhos: Effective 2B (E2B), Effective 4B (E4B), 26B Mixture of Experts (MoE) e 31B Dense. A Gemma 4 suporta entrada multimodal, incluindo imagens e vídeo em todos os modelos, com entrada de áudio nativa nos modelos E2B e E4B. A variante 31B Dense da Gemma 4 alcançou o terceiro lugar no ranking de texto da Arena, e a variante 26B alcançou o sexto lugar. A Gemma 4 12B foi lançada em 3 de junho de 2026 e apresenta uma arquitetura multimodal unificada que processa imagens e áudio sem codificadores.
Arquitetura
A Gemma 3 é baseada em uma arquitetura transformer somente de decodificador, com atenção de consulta agrupada (GQA) e o codificador de visão SigLIP. Cada modelo tem um comprimento de contexto de 128K, com exceção da Gemma 3 1B, que tem um comprimento de contexto de 32K.
Versões quantizadas, ajustadas finamente usando treinamento ciente de quantização (QAT), também estão disponíveis, oferecendo melhorias consideráveis no uso de memória com algum impacto negativo na precisão e exatidão.
Variantes
O Google desenvolve variantes oficiais dos modelos Gemma projetadas para fins específicos, como análise médica ou programação. Estas incluem:
- CodeGemma (2B e 7B): A CodeGemma é um grupo de modelos projetados para conclusão de código, bem como para uso geral em codificação. Ela suporta várias linguagens de programação, incluindo Python, Java, C++ e outras.
- DolphinGemma (aproximadamente 400M): Desenvolvida em colaboração com pesquisadores da Georgia Tech e do Wild Dolphin Project, a DolphinGemma visa entender melhor a comunicação dos golfinhos por meio de análise de áudio. No entanto, nenhum modelo ou dado foi divulgado publicamente.
- MedGemma (4B e 27B): Também baseada na Gemma 3, a MedGemma é projetada para aplicações médicas, como análise de imagens. No entanto, o Google também observa que a MedGemma 'ainda não tem nível clínico'. Desenvolvedores da Tap Health em Gurgaon, na Índia, usaram a MedGemma para aprimorar aplicações de gerenciamento de diabetes assistidas por IA.
- PaliGemma (3B, 10B e 28B, baseada na Gemma 2 com 2B, 9B e 27B, respectivamente): Para visão computacional e análise de imagens.
- ShieldGemma 2 (4B): Baseada na família Gemma 3, a ShieldGemma é projetada para identificar e filtrar imagens violentas, perigosas e sexualmente explícitas.
- TranslateGemma (4B, 12B e 27B): Para tradução automática.
Nota: modelos com pesos abertos podem ter seu comprimento de contexto redimensionado no momento da inferência. Com a Gemma 1, Gemma 2, PaliGemma e PaliGemma 2, o custo é um aumento linear do tamanho do cache kv em relação ao tamanho da janela de contexto. Com a Gemma 3, há uma curva de crescimento melhorada devido à separação da atenção local e global. Com a RecurrentGemma, o uso de memória permanece inalterado após 2.048 tokens.
Ver também
- Lista de modelos de linguagem de grande porte
- Listas de software de inteligência artificial de código aberto
Referências
Ligações externas
- Site oficial