Traducido del inglés

Gemma es una serie de modelos de lenguaje grandes de código disponible desarrollados por Google DeepMind, basados en la tecnología Gemini. Lanzada a partir de febrero de 2024, incluye variantes como PaliGemma y MedGemma, con la última versión de pesos abiertos, Gemma 4, publicada en abril de 2026.

Gemma es una serie de modelos de lenguaje de gran tamaño de código disponible, desarrollados por Google DeepMind. Se basa en tecnologías similares a las de la serie de modelos Gemini y está diseñado para apoyar la misión de Google de 'hacer que la IA sea útil para todos'. La primera versión se lanzó en febrero de 2024, seguida de Gemma 2 en junio de 2024, Gemma 3 en marzo de 2025 y Gemma 4, con pesos abiertos, en abril de 2026. También se han desarrollado variantes de Gemma, como el modelo de visión y lenguaje PaliGemma y el modelo MedGemma para temas de consulta médica.

Historia

En febrero de 2024, Google presentó Gemma, una colección de LLM de código disponible que sirven como una versión ligera de Gemini. El lanzamiento inicial llegó en dos tamaños: redes neuronales con dos y siete mil millones de parámetros, respectivamente. Varias publicaciones consideraron esto como una respuesta a competidores como Meta, que publicaron el código fuente de sus modelos de IA, y un cambio respecto a la práctica de larga data de Google de mantener privado el código fuente de su IA.

Gemma 2 se lanzó el 27 de junio de 2024, y Gemma 3 se lanzó el 12 de marzo de 2025. El 2 de abril de 2026, Google lanzó Gemma 4 bajo la licencia libre y de código abierto Apache 2.0.

Descripción general

Basado en tecnologías similares a las de la serie de modelos Gemini, Google describe a Gemma como un apoyo a su misión de 'hacer que la IA sea útil para todos'. Google ofrece variantes oficiales de Gemma optimizadas para casos de uso específicos, como MedGemma para análisis médico.

Desde su lanzamiento, los modelos Gemma han superado los 150 millones de descargas, con 70,000 variantes disponibles en Hugging Face.

Gemma 3 se ofreció en tamaños de 1, 4, 12 y 27 mil millones de parámetros, con soporte para más de 140 idiomas. Como modelos multimodales, admiten entrada tanto de texto como de imagen. Google también ofrece Gemma 3n, modelos más pequeños optimizados para ejecutarse en dispositivos de consumo como teléfonos inteligentes, portátiles y tabletas.

La generación más reciente de modelos es Gemma 4, lanzada el 2 de abril de 2026. Está disponible en cuatro tamaños: Effective 2B (E2B), Effective 4B (E4B), 26B Mixture of Experts (MoE) y 31B Dense. Gemma 4 admite entrada multimodal, incluidas imágenes y video en todos los modelos, con entrada de audio nativa en los modelos E2B y E4B. La variante 31B Dense de Gemma 4 alcanzó el tercer lugar en la tabla de clasificación de texto de Arena, y la variante de 26B alcanzó el sexto lugar. Gemma 4 12B se lanzó el 3 de junio de 2026 y presenta una arquitectura multimodal unificada que procesa imágenes y audio sin codificadores.

Arquitectura

Gemma 3 se basa en una arquitectura transformer de solo decodificador con atención de consulta agrupada (GQA) y el codificador de visión SigLIP. Cada modelo tiene una longitud de contexto de 128K, con la excepción de Gemma 3 1B, que tiene una longitud de contexto de 32K.

También están disponibles versiones cuantizadas ajustadas mediante entrenamiento consciente de la cuantización (QAT), que ofrecen mejoras considerables en el uso de memoria con cierto impacto negativo en la precisión y exactitud.

Variantes

Google desarrolla variantes oficiales de los modelos Gemma diseñadas para fines específicos, como análisis médico o programación. Estas incluyen:

  • CodeGemma (2B y 7B): CodeGemma es un grupo de modelos diseñados para la finalización de código, así como para el uso general de programación. Admite múltiples lenguajes de programación, incluidos Python, Java, C++ y más.
  • DolphinGemma (aproximadamente 400M): Desarrollado en colaboración con investigadores de Georgia Tech y el Wild Dolphin Project, DolphinGemma tiene como objetivo comprender mejor la comunicación de los delfines mediante el análisis de audio. Sin embargo, no se han publicado públicamente modelos ni datos.
  • MedGemma (4B y 27B): También basado en Gemma 3, MedGemma está diseñado para aplicaciones médicas como el análisis de imágenes. Sin embargo, Google también señala que MedGemma 'aún no tiene nivel clínico'. Desarrolladores de Tap Health en Gurgaon, India, han utilizado MedGemma para mejorar aplicaciones de gestión de la diabetes asistidas por IA.
  • PaliGemma (3B, 10B y 28B, basado en Gemma 2 con 2B, 9B y 27B, respectivamente): Para visión artificial y análisis de imágenes.
  • ShieldGemma 2 (4B): Basado en la familia Gemma 3, ShieldGemma está diseñado para identificar y filtrar imágenes violentas, peligrosas y sexualmente explícitas.
  • TranslateGemma (4B, 12B y 27B): Para traducción automática.

Nota: los modelos de pesos abiertos pueden tener su longitud de contexto reescalada en el momento de la inferencia. Con Gemma 1, Gemma 2, PaliGemma y PaliGemma 2, el costo es un aumento lineal del tamaño de la caché kv en relación con el tamaño de la ventana de contexto. Con Gemma 3, hay una curva de crecimiento mejorada debido a la separación de la atención local y global. Con RecurrentGemma, el uso de memoria no cambia después de 2,048 tokens.

Véase también

  • Lista de modelos de lenguaje de gran tamaño
  • Listas de software de inteligencia artificial de código abierto

Referencias

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-models·google-deepmind·open-source-ai·generative-ai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial